Piyasa — Tek hisse opsiyon ekranları
Haftalık türev stratejisi yayını, Russell 1000 endeksinin likit opsiyon piyasasına sahip hisselerinde tek hisse opsiyon fırsatlarını taramaya yönelik ekranlar sunuyor.
GPU (Graphics Processing Unit, grafik işlem birimi), binlerce basit hesap biriminin aynı komutu çok sayıda veri üzerinde eşzamanlı yürüttüğü bir işlemcidir. Grafik için geliştirildi, 2010'lardan bu yana yapay zekâ modellerinin eğitiminde ve çalıştırılmasında başlıca hızlandırıcıdır.
GPU (Graphics Processing Unit, grafik işlem birimi), binlerce basit hesap biriminin aynı komutu çok sayıda veri üzerinde eşzamanlı yürüttüğü bir işlemcidir. Ekran görüntüsü oluşturmak için geliştirildi, 2010'lardan itibaren bilimsel hesaplamada, yapay zekâ modellerinin eğitiminde ve çalıştırılmasında en yaygın hızlandırıcı oldu. Büyük dil modellerinin maliyetini, hızını ve enerji tüketimini büyük ölçüde GPU belirler. Bu yüzden Nvidia, AMD, TSMC, bellek üreticileri ve bulut şirketlerinin gelir ve yatırım planları bu çipe bağlıdır. Dragonomi yazılarında GPU, Nvidia ve AMD bilanço notlarında, bulut şirketlerinin sermaye harcamalarında ve ABD'nin Çin'e çip ihracat kurallarında sık geçer.
| Künye | |
|---|---|
| Açılım | Graphics Processing Unit |
| Türkçe karşılık | Grafik işlem birimi, grafik işlemci |
| Kullanım alanı | Bilgisayar grafiği, yapay zekâ eğitimi ve çıkarımı, bilimsel hesaplama |
| Başlıca üreticiler | Nvidia, AMD, Intel (tasarım), TSMC (üretim), Çin'de Moore Threads, MetaX, Biren |
| Terimi yaygınlaştıran ürün | Nvidia GeForce 256 (Ekim 1999). Terimi Sony 1994'te PlayStation için kullanmıştı |
| Güncel nesil | Nvidia Blackwell (2024) ve Rubin (Ocak 2026'da tam üretimde), AMD Instinct MI355X (Haziran 2025) |
Bir bilgisayarın ana işlemcisi, yani CPU (central processing unit, merkezi işlem birimi), az sayıda güçlü çekirdekten oluşur. Her çekirdek dallanan, sırası önemli ve öngörülmesi zor kodu hızla bitirmek için büyük önbellekler ve karmaşık denetim devreleri taşır. Tasarımın hedefi tek bir işin gecikmesini kısaltmaktır. Türkçede grafik işlemci de denen GPU ters yoldan gider. Denetim devrelerini küçültür, kalan silikona binlerce basit aritmetik birim yerleştirir ve bunları aynı komutu farklı veriler üzerinde çalıştıracak biçimde gruplar. Tek bir işi CPU'dan hızlı bitirmez, ama aynı anda çok sayıda işi bitirerek birim zamanda yapılan toplam hesabı, yani iş hacmini (throughput) büyütür.
Bu tasarım, birbirinden bağımsız çok sayıda küçük parçaya bölünebilen hesaplarda işe yarar. Grafik bunun ilk örneğidir. 4K bir ekranda 3.840 × 2.160 = 8.294.400 piksel vardır ve her pikselin rengi aynı formülle, komşusunu beklemeden hesaplanabilir. Yapay sinir ağları da aynı yapıdadır. Bir sinir ağının hesap yükünün büyük bölümü matris çarpımıdır ve sonuç matrisinin her elemanı bağımsız bir iç çarpımdır. İki adet 4.096 × 4.096 matrisin çarpımı 4.096³ ≈ 68,7 milyar çarpma-toplama, yani yaklaşık 137 milyar kayan noktalı işlem gerektirir. Nvidia'nın H100 veri sayfasındaki değerden hesaplanan hızla kart, 16 bitlik sayılarla saniyede yaklaşık 989 trilyon işlem yapabilir. Bu hızla çarpım kuramsal olarak 0,14 milisaniyede biter.
Bir yapay zekâ sunucusunda CPU işi dağıtır, veriyi hazırlar ve GPU'lara iletir, ağır matris hesabını ise GPU yapar.
Nvidia GPU'larının temel yapı taşı SM'dir (streaming multiprocessor, akış çoklu işlemcisi). Her SM, basit aritmetik birimler olan CUDA çekirdeklerini, yerel belleği ve komut dağıtıcılarını bir arada tutar. İş parçacıkları (thread) 32'lik gruplar hâlinde aynı komutu yürütür. Nvidia bu modele SIMT (single instruction, multiple threads, tek komut çok iş parçacığı) der.
2017'den bu yana SM'lerin içinde bir de Tensor Core bulunur. Tensor Core, küçük matris bloklarını tek adımda çarpıp toplayan özel devredir ve yapay zekâ performansının büyük bölümü buradan gelir. Nvidia'nın 2022 tarihli Hopper mimari belgesine göre tam GH100 kalıbında 144 SM var, satışa çıkan H100 SXM5'te bunların 132'si açık. Kart 16.896 FP32 CUDA çekirdeği ve 528 Tensor Core taşır. Altı HBM yığınından beşi ve 60 MB'lık L2 önbelleğin 50 MB'ı kullanılır. Üreticiler büyük kalıplarda hatalı birimleri kapatıp kalanını satarak üretim verimini yükseltir.
Hesap birimlerini sürekli veriyle beslemek, hesabın kendisi kadar zordur. Veri merkezi GPU'ları bu yüzden HBM (High Bandwidth Memory, yüksek bant genişlikli bellek) kullanır. HBM, üst üste istiflenmiş DRAM (dinamik bellek) yongalarının GPU ile aynı pakete, çipin birkaç milimetre yanına yerleştirilmesidir. Nvidia'nın veri sayfasına göre H100 SXM'in 80 GB'lık HBM3 belleği saniyede 3,35 terabayt (TB/s) veri taşır. Oyun kartları daha ucuz GDDR (graphics DDR) belleği kullanır.
Bellekten sonraki ikinci etken sayı biçimidir. FLOPS (floating-point operations per second), saniyedeki kayan noktalı işlem sayısıdır. Bilimsel hesaplama 64 bitlik (FP64) ya da 32 bitlik (FP32) sayılarla çalışır. Sinir ağları daha düşük hassasiyete dayanabilir. 16 bitlik FP16 ve BF16, 8 bitlik FP8 ve 4 bitlik FP4 biçimlerinde bit sayısı yarıya indikçe işlem hızı kabaca iki katına çıkar, bellek ihtiyacı yarıya iner. Nvidia'nın H100 veri sayfasındaki değerlerden hesaplanan BF16 hızı yaklaşık 989 TFLOPS (saniyede trilyon işlem), FP8 hızı bunun iki katı, yaklaşık 1.979 TFLOPS'tur. Nesiller arasındaki hız artışının önemli bir bölümü daha az bitle hesap yapabilmekten gelir.
Yapay zekâda GPU iki ayrı işte kullanılır. Eğitim (training), bir modelin milyarlarca parametresinin büyük veri kümeleriyle haftalar boyunca ayarlanmasıdır ve on binlerce GPU'nun tek bir iş için birlikte çalışmasını gerektirir. Çıkarım (inference), eğitilmiş modelin kullanıcı isteklerine yanıt üretmesidir. Büyük dil modelleri metni token denen kelime parçaları hâlinde işler. Çıkarımın iki evresi vardır. Prefill, kullanıcının gönderdiği metnin tek seferde işlendiği evredir ve hesap ağırlıklıdır. Decode ise yanıtın token token üretildiği evredir. Her yeni token için modelin ağırlıkları bellekten yeniden okunur, bu yüzden decode hızı büyük ölçüde bellek bant genişliğine bağlıdır. Bu fark, 2025'ten itibaren çıkarıma özel çiplerin ve GPU sürümlerinin çoğalmasının temel nedenidir.
"GPU" kelimesi analiz yazılarında farklı ölçeklerde kullanılır. En altta kalıp (die), yani silikon plakadan kesilen tek çip parçası vardır. Kalıp, HBM yığınlarıyla birlikte bir pakete yerleştirilir. Paket, SXM gibi bir modüle ya da PCIe kartına takılır. Sekiz GPU'lu bir sunucu (Nvidia'nın HGX ve DGX sistemleri) bir üst ölçektir. En üstte raf gelir. Nvidia'nın GB200 NVL72 rafı 36 adet Grace Blackwell Superchip içerir. Her Superchip iki Blackwell GPU'yu ve bir Grace CPU'yu birleştirir, rafta toplam 72 GPU ve 36 CPU bulunur. Blackwell GPU'nun kendisi de iki kalıptan oluşur.
Sayma birimi de değişebilir. Nvidia'nın Mart 2025'teki GTC etkinliğinde kalıpları sayarak "Vera Rubin NVL144" diye duyurduğu raf, Ocak 2026'da GPU paketleri sayılarak "Vera Rubin NVL72" adını aldı. Raf aynıdır, 72 paket ve 144 kalıp içerir. Bir yazıda "GPU adedi" geçtiğinde kalıbın mı, paketin mi, Superchip'in mi sayıldığına bakmak bu yüzden gerekir.
Nvidia, GeForce 256'yı 11 Ekim 1999'da piyasaya sürdü ve "dünyanın ilk GPU'su" diye pazarladı. Terim Nvidia'dan eskidir. Sony 1994'te PlayStation'daki Toshiba tasarımı grafik çipine GPU demişti. Nvidia'nın katkısı terimi yaygınlaştırmak oldu.
2000'lerin başında araştırmacılar GPU'yu grafik dışı hesaplar için kullanmaya başladı. Buna GPGPU (general-purpose computing on GPUs, GPU'da genel amaçlı hesaplama) denir. Yöntem dolambaçlıydı. Sayı dizisi bir doku (texture) olarak yükleniyor, ekrana bir dörtgen çiziliyor, hesap piksel gölgelendirici programıyla yapılıyor ve sonuç piksellerden geri okunuyordu. Buna rağmen SIGGRAPH 2003'te Caltech'ten Bolz ve arkadaşları ile Münih Teknik Üniversitesi'nden Krüger ve Westermann doğrusal cebir problemlerini GPU'da CPU'dan hızlı çözdü.
Kırılma 2006'da geldi. Nvidia 8 Kasım 2006'da G80 kalıbını kullanan GeForce 8800 GTX'i çıkardı. G80, ayrı köşe ve piksel birimleri yerine her işi yapabilen ortak birimler kullanan ilk Nvidia mimarisiydi. Buna birleşik gölgelendirici (unified shader) denir. Kartta 90 nm süreçte üretilmiş yaklaşık 681 milyon transistör, 1,35 GHz'de çalışan 128 akış işlemcisi, 768 MB GDDR3 bellek ve saniyede 86,4 GB bellek bant genişliği vardı. Aynı yıl Nvidia CUDA'yı duyurdu, yazılım geliştirme kiti 15 Şubat 2007'de kamuya açıldı. GPU böylece grafik hilesine gerek kalmadan C benzeri bir dille programlanabilir hâle geldi.
Her deneme tutmadı. Intel'in x86 çekirdeklerinden oluşan Larrabee adlı GPU'sunun erken silikonu rakip kartların kabaca beşte biri kadar performans verdi. Proje 25 Mayıs 2010'da GPU olarak rafa kalktı ve teknoloji Xeon Phi'ye aktarıldı. Genel amaçlı CPU çekirdeklerini çoğaltarak GPU yapma denemesi başarısız oldu.
Yapay zekâ tarafındaki dönüm noktası 2012'dir. Krizhevsky, Sutskever ve Hinton'un NIPS 2012'de yayımladıkları AlexNet ağı, iki adet GTX 580 oyun kartında beş-altı günde eğitildi. Tek kartın 3 GB belleği yetmediği için ağ iki GPU'ya bölündü. AlexNet, ILSVRC-2012 görüntü tanıma yarışmasında %15,3 ilk beş hata oranıyla ikinci en iyi sonucu (%26,2) açık farkla geçti. Derin öğrenmenin GPU üzerindeki yükselişi bu makaleyle başladı.
Sonraki on yılda GPU, grafik kartından veri merkezi ürününe dönüştü. Nvidia 10 Mayıs 2017'de Volta mimarisini ve ilk Tensor Core'ları taşıyan Tesla V100'ü tanıttı. 22 Mart 2022'de tanıtılan Hopper H100 ise 80 milyar transistör, FP8 desteği ve HBM3 bellekle geldi. Hopper belgesine göre veri merkezi H100'ünde yalnızca iki TPC (texture processing cluster, doku işleme kümesi) grafik işi yapabilir. "Grafik işlem birimi" adı bu ürünler için 2022'den itibaren tarihsel bir etikettir. 18 Mart 2024'te iki kalıplı ve 208 milyar transistörlü Blackwell geldi. Nvidia 5 Ocak 2026'da CES fuarında Rubin'in tam üretimde olduğunu açıkladı. Rubin GPU'da 336 milyar transistör ve saniyede 22 TB bellek bant genişliği var. G80'den Rubin'e transistör sayısı yaklaşık 490 kat, bellek bant genişliği yaklaşık 255 kat büyüdü.
GPU'yu tasarlayan şirketle üreten şirket çoğu zaman farklıdır. Nvidia ve AMD fabrikası olmayan (fabless) tasarım şirketleridir, tasarımlarını TSMC üretir. H100 TSMC'nin 4N sürecinde, Blackwell özel 4NP sürecinde, AMD'nin Haziran 2025'te tanıttığı Instinct MI355X ise 3 nm süreçte üretilir. HBM belleği SK hynix, Samsung ve Micron sağlar. GPU kalıbı ile HBM yığınları TSMC'nin CoWoS (Chip on Wafer on Substrate) paketleme hattında bir araya gelir. Hazır paketler sözleşmeli ve markalı sunucu üreticilerinde (ODM ve OEM) sunucuya ve rafa dönüşür. Zincirin ayrıntısı yarı iletken değer zinciri maddesinde anlatılır.
Tasarım tarafında pazar tek şirketin elindedir. Jon Peddie Research'e göre Nvidia'nın masaüstü bilgisayarlara takılan ayrık grafik kartlarındaki (add-in board) payı 2025'in ilk üç çeyreğinde %92 ile %94 arasındaydı. Veri merkezi hızlandırıcılarında tek kaynaklı ve güvenilir bir pay verisi yok, ama gelir büyüklükleri tabloyu gösteriyor. Nvidia'nın 26 Ekim 2025'te biten çeyrekteki veri merkezi geliri 51,2 milyar dolardı. AMD'nin Temmuz-Eylül 2025 veri merkezi geliri, sunucu işlemcilerini de içerdiği hâlde 4,3 milyar dolardı.
Rakipler üç gruptadır. Birincisi AMD'nin Instinct serisidir. İkincisi Google'ın TPU'su ve Amazon'un Trainium'u gibi bulut şirketlerinin kendi çipleridir. Üçüncüsü Çin'deki yerli üreticilerdir, yani Huawei, Cambricon ve Hygon ile GPU tasarlayan Moore Threads, MetaX ve Biren. Intel'in 2022'de çıkan Arc kartları ise tüketici pazarını hedefler.
Tedarik tarafı da yoğunlaşmıştır. TSMC 15 Ocak 2026'daki telekonferansında yapay zekâ hızlandırıcılarının 2025 gelirindeki payının %15-20 aralığının üst yarısında olduğunu söyledi. Şirket bu gelirin 2024-2029 arasında yılda ortalama %55-59 dolayında büyümesini bekliyor. TSMC aynı gün 2026 sermaye harcaması bütçesini 52-56 milyar dolar olarak açıkladı (2025'te 40,9 milyar dolar) ve bunun %10-20'sini ileri paketleme, test ve maske üretimine ayırdı. SK hynix de 29 Ekim 2025'te 2026 HBM tedarik görüşmelerini tamamladığını duyurdu. Bir GPU üreticisi ne kadar sipariş alırsa alsın, sevkiyatı TSMC'nin paketleme kapasitesi ve bellek üreticilerinin HBM kapasitesi sınırlar. Tasarım değişikliği de takvimi kaydırabilir. Nvidia 28 Ağustos 2024'te üretim verimini artırmak için Blackwell GPU maskesini, yani devre desenini silikona aktaran şablonu değiştirdiğini açıkladı ve seri üretime geçiş 2025 mali yılının dördüncü çeyreğine kaydı.
| Ürün | Tanıtım | Bellek | Bant genişliği | Not |
|---|---|---|---|---|
| Nvidia H100 SXM | Mart 2022 | 80 GB HBM3 | 3,35 TB/s | 80 milyar transistör, 700 W |
| Nvidia H200 | Kasım 2023 | 141 GB HBM3e | 4,8 TB/s | H100 ile aynı hesap gücü |
| Nvidia B200 | Mart 2024 | 180 GB HBM3e (kullanılabilir) | 8 TB/s | 208 milyar transistör, iki kalıp |
| Nvidia Rubin | Ocak 2026 | 288 GB HBM4 | 22 TB/s | 336 milyar transistör, ürünler 2026 ikinci yarı |
| AMD MI300X | Aralık 2023 | 192 GB HBM3 | 5,3 TB/s | 153 milyar transistör, 750 W |
| AMD MI355X | Haziran 2025 | 288 GB HBM3E | 8 TB/s | 185 milyar transistör, 1.400 W |
| Google Ironwood (TPU v7) | Nisan 2025 | 192 GB HBM | 7,37 TB/s | 9.216 çiplik süperpod |
| AWS Trainium3 | Aralık 2025 | 144 GB HBM3e | 4,9 TB/s | AWS'nin ilk 3 nm çipi |
Tablodaki değerler Nvidia, AMD, Google ve AWS'nin 2022-2026 arasındaki veri sayfalarından ve duyurularından alınmıştır. Bellek kapasitesi, bir modelin kaç GPU'ya bölünmeden sığabileceğini belirler. Bant genişliği, yanıt üretme hızının üst sınırını çizer. Güç tüketimi ise veri merkezinin elektrik ve soğutma altyapısını belirler.
Tablo, nesiller arası yarışın bellekte yaşandığını da gösterir. H200, H100 ile aynı Hopper hesap gücünü taşır ama belleği 80 GB'tan 141 GB'a, bant genişliği 3,35 TB/s'den 4,8 TB/s'ye çıkar. H100'den Rubin'e bant genişliği 6,6 kat (22 ÷ 3,35), bellek kapasitesi 3,6 kat (288 ÷ 80) arttı.
Üretici sayfalarındaki hesap gücü rakamları iki tuzak barındırır. Birincisi seyrekliktir (sparsity). Nvidia'nın Tensor Core'ları, her dört değerden ikisi sıfır olan matrisleri iki kat hızlı işleyebilir ve şirketin H100 sayfasındaki bütün Tensor değerleri bu modla verilir. Sayfadaki 1.979 TFLOPS'luk BF16 değerinin yoğun (dense) karşılığı yaklaşık 989 TFLOPS'tur. GB200 NVL72 rafının NVFP4 (Nvidia'nın 4 bitlik sayı biçimi) değeri de seyrek hesapla 1.440, yoğun hesapla 720 PFLOPS'tur (saniyede katrilyon işlem).
İkincisi hassasiyet ve senaryodur. Nvidia'nın 18 Mart 2024'te açıkladığı "büyük dil modeli çıkarımında 30 kata kadar" iddiası, GB200 NVL72 rafının aynı sayıda H100'le karşılaştırmasıdır. Blackwell FP4 ile, H100 ise en düşük FP8 ile çalışır ve bu hassasiyet farkı tek başına kabaca iki kat kazanç getirir. Rubin'in 50 PFLOPS'luk NVFP4 çıkarım değeri de Nvidia'nın Transformer Engine teknolojisiyle hesaplanır, aynı çipin yoğun eğitim değeri 35 PFLOPS'tur. Nvidia'nın Rubin için açıkladığı "Blackwell'e göre 10 kata kadar düşük çıkarım token maliyeti" de belirli senaryolara ait bir üretici beyanıdır. 9 Eylül 2025'teki Rubin CPX duyurusunda yer alan "100 milyon dolarlık yatırıma 5 milyar dolar token geliri" hesabı aynı türdendir.
Öbür uçta FP64 geri plana itiliyor. AMD'nin Haziran 2025 verilerine göre MI355X'in FP64 hızı 78,6 TFLOPS'tur. Nvidia'nın ürün sayfalarına göre bu değer H100 SXM'de 34 TFLOPS'tur. Sekiz GPU'lu HGX B200 sisteminde toplam 296 TFLOPS, yani GPU başına 37 TFLOPS verilir. Sekiz Blackwell Ultra GPU'lu HGX B300'de ise toplam değer 10 TFLOPS'a düşer. İklim ve fizik simülasyonu yapan alıcılar için bu düşüş, GPU'nun genel amaçlı olma iddiasını zayıflatır.
Roofline (çatı çizgisi) modeli, bir işin hesap gücüyle mi yoksa bellek hızıyla mı sınırlandığını gösterir. Tepe hesap gücü bant genişliğine bölünür. Nvidia'nın veri sayfasındaki değerlerle H100 SXM için bu oran 989,5 TFLOPS ÷ 3,35 TB/s ≈ 295 işlem/bayttır. Bellekten okunan her bayt için 295'ten az işlem yapan bir iş, hesap birimlerini boşta bekletir.
Decode bu sınırın çok altında kalır. Tek kullanıcıya yanıt üretirken BF16'daki her 2 baytlık parametre bir çarpma-toplama, yani 2 işlem görür. Bu, bayt başına yaklaşık 1 işlem demektir ve H100 tepe hesap gücünün yaklaşık %0,3'ünü (1 ÷ 295) kullanabilir. İstekleri toplu işlemek (batching) oranı yükseltir, ama hesap gücüne yaslanmak için yüzlerce isteğin birlikte işlenmesi gerekir. H200'ün ve Rubin'in bant genişliğini büyütmesi bu yüzdendir. Nvidia'nın 9 Eylül 2025'te duyurduğu ve 2026 sonunda çıkması planlanan Rubin CPX ters yönde bir ayrışmadır. Hesap ağırlıklı prefill için tasarlanan çip, HBM yerine 128 GB GDDR7 kullanır ve 30 PFLOPS NVFP4 hesap gücü sunar.
Eğitimde de tepe değere yaklaşılamaz. Meta'nın Temmuz 2024'te yayımladığı Llama 3 makalesine göre 405 milyar parametreli model en fazla 16 bin H100 üzerinde, toplam 3,8 × 10²⁵ işlemle eğitildi. MFU (model FLOPS utilization, model hesap kullanım oranı), yani faydalı hesabın tepe değere oranı %38 ile %43 arasında kaldı. Satın alınan tepe hesap gücünün yarısından fazlası kullanılamadı. Aynı makalede paylaşılan 54 günlük dönemde eğitim 466 kez kesildi, bunların 419'u plansızdı. Bu, günde yaklaşık sekiz plansız kesinti eder (419 ÷ 54 ≈ 7,8). Plansız kesintilerin yaklaşık %78'i donanımla ilgiliydi. Makaledeki tabloya göre 148'i arızalı GPU'dan, 72'si HBM3 bellekten kaynaklandı. Meta etkin eğitim süresini yine de %90'ın üzerinde tuttu. On binlerce GPU'lu bir kümede arıza günlük işletme koşuludur.
Güç her nesilde artıyor. Nvidia'nın sekiz GPU'lu DGX B200 sistemi en fazla yaklaşık 14,3 kW harcar, bu da işlemci ve ağ dahil GPU başına yaklaşık 1,8 kW eder. GB200 NVL72 sıvı soğutmalıdır, Vera Rubin rafları ise 45 °C'lik sıcak suyla soğutulacak. Morgan Stanley'nin görüşünü özetleyen Vera Rubin soğutma yazısı, yeni çiplerin Blackwell'in iki katı güç çekeceğini, megavat başına soğutma ekipmanı ihtiyacının ise düşeceğini anlatır.
Tek GPU'ya sığmayan modellerde hesap birden çok GPU'ya bölünür ve GPU'lar arası bağlantı hızı yeni sınır olur. Nvidia aynı raftaki GPU'ları kendi NVLink bağlantısıyla tek bir büyük işlemci gibi çalıştırır. Şirketin ürün sayfalarına göre NVLink hızı H100'de GPU başına saniyede 900 GB, Blackwell'de 1,8 TB'tır ve 72 GPU'lu GB200 NVL72 rafında toplam 130 TB/s eder. Ocak 2026'da tanıtılan NVLink 6, Rubin'de GPU başına 3,6 TB/s ve Vera Rubin NVL72 rafında toplam 260 TB/s sunar.
Yapay zekâ hızlandırıcısı (AI accelerator), sinir ağı hesaplarını genel amaçlı işlemciden çok daha hızlı ve verimli yapan çiplerin ortak adıdır. GPU bu ailenin en programlanabilir üyesidir. Öbür uçta ASIC (application-specific integrated circuit, uygulamaya özgü tümleşik devre) durur. ASIC tek bir iş yüküne göre tasarlanır ve aynı işi daha az enerjiyle yapar, karşılığında esneklikten vazgeçer. Google'ın TPU'su (tensor processing unit) ve Amazon'un Trainium'u bu gruptadır. Huawei'nin NPU'su (neural processing unit, sinir ağı işlem birimi) ve Groq'un LPU'su (language processing unit) başka yollardır.
ASIC yolunun en başarılı örneği TPU'dur. Jouppi ve arkadaşlarının 2017 tarihli ISCA makalesine göre ilk TPU 2015'ten beri Google veri merkezlerinde çalışıyordu ve tasarımdan devreye almaya 15 ayda hazırlandı. Güncel nesil Ironwood (TPU v7), Google'ın Nisan 2025 duyurusuna göre çip başına 4.614 TFLOPS FP8 hız sunar ve 9.216 çiplik bir süperpod 42,5 exaflops'a ulaşır. Dragonomi'nin aktardığı SemiAnalysis değerlendirmesine göre Google'ın Gemini 3 modeli tamamen TPU'larda eğitildi. Anthropic 23 Ekim 2025'te Google Cloud'dan bir milyona kadar TPU'ya erişim için on milyarlarca dolarlık anlaşma yaptı.
Broadcom, Google'ın TPU'su başta olmak üzere özel hızlandırıcıların tasarım ortağıdır ve bu çiplere XPU der. Şirket 11 Aralık 2025'te 2026 mali yılının ilk çeyreği için 8,2 milyar dolar yapay zekâ yarı iletken geliri öngördü, bu yıllık bazda iki kat demektir. Kalem özel hızlandırıcılarla ağ anahtarlarını birlikte içerir. Dragonomi'nin telekonferans notuna göre Broadcom'un 73 milyar dolarlık yapay zekâ sipariş birikiminin 53 milyar doları özel hızlandırıcılardan oluşuyor. Google TPU yazısında Meta'nın 2027'den itibaren kendi veri merkezlerinde TPU kullanmak için milyarlarca dolar harcamaya niyetli olduğu yazar. Aynı yazıda Morgan Stanley'nin aktardığı analist beklentisi, Nvidia'nın 2027'de yaklaşık 8 milyon GPU sevk etmesidir. Özel çipler GPU'yu ortadan kaldırmıyor, alıcıların pazarlık gücünü artırıyor. Anthropic TPU, Trainium ve Nvidia GPU'larını birlikte kullanıyor.
GPU ailesi de kendi içinde ayrışıyor. Grafik devrelerinin küçülmesi, Tensor Core'ların büyümesi ve FP64'ün geri plana itilmesi, veri merkezi GPU'sunun her nesilde ASIC'e biraz daha benzediğini gösterir. Nvidia 24 Aralık 2025'te HBM yerine çip içi SRAM (statik bellek) kullanan LPU'nun geliştiricisi Groq ile münhasır olmayan bir lisans anlaşması yaptı. CNBC tutarı yaklaşık 20 milyar dolar olarak aktardı, şirketler doğrulamadı. LPU yazısında geçen "beş kat düşük maliyet" gibi rakamlar bağımsız olarak doğrulanmamış iddialardır.
CUDA (Compute Unified Device Architecture), Nvidia GPU'larını programlamak için kullanılan platformdur. Programlama modeli, C++ uzantıları, derleyici, sürücü ve yüzlerce kitaplıktan oluşur. Kökeni Ian Buck'ın Stanford'da geliştirdiği Brook dilidir, Buck 2004'te Nvidia'ya katıldı ve John Nickolls ile birlikte çalıştı.
CUDA'nın gücü dilden çok kitaplıklardadır. Derin öğrenme için cuDNN, GPU'lar arası iletişim için NCCL, çıkarım için TensorRT gibi kitaplıklar modellerin Nvidia donanımında hızlı çalışmasını sağlar ve PyTorch gibi çerçeveler bunların üzerine kurulur. Nvidia Eylül 2025'te 6 milyondan fazla geliştirici ve yaklaşık 6.000 CUDA uygulaması bulunduğunu açıkladı. Bağımlılığın hukuki boyutu da var. CUDA lisans sözleşmesinin (EULA) 1.2 maddesi, SDK ile üretilen çıktının Nvidia dışı bir platformu hedeflemek üzere çevrilmesi amacıyla tersine mühendislikten geçirilmesini yasaklar. ZLUDA gibi CUDA programlarını başka GPU'larda çalıştırmayı amaçlayan çeviri katmanları bu maddeyle çelişme riski taşır. Nvidia finans direktörü Colette Kress 19 Kasım 2025 telekonferansında CUDA'sız hızlandırıcıların çoğunun birkaç yılda eskidiğini söyledi.
ROCm, AMD'nin açık kaynak GPU yazılım yığınıdır. İlk sürümü 14 Kasım 2016'da çıktı ve GPU donanım yazılımı dışında MIT lisansıyla dağıtılır. Programlama katmanı HIP, CUDA'ya çok benzeyen bir C++ arayüzüdür. HIPIFY aracı CUDA kaynak kodunu HIP'e çevirir. ROCm'un zayıf yanı uzun süre kapsam oldu. Yığın öncelikle Instinct ve Radeon Pro kartlarını hedefler, tüketici kartlarında destek kısmidir. CUDA ise 2006'daki G80'den bu yana GeForce kartlarında da çalışır. Bu fark, öğrencilerin ve bağımsız geliştiricilerin hangi platformla başladığını etkiler.
AMD, 16 Eylül 2025'te çıkan ROCm 7.0 için ROCm 6'ya göre üç popüler modelde ortalama 3,5 kat, en yüksek 3,8 kat çıkarım kazancı açıkladı. AMD CEO'su Lisa Su 4 Kasım 2025 telekonferansında aynı tabana göre çıkarımda 4,6 kata kadar, eğitimde 3 kat artıştan söz etti. İlki ortalama, ikincisi tepe değerdir. Aynı donanımda salt yazılımla bu kadar kazanç elde edilmesi, önceki sürümün ne kadar geride kaldığını da gösterir.
Rekabetin asıl alanı çerçeve katmanıdır. 15 Mart 2023'te çıkan PyTorch 2.0, aynı model kodunun farklı donanımlara çevrilmesini kolaylaştıran derleyici tabanlı bir yürütme katmanı (TorchDynamo) getirdi. Model PyTorch'ta yazıldığında donanım değiştirmenin maliyeti düşer, en hızlı çekirdek kodlar ise hâlâ donanıma özgüdür.
Nvidia'nın 19 Kasım 2025'te açıkladığı 2026 mali yılı üçüncü çeyrek sonuçlarında gelir yıllık bazda %62 artışla 57,0 milyar dolar oldu. Veri merkezi 51,2 milyar dolar, oyun 4,3 milyar dolar getirdi. GAAP brüt marj %73,4, GAAP dışı brüt marj %73,6'ydı. Şirket dördüncü çeyrek için 65,0 milyar dolar (±%2) gelir rehberliği verdi. GPU'yu oyun kartıyla yaygınlaştıran şirkette oyunun payı yaklaşık %7,5'e indi (4,3 ÷ 57,0). Veri merkezi geliri de GPU satışıyla eş anlamlı değildir. Finans direktörü Colette Kress'in sonuçlarla birlikte yayımlanan yorumuna göre bunun 43,0 milyar doları hesaplama (yıllık +%56), 8,2 milyar doları ağ (yıllık +%162) ürünlerinden geldi. Yaklaşık %16'lık pay, GPU'ları birbirine bağlayan NVLink, InfiniBand ve Ethernet ürünlerine aittir.
Nvidia'nın SEC'e sunduğu çeyreklik 10-Q formuna göre aynı çeyrekte dört doğrudan müşteri gelirin %22, %15, %13 ve %11'ini, toplamda %61'ini oluşturdu. Doğrudan müşteri kavramı kart ve sunucu üreticilerini (ODM ve OEM), distribütörleri, bulut sağlayıcılarını ve sistem entegratörlerini kapsar. "Müşteri A" bir bulut şirketi için raf üreten bir sunucu üreticisi olabilir. Kress 19 Kasım 2025 telekonferansında Blackwell ve Rubin için 2025 başından 2026 sonuna kadar "yarım trilyon dolar" gelir görünürlüğünü yineledi ve ilk 150 milyar doların sevk edildiğini söyledi. Görünürlük bağlayıcı sipariş defteri değil, şirket öngörüsüdür. 26 Ekim 2025 itibarıyla stoklar bir çeyrekte 15,0 milyar dolardan 19,8 milyar dolara çıktı (%32), tedarik ve kapasite taahhütleri 50,3 milyar dolara ulaştı. Ticari alacaklar Ocak 2025'e göre yaklaşık %45 artışla 33,4 milyar dolar oldu.
Son alıcı tarafında talep birkaç bulut şirketinde toplanır. Amazon, Eylül 2025'te biten 12 ayda 120,1 milyar dolarlık maddi duran varlık aldı ve 3,8 GW güç kapasitesi ekledi. Anlaşmalar da 2025'ten itibaren gigavatla (GW) duyuruluyor. Dragonomi'nin ikinci çeyrek telekonferans notuna göre Jensen Huang 27 Ağustos 2025'te gigavat ölçeğindeki bir yapay zekâ tesisinin 50-60 milyar dolara mal olduğunu ve Nvidia'nın bundan yaklaşık %35 pay aldığını söyledi. Bu ölçüyle 10 GW'lık bir anlaşma 500-600 milyar dolar toplam yatırım, Nvidia için 175-210 milyar dolar gelir demektir (500 × 0,35 ve 600 × 0,35). DGX B200'deki GPU başına yaklaşık 1,8 kW'lık sistem gücüyle 1 GW, soğutma payı sayılmazsa en fazla yaklaşık 550 bin GPU'ya yeter (1.000.000 kW ÷ 1,8 kW). Nvidia'nın GW başına 17,5-21 milyar dolarlık payı bu kaba hesapla GPU başına 32-38 bin dolar eder. Huang da 19 Mart 2024'te CNBC'ye Blackwell'in tanesinin 30-40 bin dolar olacağını söylemişti.
2025'te satıcı ile alıcı arasındaki para akışı çift yönlü hâle geldi. Nvidia 22 Eylül 2025'te OpenAI ile en az 10 GW'lık sistem için niyet mektubu imzaladı ve her gigavat devreye girdikçe OpenAI'a toplam 100 milyar dolara kadar yatırım yapmayı amaçladığını açıkladı. 10-Q'ya göre Nvidia 26 milyar dolarlık çok yıllı bulut hizmeti sözleşmeleriyle kendi GPU'ları üzerinden kapasite de satın alıyor. Tom's Hardware'ın 5 Eylül 2025'te aktardığına göre şirket, bulut sağlayıcısı Lambda'dan 18 bin GPU'yu dört yıllığına toplam 1,5 milyar dolara geri kiraladı. Tutar dört yıla eşit yayılırsa GPU-saat başına yaklaşık 2,4 dolar eder (1,5 milyar ÷ 18.000 ÷ 35.040 saat). AMD 6 Ekim 2025'te OpenAI ile 6 GW'lık anlaşma yaptı ve OpenAI'a alım hacmine ve kilometre taşlarına bağlı olarak 160 milyon hisseye kadar alım hakkı (warrant) verdi. Alıcının satıcıdan hisse opsiyonu alması ekonomik olarak fiyat indirimi gibi çalışır. Bu yapılar, talebin bir bölümünün satıcının kendi parasıyla finanse edildiği eleştirisine yol açtı. Dragonomi'nin telekonferans notuna göre Jensen Huang ise müşteri finansmanı konusunda endişe olmadığını, bu yatırımların CUDA ekosistemini genişlettiğini söyledi.
Zincirin en kaldıraçlı halkası, GPU'yu satın alıp saatlik kiralayan yeni nesil bulut şirketleridir (neocloud). CoreWeave'in 2025 üçüncü çeyreğinde gelir %134 artışla yaklaşık 1,36 milyar dolara, sipariş birikimi 55,6 milyar dolara çıktı. Düzeltilmiş faaliyet kârı 217,2 milyon dolardı, ama net faiz gideri 310,6 milyon dolara ulaştı ve çeyrek 110,1 milyon dolar net zararla kapandı. Toplam borç yaklaşık 14,0 milyar dolardı ve şirketin 10-Q formunda adı verilmeyen "Müşteri A" çeyrek gelirinin %67'sini oluşturdu.
İlk tuzak sermaye harcamasının tanımıdır. Microsoft'un Temmuz-Eylül 2025 çeyreğinde yönetimin açıkladığı sermaye harcaması 34,9 milyar dolardı. Bunun 11,1 milyar doları finansal kiralamaydı ve harcamanın yaklaşık yarısı GPU ve CPU gibi kısa ömürlü varlıklara gitti. Nakit akış tablosundaki maddi duran varlık ödemesi ise 19,4 milyar dolardı. Kiralamayla edinilen varlıklar bu nakit kalemine girmediği için, faaliyet nakit akışından nakit yatırım harcaması düşülerek bulunan serbest nakit akışı da yatırımın tamamını yansıtmaz.
İkinci tuzak faydalı ömürdür. Sunucunun maliyeti tahmini kullanım süresine bölünerek amortisman gideri yazılır, ömür uzarsa gider düşer ve kâr artar. Microsoft Temmuz 2022'de sunucu ömrünü 4'ten 6 yıla uzattı ve bu 2023 mali yılı faaliyet kârına 3,7 milyar dolar ekledi. Alphabet 2023'te aynı değişikliği yaptı ve amortisman giderini 3,9 milyar dolar azalttı. Meta Ocak 2025'te ömrü 5'ten 5,5 yıla çıkardı ve 2025 amortismanında yaklaşık 2,9 milyar dolar azalma bekledi. Amazon sunucu ömrünü 2022'de 4'ten 5'e, 2024'te 5'ten 6 yıla çıkardı, 2024'teki değişiklik amortismanı 3,2 milyar dolar düşürdü. Şirket 1 Ocak 2025'ten itibaren ise sunucularının bir alt kümesinde ömrü yeniden 5 yıla indirdi ve bunun 2025 faaliyet kârını yaklaşık 0,7 milyar dolar azaltmasını bekledi. Bu geri adım, uzatma eğiliminin yapay zekâ donanımında tersine dönebileceğini gösterdi.
Yatırımcı Michael Burry 10 Kasım 2025'te bu uzatmaların kazançları yapay olarak şişirdiğini yazdı. Burry'nin hesabına göre büyük bulut şirketleri 2026-2028'de yaklaşık 176 milyar dolar amortismanı eksik yazacak. Nvidia, Kasım 2025'in son haftasında analistlere gönderdiği ve CNBC'nin 25 Kasım'da haberleştirdiği notta müşterilerinin GPU'ları 4-6 yılda amortismana tabi tuttuğunu ve 2020'de çıkan A100'lerin hâlâ yüksek kullanımda olduğunu savundu. Morgan Stanley'nin altyapı değerlendirmesini özetleyen altyapı darboğazı yazısı ise modern GPU'ların 3-4 yılda ekonomik olarak eskidiğini yazar. Tartışmada üç kavram karışıyor. Muhasebe ömrü amortisman tablosundaki süredir. Teknik ömür çipin çalıştığı süredir. Ekonomik ömür ise çipin elektrik, soğutma ve alan maliyetini karşılayacak kadar gelir ürettiği süredir ve GPU-saat kira fiyatıyla izlenir. Nvidia'nın argümanı teknik ömre ve 2025'teki kıtlığa dayanır. Burry'nin eleştirisi ise ekonomik ömrün muhasebe ömründen kısa olduğu varsayımına dayanır.
Üçüncü tuzak segment adlarıdır. ABD Menkul Kıymetler ve Borsa Komisyonu (SEC), 6 Mayıs 2022'de Nvidia'ya 5,5 milyon dolar ceza kesti. Şirket, 2018 mali yılında oyun GPU satışlarındaki artışın önemli bölümünün kripto madenciliğinden geldiğini yatırımcılara yeterince açıklamamıştı. Oyun geliri diye raporlanan kalemin içinde başka bir döngüye ait talep vardı.
Maliyet rakamlarının kapsamı da yanlış okunabilir. DeepSeek, Aralık 2024'teki V3 teknik belgesinde modeli 2.048 adet Nvidia H800 (H100'ün Çin'e özel sürümü) üzerinde yaklaşık 2,8 milyon GPU-saatle eğittiğini yazdı. Saat başı 2 dolar varsayımıyla bu yaklaşık 5,6 milyon dolar ediyordu. R1 modelinin 20 Ocak 2025'teki çıkışından sonra Nvidia hissesi 27 Ocak 2025'te yaklaşık %17 düştü ve yaklaşık 590 milyar dolar piyasa değeri kaybetti. Oysa aynı belge rakamın önceki araştırmaları, mimari, algoritma ve veri denemelerini içermediğini açıkça yazıyordu. Tutar son eğitim koşusunun GPU kira bedeliydi.