Nvidia’nın yeni Vera Rubin platformu, bu yıl içinde piyasaya sunulacak ve yapay zeka dünyasında önümüzdeki dönemin beliren taleplerine yanıt vermeye hazırlanıyor. Özellikle büyük ölçekli AI çıkarımlarının gerektirdiği yüksek performans ve düşük maliyet tartışmaları, bu yeni sistemin önemini artırıyor. Üretken iş akışlarında generate edilen tokenların hızlı ve verimli bir şekilde işlenmesi, günümüz veri merkezlerinin en büyük talepleri arasında.
Performans Testleri
Vera CPU’nun agentic AI iş yüklerini hızlandırmasına dair derinlemesine veriler sunulmakla birlikte, Nvidia bu yeniliklerle birlikte Rubin mimarisinin nasıl daha etkili çalıştığını da detaylandırıyor. Özellikle GPU düzeyinden veri merkezi ölçeğine kadar çıkarsama verimliliğini artırmayı hedefliyor.
Teknik Özellikler
- GPU Yapısı: Vera Rubin NVL72 rack-scale sistemi, 36 Vera CPU ve 72 Rubin GPU’dan oluşuyor.
- İşlemci Mimarisi: Rubin, Nvidia Yüksek Bant Genişliği Arayüzü kullanarak iki işlemci çipini tek bir paket içinde birleştiriyor. Bu yapı, 224 Streaming Multiprocessor (SM) ve toplamda 896 Tensor Core’a sahip oluyor. Ayrıca, 288 GB HBM4 bellek ile 22 TB/s bellek bant genişliği sunuyor.
Yüksek Performans
Nvidia, Rubin’in NVFP4 çıkarım hızı ile 50 sparse PFLOPS döngüsel işlem kapasitesine ulaştığını vurguluyor. Ancak bu, sadece bu çipin işleyebileceği veri türlerinden biridir. Aşağıda, bu çipin bazı anahtar oranlarını sıraladık:
- NVFP4 Çıkarım: 50 PFLOPS (sparsity ile)
- NVFP4 Eğitim: 35 PFLOPS
- FP8/FP6 Eğitim: 17.5 PFLOPS
- INT8: 250 TOPS
- FP32: 130 TFLOPS
Soğutma Çözümleri
NVIDIA’nın TMA (Tensor Memory Accelerator) ile yapılan iyileştirmeler, Tensor Cores ile veri akışını yönetmeyi hedefliyor. MoE (Mixture of Experts) mimarisi ile GPU’lar arası bataryalarda etkin kullanım sağlanabiliyor. Bu sistem, günümüzün en iyi AI modellerinin gereksinimlerine cevap veriyor.
Tensor Core Çıktısındaki Gelişmeler
Rubin, Tensor Core üzerindeki K-boyutunda yapılan iyileştirme ile matris çarpımlarında biriken iş yükünü iki katına çıkarıyor. Bu, FP32 ve BF16 veri türleri üzerinde hesaplama hızlarını önemli ölçüde artırıyor. Örneğin, bir hesaplama sonucunu elde etmek için Blackwell üzerinde gerekli olan döngü sayısı Rubin ile yarıya iniyor.
Inter-GPU İletişim Verimliliği
Rubin’in NVLink ağı ile GPU’lar arasında veri aktarımı ve senkronizasyon mesajları daha verimli bir hale geliyor. Bununla birlikte, CUDA çekirdekleri diğer GPU’larla doğrudan iletişim kurarak, iletişim ve senkronizasyon ağ trafiğini önemli ölçüde azaltıyor.
Sonuç olarak, Vera CPU’nun yüksek tek iş parçacığı performansı ve Rubin GPU’daki iyileştirmeler, veri merkezi ölçeğinde yüksek performans ve düşük maliyetli çıkarım işlemleri sağlamayı vaat ediyor. Nvidia’nın hayalindeki bu yeni çağ için geliştirilen sistemlerin bu sonbaharda teslim edilmeye başlanması bekleniyor.
Kaynak: Tom’s Hardware verileriyle derlenmiştir.


