Evde kurulan çok düğümlü yapay zekâ sistemleri, kapalı veriyi dışarı çıkarmadan yüksek performanslı çıkarım çalıştırmak isteyenler için giderek daha ilgi çekici hale geliyor. Son örneklerden birinde, dört adet NVIDIA DGX Spark biriminden oluşan kompakt bir küme, DeepSeek V4.1-Flash modelini yerelde çalıştırarak dikkat çekici hız değerleri ortaya koydu.
Kurulumun merkezinde 4x NVIDIA DGX Spark yer alıyor. Toplamda yaklaşık 512 GB birleşik bellek sunan bu yapı, ek fanlarla desteklenen kompakt bir rafa yerleştirilmiş. Her DGX Spark sisteminde 20 çekirdekli bir Arm işlemci bulunuyor; bu yapı 10 adet performans odaklı Cortex-X925 ve 10 adet verimlilik odaklı Cortex-A725 çekirdeğinden oluşuyor. Her çekirdeğin özel L2 önbelleği bulunurken, küme başına 16 MB olmak üzere toplam 32 MB L3 önbellek yer alıyor.
Grafik ve yapay zekâ tarafında ise GB10 iGPU görev yapıyor. Birim, beşinci nesil Tensor Core’lar, DLSS 4 desteği ve RTX Ray Tracing çekirdekleriyle geliyor. NVIDIA’nın verdiği değerlere göre sistem, FP32 tarafında 31 TFLOPs’a kadar, yapay zekâ iş yüklerinde ise NVFP4 yani FP4 formatında 1000 TOPS’a kadar hesaplama gücü sunabiliyor. Bellek tarafında her bir ünitede CPU ve GPU tarafından ortak kullanılan 128 GB LPDDR5X bellek mevcut ve bant genişliği yaklaşık 273 GB/s seviyesinde.
Bağlantı tarafında ConnectX-7 SmartNIC kullanılıyor. Her sistemde çift 200 Gb/s QSFP portu yer alırken buna ek olarak 10 GbE, Wi-Fi 7, Bluetooth, HDMI 2.1a ve birden fazla USB-C portu da sunuluyor. Depolama tipik olarak 1–4 TB NVMe SSD aralığında. Sistemlerin adaptörle birlikte yaklaşık 140–240 W güç çektiği belirtiliyor ve yazılım tarafında Ubuntu tabanlı NVIDIA DGX OS ile tam CUDA AI yığını hazır geliyor.
Bu kurulumdaki önemli nokta, dört düğümün klasik yıldız topolojisi ve harici anahtar yerine anahtarsız bir ring topolojisiyle birbirine bağlanmış olması. Bağlantı düzeninde Spark 1, Spark 2 ve Spark 4’e; Spark 2, Spark 1 ve Spark 3’e; Spark 3, Spark 2 ve Spark 4’e; Spark 4 ise Spark 3 ve Spark 1’e bağlanıyor. NVIDIA’nın dört DGX Spark için normalde 200 GbE switch kullanılan yıldız topolojisini önerdiği, ancak bunun toplam maliyeti artırdığı not ediliyor.

Çalıştırılan model DeepSeek V4.1-Flash. Model toplam 552 milyar parametreye sahip olsa da ön doldurma aşamasında 8 milyar, decode aşamasında 16 milyar aktif parametre kullanıyor. Yapıda 1 paylaşımlı uzman ve 384 yönlendirilmiş uzman bulunuyor; bunların 6’sı aktif çalışıyor. Ayrıca Causal Encoder-Decoder, Compressed Sparse Attention 2, FP4 Quantization ve SWA Bounded Replay gibi mimari unsurlar sayesinde KV cache boyutunun token başına yalnızca 890 byte seviyesine indiği belirtiliyor.
Performans sonuçları da bu verimlilik iddiasını destekliyor. Kod üretiminde 32 eşzamanlı istekte tepe çıktı 494 tok/s olarak ölçülmüş. Düz yazı senaryosunda tepe değer 280 tok/s. Tek istekte yaklaşık 58 tok/s düz yazı ve yaklaşık 96 tok/s kod üretim hızı görülüyor. Prompt işleme performansı yaklaşık 4.764 tok/s düzeyinde. Boşta ilk token gecikmesi ise yaklaşık 0,2 saniye. Tüm kurulumun bellek ayak izi 476 GB olarak veriliyor.
Maliyet tarafında her 128 GB NVIDIA DGX Spark biriminin depolama kapasitesi ve bulunabilirliğe göre $5,500 ile $9,000+ arasında değiştiği ifade ediliyor. Buna göre dört sistemin toplamı tipik olarak $22,000–$36,000 aralığına çıkıyor. Ring bağlantısı için gerekli QSFP kablolar birkaç yüz dolar, raf, ek fanlar, güç dağıtımı ve çeşitli parçalar da yine birkaç yüz dolar daha ekliyor. Böylece toplam kurulum maliyeti yaklaşık $25,000 ile $40,000 bandına yerleşiyor. Bu bedel yüksek olsa da, sistemi 24/7 çalıştırıp API ücreti ve kullanım limiti olmadan yerel çıkarım almak isteyenler için farklı bir denge sunuyor.

