Cerebras, wafer-scale mimarisini temel alan yeni CS-4 çözümünü duyurdu. Şirketin yeni sistemi, WSE-3 Turbo ya da kısa adıyla WSE-3T çipi üzerine kurulu. Bu yeni yonga, Cerebras’ın daha önce tanıttığı 3. nesil Wafer Scale Engine tasarımının devamı niteliğinde ve şirketin “en büyük AI işlemcisi” yaklaşımını koruyor.
WSE-3T, teknik açıdan WSE-3 ile aynı ölçekte kalıyor. Çipte 4 trilyon transistör ve 900.000 çekirdek yer alıyor. Toplam kalıp alanı 46.225 mm2 seviyesinde. Ayrıca aynı wafer üzerine entegre edilmiş 44 GB SRAM bulunuyor. Bu yapı, özellikle düşük gecikme ve yüksek veri besleme kapasitesi gerektiren yapay zeka iş yükleri için tasarlanmış durumda.

Performans tarafında Cerebras, WSE-3T ile yapay zeka hesaplama kapasitesinin iki katına çıktığını belirtiyor. Çip, wafer başına 125 PFLOPs hesaplama sunuyor; sparsity kullanıldığında bu değer 250 PFLOPS seviyesine ulaşıyor. Bant genişliği tarafında ise toplam değer 43.2 PB/s olarak veriliyor. Yonga içi fabric 53.5 PB/s, yonga dışı I/O ise 2.4 Tb/s bant genişliği sağlıyor. Gecikme tarafında da önceki nesilde 5 ms olan değerin 2 ms seviyesine indirildiği ifade ediliyor.
Cerebras, yalnızca çip değil, doğrudan sistem düzeyinde çözüm sunduğunu vurguluyor. Bu nedenle WSE-3T, yeni CS-4 rack-scale platformunun merkezinde yer alıyor. CS-4, şirketin Nexus Platform Architecture adını verdiği yeni yapıya dayanıyor. Bu mimari; Compute, Power ve I/O olmak üzere üç katmanlı modüler bir tasarım kullanıyor.

Her rafta takılabilir “backpack” tasarımı bulunuyor. Hesaplama alt sistemi, güç dizisine dikey olarak bağlanan arka bölümde konumlanıyor. Bu bağımsız wafer-scale modüller; güç dönüşümü, doğrudan sıvı soğutma, yüksek hızlı I/O ve kontrol sistemlerini kompakt bir pakette bir araya getiriyor. Yeni tasarımın önemli hedeflerinden biri de güç dönüşümünü wafer’lara yaklaştırarak enerji kayıplarını ciddi ölçüde azaltmak. Şirkete göre bu sayede WSE çiplerine daha fazla güç aktarılabiliyor; sonuç olarak motor tarafında 2x güç, daha yüksek frekanslar ve daha hızlı hesaplama mümkün oluyor.
CS-4 için paylaşılan uygulama örneklerinden biri GPT-OSS 120B modeli oldu. Cerebras, tek bir CS-4 rafının bu modelde 4.400 token/s üzeri üretim sağlayabildiğini söylüyor. Ayrıca GPU tabanlı bir AI çözümüyle kıyaslamada, CS-4’ün 1 saniyede ürettiği çıktının GPU rafında 30 saniyede üretildiği belirtiliyor.

Toplam sistem seviyesinde her bir CS-4 rafı üç adet WSE-3T çipi taşıyor. Böylece raf başına 750 PFLOPS AI hesaplama, 7.2 Tb/s I/O bant genişliği ve 129.6 PB/s SRAM bant genişliği sunuluyor. Şirket ayrıca CS-4’ün, önceki CS-3’e kıyasla watt başına 10x daha yüksek throughput sağladığını öne sürüyor. Yeni ara bağlantı çözümüyle CS-4 kümeleri, 50 trilyon parametrenin üzerindeki modelleri destekleyecek ölçekte büyütülebiliyor. İlk CS-4 sevkiyatlarının bu çeyrekte başlaması bekleniyor.

