NVIDIA, yapay zeka tarafında yalnızca temel modelin değil, onu çevreleyen yazılım katmanının da ne kadar kritik olduğunu gösteren yeni bir sonuç paylaştı. Şirketin AVO adlı kodlama ajanı, ARC-AGI-3 kamuya açık veri setinde yer alan 25 oyundaki toplam 183 seviyenin tamamını çözerek %100 başarı elde etti. Dikkat çeken nokta ise bunun, önceden özel talimatlar veya hedefler verilmeden yapılmış olması.
Buradaki temel kavram “harness” olarak geçen dış yazılım katmanı. Basitçe söylemek gerekirse bu yapı, bir yapay zeka modelinin etrafına sarılan ve onu daha işlevsel hale getiren bir çerçeve görevi görüyor. Model metin üretme veya tahmin etme yeteneğini sağlarken, harness ise dosyalarla çalışma, araç kullanma, deneme-yanılma döngüsü kurma, ara sonuçları saklama ve katı kurallarla ilerleme gibi işlevleri üstleniyor.
Bu yaklaşım özellikle karmaşık görevlerde önemli hale geliyor. Standart bir model tek başına bir web sayfasını gezemez, bir Python betiğini çalıştıramaz veya her denemeden sonra sistemli biçimde kendini düzeltemez. İyi tasarlanmış bir harness ise modelin önce bir çözüm üretmesini, ardından çıkan sonuca göre yeni denemeler yapmasını sağlayabiliyor. Ayrıca uzun bağlamlarda unutulan ayrıntıları saklayarak ilerlemenin daha tutarlı sürmesine yardımcı oluyor.
NVIDIA’nın AVO sistemi de bu mantıkla çalışıyor. AVO, Anthropic’in Claude Opus 5 modeli etrafına kurulmuş bir ajan katmanı. Şirket bu sistemi ilk olarak CUDA GPU kernel optimizasyonu için geliştirdi. Verilen bilgilere göre ajan 7 gün boyunca otonom çalıştı, 500’den fazla yönü denedi ve bazı durumlarda FlashAttention-4’ü %10.5’e kadar geride bırakan kernel çıktıları üretti.
Daha sonra NVIDIA, temel ajan mimarisini değiştirmeden GPU mühendisliğine yönelik araçları çıkarıp yerine ARC-AGI-3 görev arayüzünü yerleştirdi. Böylece AVO’nun kod inceleme ve öz-düzeltme mantığı, görsel ve etkileşimli mantık bulmacalarına aktarılmış oldu. Sonuçta sistem, açık veri setindeki 183 bulmacanın tamamını doğru çözdü.

Burada asıl kıyaslama dikkat çekici. Aynı ARC-AGI-3 kamuya açık sette, temel Claude Opus 5 modelinin yalnızca %30 skor alabildiği belirtiliyor. Buna karşılık AVO’nun %100 sonuca ulaşması, iyi tasarlanmış bir ajan katmanının tek başına model performansını ne kadar ileri taşıyabildiğini gösteriyor.
Verimlilik tarafında da sayılar paylaşılmış durumda. NVIDIA’ya göre AVO, 183 seviyeyi toplam 6.624 aksiyonla tamamladı. Bu da kamuya açık seti bitirmek için 7.542 aksiyon kullanan VISTA gibi diğer önde gelen ajan katmanlarına kıyasla %12 daha yüksek verimlilik anlamına geliyor.
Öte yandan bu sonucun önemli bir sınırı var. ARC-AGI-3 değerlendirme platformu şu anda harici ve özel geliştirilmiş ajan katmanlarının gizli özel veri setinde çalıştırılmasına izin vermiyor. Bu nedenle AVO’nun daha kritik kabul edilen kapalı sette nasıl bir performans göstereceği şimdilik bilinmiyor.

