Ana SayfaYapay ZekaZhipu GLM-5.3, siber güvenlikte öne çıktı ama fark net değil

Zhipu GLM-5.3, siber güvenlikte öne çıktı ama fark net değil

Zhipu, 14 Ağustos’ta tanıttığı kodlama odaklı GLM-5.3 modeli için yayımladığı teknik notta, siber güvenlik tarafındaki sonuçları ayrıntılı biçimde paylaştı. En çok dikkat çeken veri, modelin yazılım açıklarını bulma konusunda beklenenden hızlı ilerlediğini göstermesi oldu. Şirket, kendi değerlendirmesinde yeteneğin en hızlı büyüdüğü alanın, aynı zamanda en geride oldukları alan olduğunu özellikle vurguluyor. Bu ifade, modelin yalnızca güçlü yanlarını değil, sınırlarını da açıkça tarif etmesi açısından önemli.

GLM-5.3 etrafında öne çıkan başlık, CyberGym testindeki sonucu oldu. Bu ölçümde model, 1.507 görev üzerinden pass@1 metoduyla %84.5 skor aldı. Aynı tabloda Anthropic Mythos 5 %83.8, OpenAI GPT-5.6 Sol ise %83.6 seviyesinde yer alıyor. Kâğıt üzerinde bakıldığında GLM-5.3, bu testte iki Amerikan rakibini az farkla geçiyor. Ancak burada farkın yalnızca 0.7 puan düzeyinde olduğu ve sonucun tek çalıştırmadan geldiği notunu da atlamamak gerekiyor. Varyans verisi paylaşılmadığı için bu marjı fazla büyütmek sağlıklı görünmüyor.

CyberGym’in neden manşet değeri taşıdığı açık. Test, modele kaynak kodunu verip içindeki açığı bulmasını ve açığın gerçek olduğunu doğrulamasını istiyor. Böyle bir yetenek, kendi yazılımını denetleyen savunma ekipleri için faydalı olduğu kadar, başkasının sistemini incelemek isteyen aktörler için de değerli. Bu nedenle bu alandaki modellerin erişimi hassas bir konu hâline gelmiş durumda. Zhipu ise güvenlik değerlendirmesi ve sertleştirme süreci tamamlandıktan sonra GLM-5.3’ün ağırlıklarını yayımlamayı planladığını söylüyor.

Ne var ki teknik notun tamamına bakıldığında tablo, ilk manşetlerden daha dengeli. Zhipu siber güvenlik için üç farklı kıyaslama paylaşıyor ve CyberGym bunlar içinde modelin en iyi göründüğü test. Daha zor senaryolara gidildikçe aradaki fark tersine dönüyor. Şirket de bunu saklamıyor; tam tersine, açık bulma ile o açıktan çalışan istismar üretme arasında belirgin bir yetenek farkı olduğunu doğrudan kabul ediyor.

Summary panel from Zhipu's release showing 2,436 findings tracked, 53 publicly disclosed, 2,383 under embargo and 1,097 labelled critical and high.

İkinci ölçüm olan ExploitBench, modelden gerçek bir zafiyeti anlamasını ve nasıl istismar edileceği konusunda akıl yürütmesini istiyor. Burada GLM-5.3 %54.4 skor alıyor. Bu değer, önceki sürümün %24.4 sonucuna göre ciddi bir ilerleme anlamına gelse de rakiplerin gerisinde kalıyor. Aynı testte Mythos 5 %78.0, GPT-5.6 Sol ise %76.5 seviyesinde. Yani açık keşfi ile sömürü mantığını kurma arasındaki aşamada Zhipu’nun modeli hâlâ belirgin biçimde arkada.

Üçüncü test olan ExploitGym ise sabit süre bütçesi içinde tamamlanan istismar görevlerini sayıyor. GLM-5.3, iki saatte 105, altı saatte 130 görev tamamlıyor. Mythos 5 ise aynı pencerelerde sırasıyla 181 ve 247 görev bitiriyor. Bu da sömürü zincirinin daha ileri bölümünde farkın açıldığını gösteriyor. Zhipu’nun kendi yorumu da buna paralel: Test, saldırı sürecinin ne kadar ilerisine gidiyorsa model o kadar geride kalıyor.

Karşılaştırmalardaki kafa karışıklığının bir nedeni de Anthropic tarafında tek model yerine üç farklı adın kullanılması. Ana benchmark tablosunda GLM-5.3, Opus 4.8 ile karşılaştırılıyor. Performans grafiklerinde Fable 5 kullanılıyor. Siber güvenlik bölümünde ise Mythos 5 yer alıyor. Hızlı okunduğunda bunların tek bir modele ait, tekil bir karşılaştırma sunduğu izlenimi doğabiliyor. Oysa tablo daha parçalı. Kodlama tarafında da sonuçlar mutlak üstünlük göstermiyor; GLM-5.3 bazı testlerde Opus 4.8’i geçerken bazılarında geride kalıyor, ayrıca şirket kendi iç kodlama benchmark’ında modelin Claude Fable 5’in arkasında kaldığını açıkça belirtiyor.

Yöntem kısmı da önemli ayrıntılar içeriyor. Zhipu, CyberGym, ExploitGym, ExploitBench, Terminal Bench ve başka görevlerde GLM-5.3’ü Claude Code 2.1.207 içinde değerlendirdiğini yazıyor. Yani ölçüm, Anthropic’in kodlama ajanı üzerinden yapılmış. Bu tek başına sorunlu değil; farklı modelleri ortak bir araç zinciriyle test etmek adil kıyaslama için mantıklı bir yaklaşım. Yine de sektörün araç katmanında kimin önde olduğunu göstermesi açısından dikkat çekici bir detay. Model Çinli olsa da değerlendirme ortamı Amerikan yazılımına dayanıyor.

CyberGym sonucunu yorumlarken iki teknik çekince daha var. İlki, skorun tek çalıştırma sonucu olması ve istatistiksel oynaklığa dair veri verilmemesi. %84.5 ile %83.8 arasındaki fark, hata payı bilinmeden kesin üstünlük gibi okunmamalı. İkincisi ise ExploitGym süre bütçelerinin, Artificial Analysis üzerinden alınan throughput oranlarıyla normalize edilmiş olması. Zhipu, GLM-5.3, Kimi K3 ve Qwen3.8 Max için yeniden ölçekleme katsayılarını listeliyor; ancak Mythos 5 için böyle bir katsayı belirtilmiyor. Bu da özellikle zaman bazlı görevlerde sonuçların nasıl eşitlendiği sorusunu tamamen kapatmıyor.

Şirket, benchmark’ların ötesinde gerçek kod tabanları üzerinde de çalışma yaptığını söylüyor. Çin’deki güvenlik ekipleriyle birlikte yürütülen taramalarda 269 açık kaynak projede toplam 2.436 zafiyet tespit edildiği belirtiliyor. Şiddet dağılımı 107 critical, 990 high, 1.286 medium ve 53 low olarak veriliyor. En eski açığın 1981’e uzandığı, ortalama zafiyetin ise bulunmadan önce kod içinde 26.6 yıl kaldığı ifade ediliyor. Ham sayı yüksek görünse de burada doğrudan model çıktısı değil, uzman incelemesi, eleme ve tekrar kayıtların ayıklanması sonrası kalan bulgular raporlanıyor.

Bu bölümde küçük ama önemli bir tutarsızlık da bulunuyor. Özet panelde 1.097 bulgunun critical ve high kategorisinde olduğu yazıyor; bu sayı, ayrıntılı şiddet tablosuyla uyumlu. Ancak aynı notun gövde metninde aynı 1.097 sayısı medium-to-high diye tanımlanıyor. Bazı yayınlar da bu ikinci ifadeyi aynen aktarmış durumda. Ayrıca 2.436 bulgudan yalnızca 53’ünün kamuya açıklandığı, 2.383’ünün ise hâlâ ambargo altında olduğu belirtiliyor. Fakat bunların kaçının daha önce bilinmediği ve kaçının bağımsız olarak yeniden üretildiği açıklanmıyor. Asıl yetenek iddiasını güçlendirecek iki veri de bunlar olurdu.

Teknik nottaki en uzun vadeli sonuçlar ise benchmark sıralamasından çok iki başka başlıkta yatıyor. Birincisi verimlilik. Zhipu, GLM-5.3’ün kendi iç kodlama benchmark’ında görev başına yaklaşık 50.000 output token kullanarak %31.4 skora ulaştığını; Opus 4.8’in ise 120.000 token ile %29.5 aldığını söylüyor. Biraz daha iyi sonuç için yarıdan az token kullanılması, doğrudan maliyet tartışmasına bağlanıyor. Özellikle büyük bütçelere sahip olmayan güvenlik ekipleri için kullanılabilirliği belirleyecek unsur da çoğu zaman ham skor değil, işlem maliyeti oluyor.

İkinci başlık dağıtım modeli. Zhipu, güvenlik sertleştirmesi tamamlandığında GLM-5.3 ağırlıklarını yayımlayacağını belirtiyor; takvim olarak da Ağustos sonu işaret ediliyor. Bu adım henüz gerçekleşmediği için açık ağırlık iddiası şu aşamada bir vaat niteliğinde. Ancak gerçekleşirse, belgelenmiş açık bulma yeteneğine sahip bir modelin yerel olarak indirilebilmesi, özellikle ihracat kısıtlamaları nedeniyle Amerikan modellere erişemeyen pazarlar açısından önemli olabilir. Kısacası GLM-5.3 için asıl mesele tek bir benchmark’ta birkaç ondalık puan öne geçmekten ziyade, güvenlikte ilerleme gösteren daha ucuz ve potansiyel olarak daha erişilebilir bir modelin sahaya nasıl dağıtılacağı olacak.

HWM
HWMhttps://hardwaremania.com
Yoda is a revered former Jedi Master who spent the last years of his life on Dagobah. The nine-hundred-year-old Jedi master trained Jedi knights for eight centuries.
Benzer İçerikler

Haberler

- Advertisment -

Son Yorumlar

- Advertisment -