Meta, Superintelligence Labs çatısı altında geliştirdiği Muse Glimmer modelini Apache 2.0 lisansı altında yayımladı. 30 milyar parametreli modelin ağırlıkları Hugging Face üzerinden erişime açılmış durumda. Şirket, Muse Glimmer’ı yerel kodlama, function calling, yerel ajan iş yükleri ve LLM-as-a-judge değerlendirmeleri için konumlandırıyor. Buradaki temel vurgu, bulut bağlantısına ve merkezi altyapıya ihtiyaç duymadan tüketici sınıfı bir GPU üzerinde çalışabilen bir model sunmak.
Muse Glimmer’ın çıkış noktası, AI ekiplerinin sık karşılaştığı operasyonel kısıtlara dayanıyor. Bulut tabanlı modeller ağ erişimi ve merkezi servisler gerektirirken, Meta bu modeli cihaz üzerinde çalışan senaryolar için öne çıkarıyor. Özellikle takvim, mesajlar, dosyalar ve diğer özel bağlamlara erişebilen kişisel ajan kullanımına dikkat çekiliyor. Bu yaklaşım, veriyi dışarı taşımadan yerel işleme ihtiyacı olan ekipler için önemli olabilir.
Meta’nın paylaştığı kıyaslamalarda Muse Glimmer, genel ajan görevlerine odaklanan sekiz testin beşinde Gemma4-31B ve Qwen3.6-27B’nin önüne geçiyor. Model MCP Atlas testinde 75.5 puan alırken, Gemma4-31B 54.2 ve Qwen3.6-27B 62.5 puanda kalıyor. DeepSearch QA’da da benzer bir tablo var: Muse Glimmer 74.6, Gemma4-31B 61.7 ve Qwen3.6-27B 71.1. τ²-Banking sonucu 23.5 olurken, rakip modeller sırasıyla 15.1 ve 16.7 seviyesinde. WildClawBench’te 47.6, GAIA2’de ise 43.3 puanla yine önde görünüyor.
Bununla birlikte her testte lider değil. GDPval-AA’da Qwen3.6-27B 1,141 puana ulaşırken Muse Glimmer 953’te kalıyor. SkillsBench with Skills testinde de Qwen3.6-27B 46.6 ile önde; Muse Glimmer 44.3 alıyor. OSWorld-Verified tarafında fark daha belirgin: Qwen3.6-27B 75.6, Muse Glimmer 65.9, Gemma4-31B ise 58.5 puanda. Bu sonuçlar, modelin ajan görevlerinde güçlü bir tablo çizdiğini gösterse de tüm kullanım alanlarında mutlak üstünlük anlamına gelmiyor.
Kodlama testlerinde tablo daha dengeli. Muse Glimmer, SWE-Bench Pro’da 51.2 puanla ilk sırada; aynı testte Gemma4-31B 36.9 ve Qwen3.6-27B 50.2 puan alıyor. SciCode sonucunda Muse Glimmer 43.6 ile Gemma4-31B’nin 43.4 puanının az farkla önünde. Ancak SWE-Bench Verified’da Qwen3.6-27B 77.2 puanla Muse Glimmer’ın 76.0 sonucunu geçiyor. TerminalBench 2.1’de de Qwen3.6-27B 60.7 ile lider; Muse Glimmer 51.7, Gemma4-31B ise 43.4 puanda kalıyor. Meta, modelin OpenClaw ve benzeri ajan orkestrasyon kalıplarını desteklediğini, özel scaffold yapılarının da geliştirici dokümantasyonunda ele alındığını belirtiyor.
Çok modlu kullanımda Muse Glimmer, metin ve görüntüyü iç içe kabul eden özel bir perception encoder kullanıyor. Böylece ekran görüntüleri, grafikler ve belgeler konuşma akışı içinde yorumlanabiliyor. Charxiv Reasoning testinde 78.8 puanla öne çıkarken, ScreenSpot Pro’da Qwen3.6-27B 76.1 ile ilk sırada, Muse Glimmer 75.4 puan alıyor. OmniDocBench v1.5’te de Qwen3.6-27B 77.8 ile lider, Muse Glimmer 75.8’de. MMMU Pro sonucunda fark daha sınırlı: Muse Glimmer 74, Qwen3.6-27B 75, Gemma4-31B ise 73 puan alıyor.
Güvenlik değerlendirmelerinde de bazı sayılar paylaşılmış durumda. CI Memories testinde Muse Glimmer için ihlal oranı 26.4 ve kapsam skoru 64.8 olarak veriliyor. Gemma4-31B aynı testte 12.1 ihlal oranı ve 53.0 kapsam, Qwen3.6-27B ise 53.4 ihlal oranı ve 66.9 kapsam elde ediyor. Siren AgentDojo testinde Muse Glimmer’ın attack success rate değeri 28.4, utility skoru ise 94.2. Gemma4-31B 25.6 ve 90.8; Qwen3.6-27B ise 40.3 ve 92.7 değerlerine sahip.
Genel akıl yürütme tarafında Muse Glimmer altı testin dördünde lider görünüyor. IFBench’te 77.0, AIME 2026’da 94.7, AA-LCR’de 80.0 ve Beam 128K’da 65.1 puan alıyor. Buna karşılık GPQA Diamond testinde Gemma4-31B 85.7 ile öne çıkıyor; Muse Glimmer 83.5 puanda. Humanity’s Last Exam, Text No Tools sonucunda da Gemma4-31B 23.6 ile ilk sırada, Muse Glimmer 22.0’da kalıyor. Genel tablo, Muse Glimmer’ın benzer ölçekli modellerle yakın rekabet içinde olduğunu gösteriyor.

Yerel çalıştırma tarafında en önemli noktalardan biri bellek gereksinimi. Meta’ya göre tam hassasiyetli 30 milyar parametreli bir model 55 GB’tan fazla bellek gerektiriyor. Muse Glimmer ise yaklaşık 4-bit weight quantisation kullanarak dil modelini 20 GB’ın altına indiriyor. Bu sayede KV cache için yer açılıyor; perception encoder ve speculative-decoding drafter için de ek alan gerekiyor. Şirket toplamda 24 GB veya 32 GB bellek zarfını hedefliyor.
Meta ayrıca DFlash tabanlı drafter’ın, ana modelin paralel biçimde doğrulayacağı token blokları önerdiğini söylüyor. Şirkete göre bu yöntem, klasik token-by-token üretime göre hız avantajı sağlarken çıktı kalitesini aynı tutuyor. Ancak paylaşılan bilgilerde token/saniye, istem boyutu, güç tüketimi veya eşzamanlılık verileri yer almıyor. K-Quant-17GB sürümü, quantised DFlash drafter ile birlikte MacBook M4-Max, MacBook M5-Max ve RTX-5090 üzerinde test edilmiş. Entegrasyonların llama.cpp, MLX ve ExecuTorch için önümüzdeki günlerde gelmesi bekleniyor.

