Artificial Analysis yetkilileri, v4.1.1, v4.2 ve v4.3 sürümlerinin daha kapsamlı v5 güncellemesi öncesi hızlandırılmış bir süreçle sunulduğunu duyurdu. Sektördeki hızlı gelişmeler nedeniyle güncellemelerin bekletilemediği ifade edildi. Bir haftada yayımlanan üç güncelleme, performans ve maliyet açısından önemli değişiklikler içeriyor.
GÜNCELLEME SÜRECİNİN DETAYLARI
Güncelleme sürecinin başlangıcında, GPT-6 Astra’nın kullanıma sunulduğu dönemde v4.1.1 sürümü Astra’ya 61 puan, Fable 5.1 modeline ise 66 puan kazandırmıştı. Dört gün sonra yayımlanan v4.2 sürümünde platform, içeriğe yeni değerlendirme kriterleri eklerken GPQA Diamond testini devre dışı bıraktı. Bu aşamada puanlar arasındaki fark kapandı; Fable 5.1’in puanı 57’ye, Astra’nın puanı ise 55’e düştü. Üç gün sonra yayımlanan v4.3 sürümünde ise Terminal-Bench ve AutomationBench-AA testleri sisteme entegre edildi ve her iki model de 53 puana ulaştı.
PERFORMANS VE MALİYET ANALİZİ
İki modelin eşit puana ulaşması, performans ve maliyet açısından önemli farklılıklar içeriyor. Astra v4.3 sürümünde görev başına ortalama 3,26 dolar maliyet çıkarken, Claude Fable 5.1 için bu rakam 7,63 dolar olarak belirlendi. Bu durum, Astra’nın aynı performans seviyesinde görev başına yüzde 57 daha düşük maliyet sunduğunu gösteriyor. Farkın temel nedeni, Astra’nın değerlendirme sürecinde daha az çıktı çipi kullanması olarak belirtildi.
TEST DETAYLARI VE GİZLİ TEST SETLERİ
Test detaylarında Fable 5.1 modeli bilgi odaklı işlerde ve bilimsel hesaplamalarda öne çıkarken, Astra modeli terminal tabanlı yazılım işlerinde ve iş akışı otomasyonlarında daha yüksek başarı gösterdi. Ayrıca, platform gizli test setlerinin kullanımını artırma kararı aldı. v4.1 sürümünde yüzde 20 olan gizli test oranı, v4.2’de yüzde 40’a, v4.3’te ise yüzde 45’e yükseltildi. Artificial Analysis, v5 sürümünde bu oranı daha da artırmayı hedefliyor.
SIRALAMADA SON DURUM
v4.3 liderlik tablosunda Astra ve Fable 5.1’in ardından Claude Opus 5 modeli 51 puanla üçüncü sırada yer aldı. Claude Fable 5 modeli 50 puan alırken, Muse Spark 1.3 modeli 48, GPT-5.6 Sol modeli ise 47 puan aldı. Açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla öne çıktı.