Yapay Zeka Güncellemeleri: Üç Sürümde Puanlar Eşitlendi

Artificial Analysis yetkilileri, v4.1.1, v4.2 ve v4.3 sürümlerinin daha kapsamlı v5 güncellemesi öncesi hızlandırılmış bir süreçle sunulduğunu duyurdu. Sektördeki hızlı gelişmeler nedeniyle güncellemelerin bekletilemediği ifade edildi. Bir haftada yayımlanan üç güncelleme, performans ve maliyet açısından önemli değişiklikler içeriyor.

GÜNCELLEME SÜRECİNİN DETAYLARI

Güncelleme sürecinin başlangıcında, GPT-6 Astra’nın kullanıma sunulduğu dönemde v4.1.1 sürümü Astra’ya 61 puan, Fable 5.1 modeline ise 66 puan kazandırmıştı. Dört gün sonra yayımlanan v4.2 sürümünde platform, içeriğe yeni değerlendirme kriterleri eklerken GPQA Diamond testini devre dışı bıraktı. Bu aşamada puanlar arasındaki fark kapandı; Fable 5.1’in puanı 57’ye, Astra’nın puanı ise 55’e düştü. Üç gün sonra yayımlanan v4.3 sürümünde ise Terminal-Bench ve AutomationBench-AA testleri sisteme entegre edildi ve her iki model de 53 puana ulaştı.

PERFORMANS VE MALİYET ANALİZİ

İki modelin eşit puana ulaşması, performans ve maliyet açısından önemli farklılıklar içeriyor. Astra v4.3 sürümünde görev başına ortalama 3,26 dolar maliyet çıkarken, Claude Fable 5.1 için bu rakam 7,63 dolar olarak belirlendi. Bu durum, Astra’nın aynı performans seviyesinde görev başına yüzde 57 daha düşük maliyet sunduğunu gösteriyor. Farkın temel nedeni, Astra’nın değerlendirme sürecinde daha az çıktı çipi kullanması olarak belirtildi.

TEST DETAYLARI VE GİZLİ TEST SETLERİ

Test detaylarında Fable 5.1 modeli bilgi odaklı işlerde ve bilimsel hesaplamalarda öne çıkarken, Astra modeli terminal tabanlı yazılım işlerinde ve iş akışı otomasyonlarında daha yüksek başarı gösterdi. Ayrıca, platform gizli test setlerinin kullanımını artırma kararı aldı. v4.1 sürümünde yüzde 20 olan gizli test oranı, v4.2’de yüzde 40’a, v4.3’te ise yüzde 45’e yükseltildi. Artificial Analysis, v5 sürümünde bu oranı daha da artırmayı hedefliyor.

SIRALAMADA SON DURUM

v4.3 liderlik tablosunda Astra ve Fable 5.1’in ardından Claude Opus 5 modeli 51 puanla üçüncü sırada yer aldı. Claude Fable 5 modeli 50 puan alırken, Muse Spark 1.3 modeli 48, GPT-5.6 Sol modeli ise 47 puan aldı. Açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla öne çıktı.

ÖNE ÇIKAN HABERLER

Görevi Kötüye Kullanan İki Görevliye Hapis Cezası

Konya'da APP plakasını değiştirmek isteyen bir vatandaştan hizmet bedeli talep eden iki görevliye hapis cezası verildi. Esnaf Furkan Baktemur, aracının APP olarak bilinen plakasını değiştirmek için Şoförler ve Otomobilciler Esnaf Odası'na gitti.

İstanbul’daki Okullarda Yeni Güvenlik Uygulaması Başlıyor

İstanbul'da öğrenciler, yaz tatilinin ardından yeni eğitim öğretim yılına 14 Eylül Pazartesi günü başlayacak. Yeni dönem öncesi, kentteki okullarda eğitim hazırlıkları sürerken öğrencilerin güvenliği için de çeşitli çalışmalar yapılıyor.

İstanbul’da Okul Açılışında Ulaşım Ücretsiz Olacak

Yeni eğitim-öğretim yılı pazartesi günü başlayacak. Okul öncesi eğitim ile ilkokul 1'inci sınıfa başlayacak öğrencilerin uyum süreçleri için yapılan eğitimlerin son günü bugün.

C31K Operasyonu: Üç İlde Okul Saldırısı Hazırlığı Belirlendi

Ankara Cumhuriyet Başsavcılığı tarafından yürütülen soruşturmada, 22 şehirde eş zamanlı olarak C31K isimli yeni nesil suç örgütüne yönelik operasyon gerçekleştirildi. Sosyal medya ve iletişim platformlarında suç içerikli paylaşımlar yapan 32 şüpheli tespit edildi.

İstanbul’da Kiralık Sosyal Konut Projesi Başlıyor

Cumhurbaşkanı Recep Tayyip Erdoğan, 15 Eylül'de İstanbul'daki kiralık sosyal konut projesinin başvurularının başlayacağını açıkladı. Bu proje, ev sahibi olamayan vatandaşların uygun fiyatlarla konut sahibi olmasını sağlayacak.