
İngiltere Yapay Zeka Güvenlik Enstitüsü'nden Kritik Uyarı: Mevcut Testler Yetersiz
UK AISI tarafından yayınlanan rapor, standart benchmark testlerinin yapay zeka ajanlarının gerçek yeteneklerini sistematik olarak düşük gösterdiğini ortaya koydu.

UK AISI tarafından yayınlanan rapor, standart benchmark testlerinin yapay zeka ajanlarının gerçek yeteneklerini sistematik olarak düşük gösterdiğini ortaya koydu.

xAI'ın Grok 4.2 ve Anthropic'in Mythos/Fable 5 modelleri, matematiksel kanıtlar ve karmaşık mantık testlerinde karşı karşıya geldi. İşte performans analizi.