Araştırmacılar, yapay zekanın "İnsanlığın Son Sınavı" ("Humanity's Last Exam") testindeki sonuçlarının önemli ölçüde arttığını kaydettiler.
"İnsanlığın Son Sınavı" testi, Scale AI ve Center for AI Safety kar amacı gütmeyen kuruluşlarının uzmanları tarafından hazırlanmıştır. Testin temelinde 50 ülkeden bilim insanlarının hazırladığı 70 bin soru yer almaktadır. Bu sorular arasından 2 500 görev seçilmiştir. Her bir soru doktora düzeyine uygun bilgi gerektirmektedir. Format, kısa ve kesin cevapları öngörmekte olup bu cevapları açık kaynaklardan bulmak zordur.
2024 yılında modeller düşük sonuçlar gösteriyordu. ChatGPT, yaklaşık %3 sonuç elde etmişti, Gemini ve Claude ise biraz daha yüksek göstergelere sahipti. O dönemde test, dil modellerinin kapasiteleri ile bilimsel uzmanların düzeyi arasındaki ciddi farkı ortaya koymuştu.
Şu anda durum değişti. Geliştiricilerin verilerine göre, Gemini %45,9, Claude ise %34,2 sonuç gösterdi. Scale AI temsilcisi Kelvin Zhang, modellerin önümüzdeki aylarda veya bir yıl içinde %100 sonuca ulaşabileceğini bildirdi.
Bununla birlikte, geliştiriciler maksimum sonuç elde edilse bile yapay zekanın insanın yerini tamamen almayacağını düşünmektedirler. Söz konusu olan, standart dışı yaklaşım gerektiren görevler ile yorumlama ve yaratıcı düşüncenin önemli olduğu dar uzmanlık alanlarındaki bilimsel konulardır.
ScienceDaily