OpenAI dil modellerinin eğitilmesi için yeni "Confessions" tekniğini tanıttı.
Oxu.Az'ın openai.com'dan aktardığı habere göre, temel amaç yapay zekayı kendi hatalarını bulmaya ve itiraf etmeye öğretmektir.
"Confessions"ın temelinde ek bir analiz aşaması bulunuyor. Önce model sorguya normal şekilde cevap veriyor, daha sonra ise kendi cevabını değerlendirdiği ayrı bir rapor oluşturuyor. İkinci mesajda model, talimatları doğru şekilde uygulamadığı yerleri veya yaptığı gerçeksel hataları gösterebilir.
Teknik halihazırda "GPT-5 Thinking" modelinde test edildi. "Confessions"dan önce model hataları gizleyebiliyordu, ancak eğitimden sonra bu tür durumların olasılığı %4,4'e kadar azaldı. Bununla birlikte, metot hataların kendisini düzeltmiyor - onları görünür kılıyor: model nerede hata yaptığını açık bir şekilde belirtmeye başlıyor ki bu da araştırmacıların işini kolaylaştırıyor.