Resmi: yapay zeka (AI), özel olarak GPT-4.5, Turing testini geçti.
San Diego Üniversitesi tarafından yürütülen bir çalışma, OpenAI tarafından geliştirilen gelişmiş bir dil modeli olan GPT-4.5’in, insanlardan daha sık insan olarak tanındığını göstermiştir.
Summary
Katılımcıların %73’ü GPT-4.5’in insan olduğuna inandı: Turing testinin geçilmesinden sonra AI için yeni bir çağ
1950 yılında Alan Turing tarafından tasarlanan aynı adlı test, devrim niteliğindeki bir soruya yanıt vermeyi amaçlıyor: makineler düşünebilir mi? Testte, bir değerlendirici kimliklerini bilmeden biri insan, diğeri yapay olan iki muhatapla etkileşime girer.
İkisini ayırt edemezse hangisinin insan olduğunu, makine testi geçti demektir.
Test, bilinci ölçmez, ancak makinenin insan davranışını inandırıcı bir şekilde simüle etme yeteneğini ölçer. Bugüne kadar, hiçbir sistem bu testi bu kadar net bir şekilde geçmemişti.
Araştırmacılar, gerçek bir kişi ve yapay zeka ile metin tabanlı sohbetlere katılmak üzere iki değerlendirme grubunu — üniversite öğrencileri ve Prolific platformu kullanıcıları — dahil ettiler.
Sohbetin sonunda, gerçek insanın kim olduğunu seçmeleri gerekiyordu.
Test edilen AI sistemleri şunları içeriyordu:
- ELIZA – 60’ların sembolik chatbot’u
- GPT-4o – OpenAI modeli, çok modlu kullanım için optimize edilmiştir
- LLaMa 3.1 – Meta’nın açık kaynak modeli
- GPT-4.5 – OpenAI’nin en gelişmiş versiyonu, burada “persona” ile ve “persona” olmadan test edilmiştir
Deneyde belirleyici bir faktör, iki tür prompt kullanımı olmuştur:
- NO-PERSONA: nötr, standart yanıtlar;
- PERSONA: belirgin bir kişilikle yanıtlar vererek daha insancıl görünmek.
Her bir değerlendirici, konuşmadan sonra bu arayüzü görüyordu. İki “tanık” arasında gerçek insanın kim olduğunu belirtmesi gerekiyordu ve seçiminde ne kadar emin olduğunu da belirtmeliydi. Birçok durumda, seçim yapay zekaya düştü.
GPT-4.5 ile “persona”: %73 başarı
GPT-4.5-PERSONA modeli, neredeyse dört etkileşimden üçünde insan katılımcıya kıyasla daha inandırıcı olarak, %73 kazanma oranı gibi etkileyici bir başarıya ulaştı.
“Persona” sistemleri, yapay bir kişilik eklemenin insanlık algısını artırdığını göstererek önemli ölçüde daha iyi performans elde etti.
Çubuk grafiği, her modelin kazanma oranlarını gösterir. GPT-4.5-PERSONA, hem Prolific katılımcıları hem de üniversite öğrencileri arasında baskın durumdadır.
Sağda, başka bir grafik değerlendiriciler tarafından ifade edilen güven seviyesini gösteriyor: genellikle, en gelişmiş AI’lar insanlarla karıştırılıyordu ve bu durum şaşırtıcı derecede yüksek bir güvenle gerçekleşiyordu.
GPT-4.5’in bu tarihi sonucu elde etmesini sağlayan ne oldu? Sadece daha büyük bir dil kapasitesi değil, aynı zamanda insan kusurlarını simüle etme yeteneği: tereddütler, daha az mükemmel yanıtlar, stratejik nezaket.
Etkileşimi daha doğal ve inandırıcı kılan unsurlar.
Ve şimdi?
Bir makine insanın kendisinden daha insancıl görünmeyi başarırsa, AI’ye olan güvenimiz nasıl değişecek? Etkileri sadece teknolojik alanda değil, aynı zamanda etik ve sosyal alanda da büyüktür.
- AI’lerin kamuya açık ortamlarda açıkça etiketlenmesi gerekecek mi?
- Bir kişiyle yapılan bir konuşmayı bir makineyle yapılandan ayırt edebilecek miyiz?
- Yapay muhatabımız daha empatik, tutarlı ve dikkatli olduğunda ne değişir?
GPT-4.5’in Turing testini geçmesi, yapay zekanın evriminde bir dönüm noktası anlamına gelir. Bu, AI’nın bilince sahip olduğunun kanıtı değil, ancak “insan gibi görünmeyi” o kadar rafine bir şekilde öğrendi ki, insanları bile kandırabiliyor.
Gerçek bir kişiyle konuşup konuşmadığımızdan artık emin olamayacağımız bir dünyaya hazır mıyız?

