Yeni bir araştırma, ChatGPT’nin 2022’nin sonunda yaygınlaşmasının ardından üniversitelerin üretime dayalı yapay zeka araçlarını sınavları atlatabilecek kadar gelişmiş olup olmadığını değerlendirmeye çalıştığını ortaya koyuyor. Avustralya’daki Wollongong Üniversitesi’nde yürütülen güncel çalışma, beş yapay zeka sağlayıcısından dokuz modelin iki zorunlu hukuk dersi sınavında öğrencilerin çoğunun önüne geçtiğini ve bu durumun gözetimsiz sınav sonuçlarının dürüstlüğünü sorgulatabileceğini gösteriyor.
Araştırmacılar, yapay zeka modellerinin artık entelektüel yükü yüksek görevlerde insanlara rakip olabilecek düzeye geldiğini, ancak bunun yapay zekayı güvenilir bir hukuk uzmanı haline getirmediğini vurguluyor. Bulguların ardından araştırmacılar, üniversitelerin sınav biçimlerini yeniden tasarlaması gerektiğini savunuyor.
Yapay zeka vaatleri ve ilk şüphe
ChatGPT’nin 2022’nin sonunda hayatımıza girmesinin ardından üniversiteler, üretime dayalı yapay zekanın değerlendirmeleri geçebilecek kadar gelişmiş olup olmadığını ve öğrencilerin sınavları atlatmak için bunu kolayca kullanıp kullanamayacağını belirlemeye çalıştı. Bu dönemde yapay zeka şirketlerinden, araçların “çeşitli profesyonel ve akademik ölçütlerde insan seviyesinde performans” gösterdiğini öne süren bazı iddialar geldi ve bazı manşetler yapay zekanın ABD bar sınavlarını geçtiğine dair iddialarla süsüldü.
Ancak ilk bulgular, üretime dayalı yapay zekanın her zaman bu beklentileri karşılayamadığını gösterdi. Araştırmacıların önceki çalışması, temel bir beceri olan kritik hukuki analizi gerektiren görevlerde modellerin zayıf performans gösterdiğini ortaya koydu. Başka bir deyişle, yapay zeka modellerinin gerçek bir hukuk öğrencisiyle hukuki analiz alanında rekabet etmesi gerçekten zor olurdu.
Yapay zeka modelleri ne kadar gelişirse gelişsin, bu durumun hala geçerli olup olmadığını öğrenmek istedik.
Araştırma ekibi
Araştırmanın yöntemi
Araştırmacıların 2023’te gerçekleştirdiği deney, üretime dayalı yapay zekayı gerçek bir Avustralya ceza hukuku sınavında test etti ve “üretime dayalı yapay zekanın [lisans düzeyinde] bir hukuk sınavı gibi entlektüel yükü yüksek görevlerde insanları yerine değiştirmeye yakın olmadığını” buldu. Araştırmacıların yeni çalışması bu deneyi yeniden değerlendirdi.
Bu kez beş yapay zeka sağlayıcısından dokuz modeli Wollongong Üniversitesi’ndeki iki zorunlu hukuk dersi üzerinde test etti. Modellerin çoğu, abonelikle kolayca erişilebiliyor. Öğrencilerin ceza hukuku ve tazminat konusunu içeren tazminat hukuku (tort law) final sınavı soruları hazırlandıktan sonra, her modelle aynı sınav kağıtlarına yanıt üretildi ve toplamda 18 yanıt oluşturuldu.
Modeller sınav sorularını ve yönlendirmeleri (prompt) aldı, ancak derslere özel not, ders kitabı veya özenle hazırlanmış hukuk materyalleri verilmedi. İnternet erişimleri vardı ve bazıları “gelişmiş akıl yürütme” özelliğine sahipti. Bu özellik yapay zekaya yanıt vermeden önce daha fazla zaman tanıyarak plan yapmasını, farklı yaklaşımları değerlendirmesini ve akıl yürütmesini gözden geçirmesini sağlıyor.
18 sınav kağıtından altısı konu koordinatörleri (araştırmanın yazarları) tarafından, geri kalan 12 tanesi ise gerçek öğrenci sınavları arasına karıştırılarak, yapay zeka modellerinin katılımı hakkında hiçbir şey bilmeyen asistanlar tarafından körlemesine değerlendirildi.
Ne bulundu?
2023’e kıyasla önemli bir gelişme kaydedildi. Ceza hukuku alanında yapay zeka kağıtları ortalama %76.3 alarak öğrencilerin %82.5’inin önüne geçti. Tazminat hukuku alanında ise ortalama %66 alarak öğrencilerin %61’inin önüne geçti. Dokuz sınav kağıtından yedisi, öğrencilerin %90’lık diliminin üzerinde veya bu düzeye eşit bir sıraya yerleşti.
Bu durum, 2023’teki ceza hukuku sonuçlarından belirgin bir ayrım gösteriyor; o yıl yapay zeka kağıtları ortalama %52.5 almış ve yaklaşık %22’lik dilimde yer almıştı.
Notlardan daha da önemlisi, modellerin değerlendirmenin bir bileşeni olan kurgusal hukuk senaryolarındaki performansıydı. 2023’te yapay zeka modelleri, bu senaryoların kritik analizinde açık bir zayıflık gösteriyordu. Yeni çalışmada ise bu zayıflık büyük ölçüde kaybolmuştu. Ceza hukuku alanında yapay zeka, öğrencilerin %59.6’sına karşı ortalama %76 ile çok daha iyi performans gösterdi. Tazminat hukuku alanında yapay zeka modelleri ve öğrenciler yaklaşık olarak aynı düzeydeyken, yapay zeka modelleri makale sorusunda önemli derecede daha iyi sonuç verdi.
Bu ne anlama geliyor?
Genel olarak çalışma, yapay zeka modellerinin artık öğrencilerin bunları kullanarak sınavı atlatabilecek kadar yetenekli hale geldiğini ve gözetimsiz değerlendirmelerin sonuçlarının dürüstlüğünü sorgulatabileceğini gösteriyor. Ancak bu, yapay zekanın güvenilir bir hukuk uzmanına dönüştüğü anlamına gelmiyor.
Çalışmadaki performans modeller ve dersler arasında belirgin şekilde değişiyordu. Aslında yapay zeka modellerinin pürüzlü, tutarsız yeteneklere sahip olduğunu tespit ettik. Bazı modeller bir derste mükemmel, diğerinde zayıf çalıştı. Güçlü analiz, zayıf atıflar, zayıf kaynak seçimi veya uydurma hukuki dayanaklarla bir arada bulunabiliyordu. Bazı modeller için hallucinasyon (uydurma) oranlarının daha düşük olduğunu belirledik, ancak aynı zamanda daha az kaynak attıf yaptıklarını da fark ettik.

Araştırmanın bize söyleyemedikleri
Sadece Avustralya’daki bir üniversitedeki iki hukuk dersini, 18 yapay zeka tarafından üretilen sınav kağıtı kullanarak test ettik. Sonuçlar diğer hukuk derslerinde (örneğin sözleşme hukuku) veya diğer disiplinlerde farklılık gösterebilir.
Yönlendirme (prompt) de önemli rol oynuyor. Yönlendirmeleri standartlaştırmaya çalıştık, ancak yanıtları gerçekçi uzunlukta tutmak için bazı değişiklikler yapmak zorunda kaldık. Ayrıca çalışma, modellerin performansının farklı yönlendirmeler, sürümler veya değerlendirm biçimleri boyunca tutarlı kalmayıp kalmayacağını değerlendirmedi.
Daha da önemlisi, asistanlara sağlanan tüm yönlendirmelere rağmen, sınav kağıtlarını değerlendirmek öznel yargılamadan etkileniyor.
Üniversiteler buna nasıl yanıt verebilir?
Günümüz iş piyasası mezunlardan yapay zeka ile sorumlu ve etkili bir şekilde çalışmalarını gerektiriyor. Ancak öğrencilerin hataları tespit etmek, zayıf yönlerini geliştirmek ve çıkt iyileştirmek için yeterli temel bilgi ve beceriye sahip olmaları gerekiyor. Yapay zekanın tek başına üretebileceğinden daha fazla değer ekleyemiyorlarsa, çalışmalarının değiştirilebilir olması muhtemel.
Tek bir sınav biçimi bu iki amaca aynı anda ulaşamaz. Üç tamamlayıcı yaklaşım öneriyoruz.
Amaç, öğrencilerin sonsuza kadar yapay zekadan uzak tutulabileceğini varsaymak ya da öğrenmeyi teknolojiye devretmek değil. Üniversiteler, öğrencilerin hâlâ bağımsız olarak ne yapabileceğini gösteren ve aynı zamanda onlara giderek yeteneklenen yapay zeka sistemlerini gözetme, sorgulama ve iyileştirme biçimlerini öğreten değerlendirmelere ihtiyaçiyor.
Araştırma ekibi
İlk olarak, bazı değerlendirmeler yapay zekadan arındırılmış ve yüz yüze gözetim altında olmalıdır. Bu, kampüs içi sınavlar, sözlü değerlendirmeler veya gözetimli problem çözmeyi içeriyor. Bu, öğrencilerin yapay zekanın nerede yanıltığını tanıyabilecek kadar yeterli bağımsız bilgi ve akıl yürütme yeteneğine sahip olduğunu güvence altına alıyor. Örneğin, ilk yıl hukukunda bu görevlerin değerlendirmenin büyük kısmını oluşturmasını öneriyoruz.
İkinci olarak, bazı değerlendirmeler bilinçli olarak yapay zeka ile işbirliğini gerektirmelidir. Ancak üniversiteler süreci, sadece cilalı son ürünü değil değerlendirmelidir. Bu, öğrencilerin yapay zeka modelleriyle işbirliği yapma becerilerini değerlendirmemiz gerektiği anlamına geliyor; örneğin neyi yönlendirdikleri, hangi kaynakları kontrol ettikleri, hangi hataları tespit ettikleri, neyi kabul edip neyi reddettikleri ve akıl yürütmeyi nasıl iyileştirdikleri gibi.
Üçüncü olarak, üniversiteler profesyonel pratiği yansıtan bir “bayrak” (relay) modeli kullanabilir. Bu yaklaşım iki sürüme sahip ve her biri iki aşamadan oluşuyor.
İnsan önceli sürümde öğrenciler gözetimli bir ortamda bir taslak sunar, ardından bunu iyileştirmek ve yeniden sunmak için yapay zeka ile işbirliği yapar.
Yapay zeka önceli sürümde ise öğrenciler yapay zeka ile işbirliği yapar ve taslaklarını sunar. Ardından, yapay zekaya erişimi olmadan, kendi bilgilerini ve kritik analizlerini kullanarak bunu eleştirmek, doğrulamak ve iyileştirmek için gözetimli bir ortamda kullanır ve çalışmalarını yeniden sunar.
Değerlendirenler, her sunumu ayrı ayrı puanlamalıdır. Bu, hem öğrencilerin hukuki bilgi ve becerilerini hem de yapay zeka ile işbirliği yapma becerilerini değerlendirmiş olur.
