Düzelti Ekibi ·
Yapay Zekâ Dedektörleri Güvenilir mi? Yanlış Pozitif Neden Olur?
Kısa cevap: İyi bir yapay zekâ dedektörü, eğitimde görmediği metinlerde de yapay zekâ yazısının büyük kısmını yakalar ve insan yazısını nadiren yanlış işaretler. Ama "nadiren" sıfır demek değildir: %1'lik bir yanlış pozitif oranı, 1.000 dürüst yazarın yaklaşık 10'unun haksız yere işaretlenmesi anlamına gelir. Bu yüzden dedektör sonucu bir başlangıç noktasıdır, tek başına kanıt değildir.
Yapay zekâ dedektörleri hakkındaki tartışma genelde iki uçta kalır: "her şeyi yakalıyor" ya da "hiçbir işe yaramıyor". İkisi de yanlış. Bir dedektörün ne kadar güvenilir olduğu, nasıl test edildiğine, hangi metin türüne baktığınıza ve sonucu nasıl okuduğunuza bağlıdır. Bu yazıda üçünü de sırayla açıyoruz.
Bir dedektör ne yapar, ne yapmaz?
Dedektör, metnin yazarını görmez. Metindeki yazım örüntülerinin, yapay zekâ ile üretilmiş metinlerde sık görülen kalıplara ne kadar benzediğini ölçer: kelime seçimi, cümle ritmi, bağlaçların dağılımı, paragrafların kuruluşu gibi.
| Dedektör şunu söyler | Dedektör şunu söylemez |
|---|---|
| "Bu metnin örüntüleri yapay zekâ metinlerine benziyor." | "Bu metni yapay zekâ yazdı." |
| "Sinyal en çok şu cümlelerde yoğunlaşıyor." | "Metnin %70'i yapay zekâ ile yazıldı." |
| "Bu metin için sinyal belirsiz." | "Bu öğrenci kopya çekti." |
Bu ayrım küçük görünür ama her şey ona dayanır. Örüntü benzerliği bir ipucudur; yazarlık ise bir olgudur ve onu kanıtlamak için başka bilgi gerekir.
İki hata türü: hangisi daha pahalı?
Her dedektör iki yönde hata yapabilir:
| Hata | Ne olur? | Kimin zararına? |
|---|---|---|
| Yanlış pozitif | İnsan yazısı "yapay zekâ" olarak işaretlenir. | Dürüst yazar. Haksız suçlama, not kaybı, güven kaybı. |
| Yanlış negatif | Yapay zekâ yazısı "insan" olarak geçer. | Değerlendirmenin adaleti. Ama kimse haksız yere suçlanmaz. |
Eğitimde ve yayıncılıkta yanlış pozitif çok daha pahalıdır. Bu yüzden iyi tasarlanmış bir dedektör, yakalama oranından biraz feda edip yanlış pozitifi düşük tutmayı seçer. Düzelti Dedektör'de "Yüksek" etiketinin eşiği tam olarak bu mantıkla, insan metinlerinin en fazla %1'ini işaretleyecek şekilde ayarlandı.
Doğruluk iddiası nasıl okunur? Sormanız gereken üç soru
"%99 doğruluk" gibi tek bir sayı neredeyse hiçbir şey söylemez. Bir dedektörün doğruluk iddiasını okurken şu üç soruyu sorun:
- Test metinleri eğitimde kullanıldı mı? Model, eğitimde gördüğü metinlerde neredeyse kusursuz çalışır. Anlamlı olan, hiç görmediği metinlerdeki başarıdır.
- İnsan metinleri ne zaman yazıldı? Yanlış pozitif oranını ölçmek için kullanılan insan metinleri, yapay zekâ araçlarının yaygınlaşmasından önce yazılmış olmalı. Aksi hâlde "insan" setinde yapay zekâ metni bulunabilir.
- Rakam, kullanıcının gördüğü etiketle mi hesaplandı? Bazı raporlar teknik bir eşikle ölçülür, ürün ise farklı bir eşikle etiket gösterir. İkisi aynı değilse rakam, ekranda gördüğünüz sonucu anlatmaz.
Biz bu üç soruyu kendi dedektörümüze sorduk ve cevapları Dedektör Doğruluk Raporu'nda yayımladık:
| Test | Sonuç |
|---|---|
| Eğitimde hiç görülmemiş 5 modelin ürettiği 348 Türkçe metin | %96,6'sı "Yüksek" |
| ChatGPT öncesine ait, eşik ayarında kullanılmamış 1.000 insan metni | %0,8'i yanlışlıkla "Yüksek" |
Yanlış pozitif neden olur?
İnsan yazısının yapay zekâ yazısına benzediği durumlar vardır. Ölçümlerimizde ve araştırmalarda öne çıkan dört durum:
1. Kalıplaşmış türler
Bazı metin türleri doğası gereği kalıp doludur: kitap tanıtımları, basın bültenleri, kurumsal duyurular, standart özetler. Ölçümümüzde en çok yanlış işaretlenen insan metinleri yayınevi kitap tanıtımlarıydı (%1,2); tez özetlerinde oran %0,3'tü.
2. Kısa metinler
Metin kısaldıkça dedektörün dayanabileceği örüntü azalır. 150 kelimeden kısa insan metinlerinde yanlış pozitif oranı %1,4'e çıktı; 400 kelimenin üstündeki 165 insan metninin hiçbiri "Yüksek" almadı.
3. Sade ve öngörülebilir dil
Stanford'dan araştırmacıların 2023'te yayımladığı bir çalışma, İngilizce dedektörlerin ana dili İngilizce olmayan yazarların metinlerinin yarısından fazlasını yapay zekâ olarak işaretlediğini gösterdi (Liang ve ark., 2023, Patterns). Sebep: sade, sık kullanılan kelimelerle yazılmış metin, dedektörün "öngörülebilir" bulduğu metindir. Bu bulgu İngilizce için ölçüldü, ama ders evrenseldir: yalın yazmak, yapay zekâ ile yazmak demek değildir.
4. Düzenleme araçları
Bir metni genel amaçlı bir sohbet aracına baştan sona yeniden yazdırmak, insan metnine yapay zekâ örüntüsü taşıyabilir: cümlelerin kuruluşu artık sizin değil, modelindir. Metnin kuruluşuna dokunmayan araçlar bu riski çok daha az taşır. Düzelti'nin yazım denetimi cümleyi yeniden kurmaz, yalnızca hatalı kelimeyi işaretler; Yeniden Yaz da tüm metni değil, tonu belirleyen birkaç kelimeyi değiştirir ve her değişikliği onayınıza sunar.
%0,8 bir sınıfta ne demek?
Oranlar soyut kalabilir. Somutlaştıralım:
| Senaryo | Değerlendirilen metin | Beklenen yanlış "Yüksek" |
|---|---|---|
| 40 kişilik sınıf, dönemde 1 ödev | 40 | 0 ile 1 arası |
| 40 kişilik sınıf, dönemde 10 ödev | 400 | yaklaşık 3 |
| Bir fakültede yılda 5.000 ödev | 5.000 | yaklaşık 40 |
Tek bir metin için %0,8 küçük bir risktir. Ama çok sayıda metin taranınca birkaç dürüst öğrencinin işaretlenmesi neredeyse kaçınılmazdır. Bu yüzden her "Yüksek" sonucun ardından bir konuşma gelmelidir, bir karar değil. Ne yapılacağını ödevde yapay zekâ şüphesi rehberimizde adım adım anlattık.
Sonucu doğru okumak için kontrol listesi
- Etiketi tek başına okumayın. "Belirsiz" bir karar değil, "bilmiyorum" demektir.
- Cümle renklerine bakın. Sinyal tüm metne mi yayılmış, yoksa bir paragrafta mı yoğunlaşmış?
- Metnin türünü ve uzunluğunu hesaba katın. Kısa ve kalıplaşmış metinlerde sonuca daha temkinli yaklaşın.
- Başka kanıt arayın. Taslaklar, sürüm geçmişi, yazarın önceki metinleri ve yazarla konuşmak her zaman daha güçlü kanıttır.
Özet
Yapay zekâ dedektörleri işe yarar ama yanılmaz değildir. Güvenilirliği tek bir yüzdeyle değil, nasıl test edildiğiyle ölçün: görülmemiş metinler, ChatGPT öncesi insan metinleri ve ürünün gösterdiği etiketle hesaplanmış rakamlar. Yanlış pozitif en çok kısa, kalıplaşmış ve sade metinlerde görülür. Sonucu bir ipucu olarak okuyun; kararı bağlamı bilen kişi verir.
Türkçe bir metni taramak için Türkçe AI Dedektörü'nü ücretsiz deneyebilir, bir metnin yapay zekâ ile yazıldığını hangi işaretlerden anlayabileceğinizi bu rehberde okuyabilirsiniz.