Türkçe AI Dedektörü · Dedektör 1.3 · Ölçüm: Ekim 2026
Dedektör Doğruluk Raporu
Bu sayfa Dedektör 1.3’ün nasıl test edildiğini, hangi metinlerde iyi çalıştığını ve nerede zorlandığını anlatır. Bütün rakamlar, ürünün ekranda gösterdiği Düşük, Belirsiz ve Yüksek etiketleriyle aynı eşiklerle hesaplandı.
Kısa cevap
Dedektör 1.3, eğitimde hiç görmediği beş modelin ürettiği 348 Türkçe yapay zekâ metninin %96,6’sına Yüksek etiketi verdi; yalnızca birini Düşük olarak gösterdi. Eşik ayarında kullanılmamış 1.000 insan metninin %0,8’ini ise yanlışlıkla Yüksek olarak işaretledi. Kısa metinlerde ve metin parçalarında hata payı artar; sonuç tek başına kanıt değildir.
Yöntem
Nasıl test ettik?
Bir dedektörün doğruluğu, eğitimde hiç görmediği metinlerle ölçülmediği sürece anlamsızdır. Bu yüzden iki ayrı test seti kullandık ve ikisi de eğitimden kilitlenerek dışarıda tutuldu.
- İnsan metinleri: 1.000 metin
- ChatGPT’nin çıktığı Kasım 2022’den önce yayımlanmış gazete köşe yazıları, YÖK Tez Merkezi’ndeki tez özetleri ve yayınevi kitap tanıtımları; her türden yaklaşık üçte bir. Bu metinler ne eğitimde ne de eşiklerin belirlenmesinde kullanıldı. Yanlış pozitif oranı bu setten gelir.
- Yapay zekâ metinleri: 348 metin
- OpenAI ve Google’ın beş güncel modeliyle üretildi; bu modellerin hiçbiri eğitim verisinde yok. Dört alan (akademik, blog, forum, haber) ve üç uzunluk tipi (kısa cevap, serbest metin, 800–2.000 kelimelik uzun yazı) kapsanıyor. Uzunluk 46 ile 2.758 kelime arasında.
- Eşikler ayrı bir setle belirlendi
- Yüksek etiketinin eşiği, ayrı bir 1.000 insan ve 1.000 yapay zekâ metni üzerinde insan metinlerinin en fazla %1’ini işaretleyecek şekilde ayarlandı. Yukarıdaki iki test seti bu ayarda kullanılmadı.
Yanlış pozitif
İnsan yazısı yanlışlıkla işaretlenir mi?
Nadiren, ama olur. 1.000 insan metninin 8’i (%0,8) Yüksek etiketi aldı. %95 güven aralığı %0,4 ile %1,6 arasıdır. Metinlerin %5,6’sı Belirsiz bandına düştü; bu bant bilinçli olarak geniş tutuldu ki kararsız metinler Yüksek olarak gösterilmesin.
| Dilim | Metin | Düşük | Belirsiz | Yüksek |
|---|---|---|---|---|
| Tüm insan metinleri1.000 metin | 1.000 | %93,6 | %5,6 | %0,8 |
| Türe göre | ||||
| Köşe yazıları333 metin | 333 | %95,5 | %3,6 | %0,9 |
| Tez özetleri (YÖK Tez)334 metin | 334 | %94,6 | %5,1 | %0,3 |
| Yayınevi kitap tanıtımları333 metin | 333 | %90,7 | %8,1 | %1,2 |
| Uzunluğa göre | ||||
| 150 kelimeden kısa285 metin | 285 | %90,2 | %8,4 | %1,4 |
| 150–400 kelime550 metin | 550 | %94,4 | %4,9 | %0,7 |
| 400 kelime ve üstü165 metin | 165 | %97,0 | %3,0 | %0,0 |
Kalıplaşmış, tanıtım dili taşıyan metinler (yayınevi kitap tanıtımları) ile kısa metinler en çok yanlış işaretlenen türlerdir. 400 kelimenin üstündeki 165 insan metninin hiçbiri Yüksek almadı.
Yakalama oranı
Yapay zekâ metinlerinin ne kadarını yakalıyor?
348 metnin 336’sı (%96,6) Yüksek etiketi aldı; %95 güven aralığı %94,1 ile %98,0 arasıdır. 11 metin Belirsiz kaldı, yalnızca 1 metin Düşük olarak gösterildi. Sonuç uzunluktan pek etkilenmiyor: kısa cevaplarda da 2.000 kelimelik yazılarda da oran %96 civarında. En zorlu model GPT-5.5 (%91,7), en zorlu alan akademik metinler (%93,4).
| Dilim | Metin | Düşük | Belirsiz | Yüksek |
|---|---|---|---|---|
| Tüm yapay zekâ metinleri348 metin | 348 | %0,3 | %3,2 | %96,6 |
| Uzunluğa göre | ||||
| Kısa cevap136 metin | 136 | %0,0 | %3,7 | %96,3 |
| Serbest metin114 metin | 114 | %0,9 | %2,6 | %96,5 |
| Uzun yazı (800–2.000 kelime)98 metin | 98 | %0,0 | %3,1 | %96,9 |
| Üreten modele göre | ||||
| Gemini 3 Flash (ön izleme)75 metin | 75 | %0,0 | %0,0 | %100 |
| Gemini 3.1 Flash-Lite76 metin | 76 | %0,0 | %2,6 | %97,4 |
| GPT-6 Astra62 metin | 62 | %0,0 | %1,6 | %98,4 |
| GPT-5.6 Terra63 metin | 63 | %0,0 | %4,8 | %95,2 |
| GPT-5.572 metin | 72 | %1,4 | %6,9 | %91,7 |
| Alana göre | ||||
| Haber88 metin | 88 | %0,0 | %0,0 | %100 |
| Forum85 metin | 85 | %0,0 | %3,5 | %96,5 |
| Blog84 metin | 84 | %0,0 | %3,6 | %96,4 |
| Akademik91 metin | 91 | %1,1 | %5,5 | %93,4 |
Cümle renkleri
Karışık metinlerde cümle vurgusu ne kadar isabetli?
İnsan ve yapay zekâ paragraflarını aynı belgede birleştirdiğimiz 160 test belgesinde, cümle renklerinin yapay zekâ cümlelerini insan cümlelerinden ayırma başarısı (AUC) 0,93 çıktı. İnsan cümlelerinin %2,9’u kırmızıya boyandı. Her cümle, çevresindeki yaklaşık 96 token’lık bağlamla birlikte puanlanır.
Bu belgeler gerçek karışık yazarlık örnekleri değil, test için birleştirildi. Gerçek hayatta düzenlenmiş paragraflar daha zor ayırt edilir.
Sınırlar
Nerede zorlanıyor?
Metin parçaları
Uzun bir yapay zekâ metninden kesilmiş, girişi ve sonucu olmayan orta parçalarda yakalama belirgin biçimde düşer. İç ölçümümüzde bu tür 138 parçanın yaklaşık üçte ikisi yakalandı.
Yeniden yazılmış metinler
Bir insanın yoğun biçimde düzenlediği veya başka bir araçla yeniden yazdırılmış yapay zekâ metinleri için yayımlanmış bir ölçümümüz henüz yok. Bu metinlerde sinyalin zayıflaması beklenir.
Kısa metinler
150 kelimenin altındaki insan metinlerinde yanlış pozitif oranı %1,4’e çıkar. Kısa metinlerde sonucu daha temkinli okuyun.
Test edilmemiş modeller
Test seti OpenAI ve Google modelleriyle üretildi. Diğer üreticilerin modelleri ve gelecekteki sürümler farklı sonuç verebilir; yeni modeller çıktıkça seti genişletiyoruz.
Bu rakamlar ne söylemez?
%0,8 yanlış pozitif oranı, 1.000 dürüst yazarın yaklaşık 8’inin haksız yere işaretlenebileceği anlamına gelir. Tek bir metin için bu, bir kişiyi suçlamaya yetecek bir kesinlik değildir.
Dedektör sonucu akademik, hukuki veya disiplin süreçlerinde tek başına kanıt olarak kullanılmamalıdır. Taslaklar, yazım geçmişi ve yazarla konuşmak her zaman daha güçlü kanıttır.
Sıkça Sorulan Sorular
Türkçe AI dedektörünün yanlış pozitif oranı nedir?
Dedektör hangi yapay zekâ modelleriyle test edildi?
Test metinleri eğitimde kullanıldı mı?
Yeniden yazılmış yapay zekâ metinlerini yakalıyor mu?
Ölçüm tarihi ve son güncelleme: · Dedektör 1.3