rung.

Türkçe konuşanlar için · İngilizce ölçüm aleti

Kayıtların yerinde

Tekrar hoş geldin.

Bıraktığın yerden devam ediyorsun. Bir kayıt, yazıldığı gün neyse o kalıyor.

Şifreni mi unuttun?

Hesabın yok mu? Hesap oluştur

Aletin ölçeği: beş bant, A1’den C1’e. Yanan basamak, bu sayfa açılırken gerçek K0 katmanının aşağıdaki cümleyi ölçtüğü yer. Her bant aynı ölçekte kalıyor, o yüzden altı ay sonraki ölçüm bugünküyle karşılaştırılabiliyor.

K0 · deterministik · model yok5 bulgu

I am agree1 with your suggestion about the meeting of tomorrow2. Thanks for the informations3 you sent me, i4 recieved5 them yesterday.

Bu cümle sayfa açılırken gerçek K0 katmanından geçti — maket değil. Model çağrısı yok: aynı metin her zaman aynı beş bulguyu veriyor, ve her bulgu metinde bir yere çapalı. Motor havada hata söyleyemiyor.

Alet nasıl çalışıyor ↓

Nasıl çalışıyor

Beş adımda, baştan sona.

Aşağıdaki her şey bu sayfa açılırken hesaplandı ya da veritabanından okundu. Ekranda maket bir sayı yok.

Yazarsın. Alet hemen konuşmaz.

Bir görev seçip İngilizce yazıyorsun. Metnine dokunan ilk katman K0: yazım, dil bilgisi kalıpları, kelime bandı ve cümle karmaşıklığı. Hepsi deterministic (belirlenimci) — model çağrısı yok, aynı metin her zaman aynı sonucu veriyor. Yukarıdaki cümlenin beş bulgusu aşağıda, motorun kendi açıklamalarıyla duruyor.

1I am agreeI agreeTürkçe kaynaklı · kalıp

"Katılıyorum" Türkçede sıfat gibi kurulur; İngilizcede "agree" zaten fiil, yanına "am" gelmez.

2the meeting of tomorrowtomorrow's meetingTürkçe kaynaklı · sözcük sırası

"yarınki toplantı" birebir çevrilmiş. İngilizcede iyelik yapısı doğal olan: "tomorrow's meeting".

3informationsinformationSözcük · sayılabilirlik

"information" İngilizcede sayılamayan bir isim, çoğul eki almaz. Türkçede karşılığı sayılabildiği için sık yapılıyor — "bilgiler", "tavsiyeler".

4iIMekanik · büyük harf

İngilizcede birinci tekil şahıs zamiri her yerde büyük yazılır. Türkçede "ben" cümle ortasında küçük kaldığı için sık atlanıyor.

5recievedreceivedMekanik · yazım

Sözlükte yok. Önerilenler: received, relieved.

K0 motorunun bu sayfa çizilirken ürettiği beş bulgu.

Her bulgu sabit bir yere yazılır.

Bulunan her şey, önceden kilitlenmiş bir taxonomy (taksonomi) içindeki tek bir alt kategoriye yazılıyor: beş aile, yirmi bir alt kategori. Sebep basit — model bugün “yanlış edat”, yarın “preposition error” derse hiçbir şey takip edilemez. Yeni alt kategori eklenebilir; var olanın adı değişemez. Yukarıdaki kadranın çevresindeki yirmi bir ışın tam olarak bunlar.

Türkçe kaynaklı 4

artikel düşürmebirebir çevirisözcük sırasıkalıp

Gramer 7

zamanözne-yüklem uyumuartikeledatçoğulkipsözcük sırası

Sözcük 4

yanlış kelimeeşdizimsayılabilirlikkayıt uyumu

Mekanik 3

yazımnoktalamabüyük harf

Söylem 3

bağlantıgereksiz tekrarbelirsizlik

Listeyi tek bir kaynak belirliyor; oraya bir alt kategori eklendiğinde kadrana bir ışın ekleniyor.

Beş katman. Üçünde model çalışmıyor.

Metin beş katmandan sırayla geçiyor ve yalnızca yorum gerektiren kısım modele gidiyor. Neyin modele verilmeyeceğini bilmek, model çağırabilmekten daha zor. Modele giden kısım da serbest konuşmuyor: sabit taksonomiye ve zorunlu bir şemaya yazmak zorunda.

K0DeterministikYazım, kurallar, kelime bandı, karmaşıklıkyapay zekâ yok
K1Model çıkarımıSabit taksonomiye ve zorunlu şemaya yazmak zorundamodel
K2İkinci geçişHer bulguya bağımsız olarak “bu gerçekten hata mı”model
K3Seviyeye göre süzmeA1’e üç bulgu, C1’e hepsi — aynı metin, farklı geri bildirimyapay zekâ yok
K4Sürümlü kayıtModel kimliği ve prompt sürümü kayda yazılıryapay zekâ yok

Mor işaretli iki satır modele giden katmanlar.

Kayıt, yazıldığı gün neyse o kalıyor.

Her analiz; metni, bulguları, onu üreten model kimliğini ve prompt version (istem sürümü) bilgisini birlikte saklıyor. Kayıtların değişmezliği koda değil veritabanına yazılı: yazılmış bir metni güncelleme denemesi veritabanı seviyesinde geri çevriliyor. Aynı metni yeniden analiz edersen yeni bir kayıt açılıyor, eskisi olduğu yerde kalıyor.

Kayıt değiştirilemez

metin
yazdığın hâliyle
bulgular
konumuyla birlikte
model kimliği
hangi model buldu
prompt version (istem sürümü)
hangi yönergeyle
timestamp (zaman damgası)
ne zaman

Beşi birlikte yazılıyor, beşi birlikte kalıyor.

Aylar boyunca aynı ölçek.

Her kaydın seviyesi dört deterministik sinyalden hesaplanıyor: kelime bandı, cümle karmaşıklığı, hata yoğunluğu ve hata türü. Hiçbiri modele sorulmuyor; hepsi aynı metinde her zaman aynı sonucu veriyor. Altı ay sonraki ölçüm bugünküyle aynı ölçeği kullanıyor — karşılaştırmanın anlamı buradan geliyor. Aşağıdakiler yukarıdaki cümlenin gerçek sinyalleri.

Kelime bandıA2
Farklı kelimelerin %15'i temel bandın dışında
Cümle karmaşıklığıA2
Yan cümle 0.00 · ortalama 11.0 kelime
Hata yoğunluğuA1
100 kelimede 22.7 bulgu
Hata türüB1
2 temel · 1 nüans

Dört sinyal, tek skor: 0,94 / 4. Kadranın göbeğinde duran sayı bu. İki cümle bir seviye ölçümü için kısa; motor bunu kendisi söylüyor ve tahmini oynak olarak işaretliyor. Ölçek uzun metinde de aynı ölçek.

Ve kendi doğruluğunu ölçüp yayımlıyor.

%100 doğruluk mümkün değil — dil modelleri olasılıksal çalışıyor. Yapılabilecek tek şey ölçmek, ve ölçtüğünü yayımlamak. Aşağıdaki sayılar sabit yazılmadı; son ölçüm koşumundan, gold set (altın küme) üstünden okundu.

Ana ölçüt false alarm (yanlış alarm): doğru olan bir cümleyi “düzeltmek”. Bir hatayı kaçırmak telafi edilir, bu edilmez.

Yanlış alarm%4,9ana ölçüt
Yakalama%95,141 beklenen hata
İsabet%95,141 bulgu
Ölçülen örnek41altın kümeden

bu koşumda 41 örnek ölçüldü · prompt v1 · çaba low · K1+K2

Bugün yaz. Altı ay sonra aynı ölçekte bak.

Yukarıdaki forma dön ↑