Kalibrasyon

Güven eşiğini seçmek

Jev her cevapla birlikte bir olasılık döner ve lansmana yönelik en yüksek sesli eleştiri, kalibrasyon iddiasını destekleyen kamuya açık hiçbir şey olmaması. Güvenilirlik eğrisi yok, beklenen kalibrasyon hatası yok, eğitim yöntemini mimariden ayıran bir ablasyon yok. Eleştiri yerinde. Ve yayına çıkmanıza da engel değil; yeter ki o sayıyı bir söz gibi görmeyi bırakıp sizin sahiplendiğiniz bir eşik gibi görmeye başlayın.

Kalibre bir olasılık ne anlama gelmeli

0,70 diyen kalibre bir model, 0,70 dediği bütün vakalarda yaklaşık yüzde 70 oranında haklı olmalı. Bu, doğruluktan farklı bir özellik, ve yazılımın karar hakkında karar vermesini sağlayan özellik bu: aksiyon al, çekil, ya da devret.

Sıradan dil modelleri bu konuda kötüdür. Bir modele ne kadar emin olduğunu sorarsınız, size güven biçiminde ama doğru olmakla ilişkisi bulunmayan bir sayı döner. System One modellerinin iddiası, olasılığın yük taşıdığı. Boşluk ise bu iddianın kamuya gösterilmemiş olması, ve sağlayıcının yüksek güvenle yanılmanın mümkün olmaya devam ettiğini açıkça söylemiş olması.

Öyleyse kendi verinizde ölçün

Faydalı tepki, başkasının güvenilirlik eğrisini beklemek değil. Kendi trafiğinizde, kendi sorunuz için kendi eğrinizi çıkarmak. Kalibrasyon soyut olarak bir modelin özelliği değildir; bir modelin bir dağılım üzerindeki özelliğidir, ve sizin dağılımınız Amazon ESCI değil.

Yöntem hiç gösterişli değil. Her çağrı için cevabı ve olasılığı loglayın. Birkaç yüz tanesini elle etiketleyin. Güvene göre kovalara ayırıp her kovayı gerçekte gözlemlediğiniz doğrulukla karşılaştırın.

confidence   n      accuracy
0.50-0.60    412    0.58
0.60-0.70    690    0.71
0.70-0.80   1103    0.79
0.80-0.90   2204    0.88
0.90-1.00   5817    0.96

Bu tablo aradığınız biçimdir, bizim trafiğimizden gerçek sayılar değil. Kovalarınız köşegeni takip ediyorsa olasılık size bir şey söylüyor demektir ve oradan bir eşik seçebilirsiniz. Etmiyorsa, bir eşikten daha değerli bir şey öğrenmişsiniz demektir: sizin sorunuzda o sayı süstür ve başka bir şeye bakarak kapı koymalısınız.

Eşik aslında neyi koruyor

Bizimki tek bir soruda duruyor. Asistan, ziyaretçinin mesajının gerçekten bir ürün araması olup olmadığını sınıflandırıyor ve arama ancak SEARCH hem kazanırsa hem de 0,75'i geçerse ilerliyor.

a = answers['intent']
allowed = a['choice'] == 'SEARCH' and a['probabilities']['SEARCH'] >= .75

Bunun ne olmadığına dikkat edin. Sonuçlar üzerinde bir kalite filtresi değil. Aksiyon alınıp alınmayacağına dair bir kapı, ve arkasındaki asimetri çok belirgin: başkasının mağazasında kendinden emin bir yanlış arama çalıştırmak, müşteriden yeniden ifade etmesini istemekten daha kötü. Kötü bir arama, bir markanın altında bir yabancıya yanlış ürünleri gösterir. Açıklayıcı bir soru sadece bir tur maliyetindedir.

Sayıyı varsayılandan değil bu asimetriden seçin. Çekilmek ucuz ve yanılmak pahalıysa yüksek kapı koyun. Her çekilme kayıp satış demekse çekilmek pahalıdır, alçak kapı koyup güvenliği başka yere taşıyın. Eşik, ondalık işareti takmış bir iş kararıdır.

Yalnızca hak eden sorulara kapı koyun

Her cevabı eşiğe bağlamıyoruz. Bir turdaki tipli soruların çoğunda kazanan seçenek doğrudan alınıyor, çünkü onları biraz yanlış almanın bedeli yanlış bir aksiyon değil biraz daha kötü bir sonuç. Mesajın önceki aramayı sürdürüp sürdürmediği, müşterinin alternatif isteyip istemediği, bütçenin hangi para biriminde olduğu: bunlar zarifçe bozulur.

Her şeye kapı koymak, hiçbir şeye koymamaktan kötü olurdu. Her kapının başarısız olduğunda ne olacağına dair bir dalı olmalı, ve kimsenin üzerinde düşünmediği bir yığın çekilme yolu, asistanın hiçbir şeye cevap veremez hale gelmesinin yoludur. Aksiyon alınıp alınmayacağına karar veren tek soruya konan tek kapı, değerin çoğunu taşıyor.

Modele belirsizliği koyacak bir yer verin

Eşik düşük güveni yakalar. Modelin iyi bir cevabı olmayan bir soruyu kendinden emin şekilde cevapladığı durumda işe yaramaz, ki bu da sunduğunuz seçenekler doğru olanı içermediğinde her seferinde olur.

Öyleyse onu da sunun. Sıralama adaylarımız, mevcut kısıtları hiçbir adayın karşılamadığı anlamına gelen açık bir NONE içeriyor; niyet sorusunda da SEARCH, SUPPORT ve OTHER'ın yanında bir UNCLEAR var. Yanlış seçenekler arasından seçmeye zorlanan model birini seçer, üstelik bunu kendinden emin görünerek yapar. Çekilmek, yalnızca cevabın dışında değil içinde de ifade edilebilir olmalı.

Dürüst özet

Jev'in olasılıklarının iyi kalibre olduğuna dair yayınlanmış bir kanıt yok. Olmadığına dair de yok, ve mekanizma en azından bunun için doğru biçimde. Yol, iddiaya inanmak ya da inanmamaktan geçmiyor. Ona ihtiyaç duymayı bırakmaktan geçiyor: olasılıkları loglayın, bir örneklem etiketleyin, kovaları kontrol edin ve kendi sayılarınızla savunabileceğiniz bir eşik koyun.

Navlu, e-ticaret mağazaları için konuşma tabanlı bir ürün keşif asistanıdır. Tur başına tek bir Jev çağrısı konuşma hakkında sekiz ila on altı tipli soruyu yanıtlar; tek bir güven kapısı aramanın çalışıp çalışmayacağına karar verir.

← Tüm yazılar