Ajanları Test Etmek: Hakkını Veren Bir Değerlendirme Seti Kurmak
Yayına çıkan ajanları pilotta çürüyenlerden ayıran soru basit: dünkü değişikliğin işleri iyileştirdiğini nereden biliyorsunuz? Cevabı olmadan her prompt düzenlemesi tahmindir ve her gerileme bir müşteri tarafından keşfedilir.
Değerlendirme seti bu sorunun cevabıdır ve bir platform gerektirmez. Bir dosyada elli vaka, onları koşturan bir betik ve vaka başına bir notlama kuralı, herhangi bir lider tablosundan çok şey söyler; çünkü bunlar sizin vakalarınızdır.
Bir vaka neye benzer#
Vaka; bir girdi, dünyanın başlangıç durumu ve kontrol edilebilir bir beklentidir. Beklenti neredeyse hiçbir zaman birebir metin değildir — bir ajan birkaç farklı ifadeyle doğru olabilir. Bunun yerine sonucu notlayın: 4471 numaralı siparişle iade aracını çağırdı mı; son cevap doğru teslim tarihini içeriyor mu; gerektiği gibi eylemeyi reddedip soru sordu mu. Düzyazı kalitesinin önemli olduğu yerlerde model tarafından notlanan bir ölçüt listesi kabul edilebilir; ama birkaç açık kritere indirin ve arada bir notlayanı elle kontrol edin.
Her vakanın ihtiyaç duyduğu durumu — sabit veriyi — vakayla birlikte saklayın. Canlı veri yüzünden yalnız salı günü geçen bir test, test değildir.
Elli vaka ve nereden geldikleri#
| Kaynak | Yaklaşık adet | Neden |
|---|---|---|
| Kayıtlardan sık gelen gerçek istekler | 20 | Gündelik yolu korur |
| Bilinen geçmiş hatalar | 10 | Gerilemelerin geri dönmesini engeller |
| Belirsiz ya da eksik tanımlı girdiler | 8 | Tahmin değil, soru sormalı |
| Reddetmesi gereken vakalar | 6 | Kapsam dışı, yetkisiz, güvensiz |
| Boş ya da bozuk araç sonuçları | 6 | Gerçekte en sık yaşanan olay |
Yolu değil sonucu notlayın#
Aynı doğru sonuca farklı yollardan varan iki koşu da doğrudur ve tek bir döküm dayatan test paketi sebepsiz yere sürekli kırılır. Neyin değiştiğini ve neyin söylendiğini doğrulayın: yan etkisi olan araç çağrıları, son cevabın kilit olguları, insan kapısının istenip istenmediği. Tam izi hata ayıklama için saklayın ama üzerine doğrulama yazmayın; yoksa her prompt iyileştirmesi yüz hata gibi görünür.
Zaman içinde izlenecek dört sayı#
- Tüm sette görev başarı oranı ve ayrıca reddetmesi gereken alt kümede.
- Dayanaksız iddia oranı — getirilen kanıtta olmayan olgular içeren cevaplar.
- Koşu başına maliyet ve gecikmenin ortancası ve 95. yüzdeliği.
- İnsan müdahale oranı: bir kişinin ne sıklıkla ve neden devreye girdiği.
Hattınızda koşturun, yayından sonra da#
Seti; prompt, araç, model sürümü ya da getirim yapılandırması her değiştiğinde koşturun — davranışı değiştiren yalnız bu dördü vardır ve dördü de sanılandan sık değişir. Yayından sonra gerçek trafikten örneklemeye devam edin: günde birkaç koşu seçin, elle notlayın ve şaşırtıcı olan her şeyi sete ekleyin. Büyümeyi bırakan bir değerlendirme seti, genelde bir çeyrek içinde kullanıcılarınızı temsil etmeyi bırakır.
Sık sorulan sorular
Başlamak için kaç vaka gerekir?
Elli, gerçek gerilemeleri yakalamaya yeter ve birkaç günde yazılacak kadar azdır. Yirmi başlamak için yeterlidir. Sayı, zor kategorileri kapsamaktan çok daha az önemlidir: belirsiz girdiler, reddetmesi gereken vakalar ve boş araç sonuçları.
Çıktıları notlamak için model kullanabilir miyim?
Evet, dikkatle. Cevabın iyi olup olmadığını sormak yerine açık kriterler verin, ölçüt listesini kısa tutun ve düzenli olarak elle örnek kontrol edin. Model notlayıcılar kayar ve kaymış bir notlayıcı bir gerilemeyi seve seve onaylar.
Değerlendirme dağıtımı engellemeli mi?
Güvenlik açısından kritik alt kümede engellesin — reddetmesi gereken vakalar ve geri alınamaz eylemleri içeren her şey. Genel kalitede eğilimi izleyin ve düşüşte otomatik engel yerine bir insan kararı isteyin; küçük hareket gürültü olabilir.
ajan değerlendirmeajan testillm değerlendirme setillm gerileme testiajan kalite metrikleri