Menguji AI Agent: Set Evaluasi yang Sepadan Usahanya
Pertanyaan yang memisahkan agent yang tayang dari agent yang membusuk di pilot itu sederhana: bagaimana Anda tahu perubahan kemarin membuatnya lebih baik? Tanpa jawaban, tiap suntingan prompt adalah tebakan dan tiap regresi ditemukan pelanggan.
Set evaluasi adalah jawabannya, dan itu tak butuh platform. Lima puluh kasus dalam satu berkas, satu skrip yang menjalankannya, dan satu aturan penilaian per kasus akan memberi tahu lebih banyak daripada papan peringkat mana pun, karena itu kasus Anda.
Seperti apa satu kasus#
Kasus adalah masukan, keadaan awal dunia, dan ekspektasi yang bisa diperiksa. Ekspektasinya hampir tak pernah berupa string persis — agent bisa benar dalam beberapa rumusan. Nilailah hasilnya: apakah ia memanggil alat pengembalian dana dengan pesanan 4471; apakah jawaban akhir memuat tanggal yang benar; apakah ia menolak dan bertanya, sebagaimana seharusnya.
Simpan keadaan yang dibutuhkan tiap kasus bersama kasusnya. Uji yang hanya lolos pada hari Selasa karena data langsung bukanlah uji.
Lima puluh kasus dan asalnya#
| Sumber | Kira-kira berapa | Kenapa |
|---|---|---|
| Permintaan nyata yang sering dari log | 20 | Melindungi jalur harian |
| Kegagalan lampau yang diketahui | 10 | Mencegah regresi kembali |
| Masukan ambigu | 8 | Harus bertanya, bukan menebak |
| Kasus yang harus ditolak | 6 | Di luar cakupan, tak berizin, tak aman |
| Hasil alat kosong atau rusak | 6 | Insiden nyata paling umum |
Nilai hasil, bukan jalur#
Dua eksekusi yang mencapai hasil benar yang sama lewat jalur berbeda sama-sama benar, dan suite yang memaksakan satu transkrip akan gagal terus tanpa alasan. Periksa apa yang berubah dan apa yang dikatakan: panggilan berefek samping, fakta kunci pada jawaban, apakah gerbang manusia diminta.
Empat angka yang diikuti dari waktu ke waktu#
- Tingkat keberhasilan seluruh set dan terpisah pada subhimpunan yang harus ditolak.
- Tingkat klaim tak berdasar — jawaban dengan fakta yang tak ada di bukti.
- Median dan persentil ke-95 biaya dan latensi per eksekusi.
- Tingkat intervensi manusia: seberapa sering orang harus turun tangan, dan kenapa.
Jalankan di pipeline, dan lagi setelah rilis#
Jalankan set itu pada tiap perubahan prompt, alat, versi model, atau konfigurasi retrieval — hanya empat hal itu yang mengubah perilaku. Setelah rilis, terus ambil sampel trafik nyata: beberapa eksekusi sehari dinilai manual, dan apa pun yang mengejutkan masuk ke set.
Pertanyaan yang sering diajukan
Berapa kasus untuk mulai?
Lima puluh menangkap regresi nyata dan bisa ditulis dalam beberapa hari. Dua puluh cukup untuk memulai.
Bolehkah menilai dengan model?
Boleh, dengan hati-hati. Beri kriteria eksplisit, jaga rubrik tetap pendek, dan periksa sampel secara manual.
Haruskah evaluasi memblokir deployment?
Blokir pada subhimpunan kritis keamanan. Untuk kualitas umum, ikuti trennya dan minta keputusan manusia saat turun.
mengevaluasi agent aipengujian agentset evaluasi llmuji regresi llmmetrik kualitas agent