Menguji AI Agent: Set Evaluasi yang Sepadan Usahanya

Produksi dan operasi 9 menit baca

Kisi hasil di layar dengan lulus dan gagal, di sampingnya daftar kasus uji tercetak
Berkas tak menarik yang menentukan apakah agent Anda pernah keluar dari pilot.

Pertanyaan yang memisahkan agent yang tayang dari agent yang membusuk di pilot itu sederhana: bagaimana Anda tahu perubahan kemarin membuatnya lebih baik? Tanpa jawaban, tiap suntingan prompt adalah tebakan dan tiap regresi ditemukan pelanggan.

Set evaluasi adalah jawabannya, dan itu tak butuh platform. Lima puluh kasus dalam satu berkas, satu skrip yang menjalankannya, dan satu aturan penilaian per kasus akan memberi tahu lebih banyak daripada papan peringkat mana pun, karena itu kasus Anda.

Seperti apa satu kasus#

Kasus adalah masukan, keadaan awal dunia, dan ekspektasi yang bisa diperiksa. Ekspektasinya hampir tak pernah berupa string persis — agent bisa benar dalam beberapa rumusan. Nilailah hasilnya: apakah ia memanggil alat pengembalian dana dengan pesanan 4471; apakah jawaban akhir memuat tanggal yang benar; apakah ia menolak dan bertanya, sebagaimana seharusnya.

Simpan keadaan yang dibutuhkan tiap kasus bersama kasusnya. Uji yang hanya lolos pada hari Selasa karena data langsung bukanlah uji.

Lima puluh kasus dan asalnya#

Menguji AI Agent: Set Evaluasi yang Sepadan Usahanya — Lima puluh kasus dan asalnya
SumberKira-kira berapaKenapa
Permintaan nyata yang sering dari log20Melindungi jalur harian
Kegagalan lampau yang diketahui10Mencegah regresi kembali
Masukan ambigu8Harus bertanya, bukan menebak
Kasus yang harus ditolak6Di luar cakupan, tak berizin, tak aman
Hasil alat kosong atau rusak6Insiden nyata paling umum

Nilai hasil, bukan jalur#

Dua eksekusi yang mencapai hasil benar yang sama lewat jalur berbeda sama-sama benar, dan suite yang memaksakan satu transkrip akan gagal terus tanpa alasan. Periksa apa yang berubah dan apa yang dikatakan: panggilan berefek samping, fakta kunci pada jawaban, apakah gerbang manusia diminta.

Empat angka yang diikuti dari waktu ke waktu#

  1. Tingkat keberhasilan seluruh set dan terpisah pada subhimpunan yang harus ditolak.
  2. Tingkat klaim tak berdasar — jawaban dengan fakta yang tak ada di bukti.
  3. Median dan persentil ke-95 biaya dan latensi per eksekusi.
  4. Tingkat intervensi manusia: seberapa sering orang harus turun tangan, dan kenapa.

Jalankan di pipeline, dan lagi setelah rilis#

Jalankan set itu pada tiap perubahan prompt, alat, versi model, atau konfigurasi retrieval — hanya empat hal itu yang mengubah perilaku. Setelah rilis, terus ambil sampel trafik nyata: beberapa eksekusi sehari dinilai manual, dan apa pun yang mengejutkan masuk ke set.

Pertanyaan yang sering diajukan

Berapa kasus untuk mulai?

Lima puluh menangkap regresi nyata dan bisa ditulis dalam beberapa hari. Dua puluh cukup untuk memulai.

Bolehkah menilai dengan model?

Boleh, dengan hati-hati. Beri kriteria eksplisit, jaga rubrik tetap pendek, dan periksa sampel secara manual.

Haruskah evaluasi memblokir deployment?

Blokir pada subhimpunan kritis keamanan. Untuk kualitas umum, ikuti trennya dan minta keputusan manusia saat turun.

mengevaluasi agent aipengujian agentset evaluasi llmuji regresi llmmetrik kualitas agent

Semua panduan

Terakhir diperbarui 2026-08-04 oleh aiagentdevelopment.info · Tentang kami

Ditulis para pembangun

Setiap panduan ditulis engineer yang menjalankan agent di produksi, bukan daur ulang situs lain.

Ditinjau terjadwal

Bidang ini bergerak cepat. Setiap panduan mencantumkan tanggal peninjauan terakhir, juga saat tidak ada yang berubah.

Tanpa penempatan berbayar

Tidak ada penyedia model, framework, atau platform agent yang bisa membeli sebutan, peringkat, atau tautan.

Dua belas bahasa

Setiap panduan diterjemahkan, bukan diganti mesin — tiap bahasa punya URL dan tanggal peninjauannya sendiri.

Batas disebut jelas

Kami katakan terus terang bila sebuah tugas tidak butuh agent dan skrip biasa akan lebih murah serta lebih andal.