Memantau Agent di Produksi: Apa yang Dicatat dan Apa yang Diperingatkan
Layanan biasa dianggap sehat bila merespons cepat dan tak melempar galat. Agent bisa melakukan keduanya sambil sepenuhnya salah — tiap permintaan dijawab dalam dua detik, dan semuanya mengutip kebijakan yang ditarik bulan Maret.
Karena itu memantau agent adalah disiplin lain. Ia bertumpu pada dua hal: jejak tiap eksekusi yang cukup rinci untuk merekonstruksi apa yang terjadi, dan segelintir metrik perilaku yang pergerakannya bermakna.
Isi jejak yang berguna#
- Pengenal eksekusi pada tiap baris log, panggilan model, dan permintaan keluar.
- Konteks persis yang dikirim ke model tiap langkah, atau hash plus bagian-bagiannya.
- Tiap panggilan alat dengan argumen, hasil, durasi, dan luaran.
- Nama dan versi model per panggilan, plus hitungan token.
- Alasan berhenti: selesai, batas langkah, batas belanja, gerbang manusia, galat.
- Keluaran akhir dan apakah kemudian dikoreksi atau dibatalkan seseorang.
Enam metrik yang benar-benar bergerak#
| Metrik | Yang diperhatikan | Biasanya berarti |
|---|---|---|
| Tingkat keberhasilan | Penurunan berkelanjutan | Model berubah, data bergeser, API berubah |
| Langkah per eksekusi | Naik perlahan | Galat alat diulang; retrieval memburuk |
| Tingkat galat per alat | Lonjakan pada satu alat | Sistem hulu rusak — bukan agent |
| Intervensi manusia | Meningkat | Kepercayaan turun atau kategori baru |
| Klaim tak berdasar | Kenaikan apa pun | Retrieval gagal diam-diam |
| Biaya per tugas | Naik pada volume tetap | Konteks membengkak atau coba ulang bertambah |
Beri peringatan pada perilaku, bukan hanya galat#
Agent jarang gagal dengan berisik. Ia memburuk perlahan: sedikit lebih banyak langkah, sedikit lebih banyak coba ulang, sedikit lebih banyak eskalasi — lalu suatu pagi ia menjawab dari dokumen basi. Beri peringatan pada laju perubahan dalam jendela bergulir, bukan ambang mutlak, dan lampirkan jejak satu eksekusi perwakilan pada tiap peringatan.
Ambil sampel dan baca eksekusi nyata, setiap hari#
Tak ada dasbor yang menggantikan membaca. Pilih beberapa eksekusi tiap hari — beberapa sukses, tiap eskalasi, tiap eksekusi yang kena batas — dan baca seluruhnya. Tiap masalah serius yang kami temukan di produksi terlihat di jejak sebelum terlihat di metrik.
Tambahkan apa pun yang mengejutkan ke set evaluasi pada hari yang sama.
Pertanyaan yang sering diajukan
Berapa lama menyimpan jejak lengkap?
Cukup lama untuk debug dan audit — umumnya 30–90 hari untuk konteks lengkap, sementara metrik disimpan jauh lebih lama.
Peringatan apa yang paling berharga?
Kenaikan eskalasi atau koreksi manusia. Itu sinyal jujur paling awal bahwa perilaku bergeser.
Perlukah alat observability khusus?
Tidak untuk memulai. Tabel jejak yang bisa dikueri sudah mencakup sebagian besar kebutuhan.
pemantauan agentobservability llmjejak agentmetrik ai produksipergeseran agent