Memantau Agent di Produksi: Apa yang Dicatat dan Apa yang Diperingatkan

Produksi dan operasi 9 menit baca

Dinding dasbor di ruang operasi yang sepi, satu panel disorot
Dasbor hijau dan jawaban salah bisa hidup berdampingan.

Layanan biasa dianggap sehat bila merespons cepat dan tak melempar galat. Agent bisa melakukan keduanya sambil sepenuhnya salah — tiap permintaan dijawab dalam dua detik, dan semuanya mengutip kebijakan yang ditarik bulan Maret.

Karena itu memantau agent adalah disiplin lain. Ia bertumpu pada dua hal: jejak tiap eksekusi yang cukup rinci untuk merekonstruksi apa yang terjadi, dan segelintir metrik perilaku yang pergerakannya bermakna.

Isi jejak yang berguna#

  • Pengenal eksekusi pada tiap baris log, panggilan model, dan permintaan keluar.
  • Konteks persis yang dikirim ke model tiap langkah, atau hash plus bagian-bagiannya.
  • Tiap panggilan alat dengan argumen, hasil, durasi, dan luaran.
  • Nama dan versi model per panggilan, plus hitungan token.
  • Alasan berhenti: selesai, batas langkah, batas belanja, gerbang manusia, galat.
  • Keluaran akhir dan apakah kemudian dikoreksi atau dibatalkan seseorang.

Enam metrik yang benar-benar bergerak#

Memantau Agent di Produksi: Apa yang Dicatat dan Apa yang Diperingatkan — Enam metrik yang benar-benar bergerak
MetrikYang diperhatikanBiasanya berarti
Tingkat keberhasilanPenurunan berkelanjutanModel berubah, data bergeser, API berubah
Langkah per eksekusiNaik perlahanGalat alat diulang; retrieval memburuk
Tingkat galat per alatLonjakan pada satu alatSistem hulu rusak — bukan agent
Intervensi manusiaMeningkatKepercayaan turun atau kategori baru
Klaim tak berdasarKenaikan apa punRetrieval gagal diam-diam
Biaya per tugasNaik pada volume tetapKonteks membengkak atau coba ulang bertambah

Beri peringatan pada perilaku, bukan hanya galat#

Agent jarang gagal dengan berisik. Ia memburuk perlahan: sedikit lebih banyak langkah, sedikit lebih banyak coba ulang, sedikit lebih banyak eskalasi — lalu suatu pagi ia menjawab dari dokumen basi. Beri peringatan pada laju perubahan dalam jendela bergulir, bukan ambang mutlak, dan lampirkan jejak satu eksekusi perwakilan pada tiap peringatan.

Ambil sampel dan baca eksekusi nyata, setiap hari#

Tak ada dasbor yang menggantikan membaca. Pilih beberapa eksekusi tiap hari — beberapa sukses, tiap eskalasi, tiap eksekusi yang kena batas — dan baca seluruhnya. Tiap masalah serius yang kami temukan di produksi terlihat di jejak sebelum terlihat di metrik.

Tambahkan apa pun yang mengejutkan ke set evaluasi pada hari yang sama.

Pertanyaan yang sering diajukan

Berapa lama menyimpan jejak lengkap?

Cukup lama untuk debug dan audit — umumnya 30–90 hari untuk konteks lengkap, sementara metrik disimpan jauh lebih lama.

Peringatan apa yang paling berharga?

Kenaikan eskalasi atau koreksi manusia. Itu sinyal jujur paling awal bahwa perilaku bergeser.

Perlukah alat observability khusus?

Tidak untuk memulai. Tabel jejak yang bisa dikueri sudah mencakup sebagian besar kebutuhan.

pemantauan agentobservability llmjejak agentmetrik ai produksipergeseran agent

Semua panduan

Terakhir diperbarui 2026-08-04 oleh aiagentdevelopment.info · Tentang kami

Ditulis para pembangun

Setiap panduan ditulis engineer yang menjalankan agent di produksi, bukan daur ulang situs lain.

Ditinjau terjadwal

Bidang ini bergerak cepat. Setiap panduan mencantumkan tanggal peninjauan terakhir, juga saat tidak ada yang berubah.

Tanpa penempatan berbayar

Tidak ada penyedia model, framework, atau platform agent yang bisa membeli sebutan, peringkat, atau tautan.

Dua belas bahasa

Setiap panduan diterjemahkan, bukan diganti mesin — tiap bahasa punya URL dan tanggal peninjauannya sendiri.

Batas disebut jelas

Kami katakan terus terang bila sebuah tugas tidak butuh agent dan skrip biasa akan lebih murah serta lebih andal.