Agents monitoren in productie: wat loggen en waarop alarmeren
Een klassieke service is gezond als hij snel antwoordt en geen fouten gooit. Een agent kan beide doen en volledig fout zitten: elk verzoek in twee seconden beantwoord, en allemaal met een beleid dat in maart is ingetrokken.
Daarom is agentmonitoring een aparte discipline. Ze rust op twee dingen: een trace per run die gedetailleerd genoeg is om te reconstrueren wat er gebeurde, en een handvol gedragsmetrieken waarvan de beweging iets betekent.
Wat een bruikbare trace bevat#
- Een run-ID op elke logregel, modelaanroep en uitgaand verzoek.
- De exacte context die per stap naar het model ging.
- Elke toolaanroep met argumenten, resultaat, duur en uitkomst.
- Modelnaam en -versie per aanroep, plus tokenaantallen.
- De stopreden: klaar, stappenlimiet, uitgavenlimiet, menselijke poort, fout.
- De einduitvoer en of iemand die later corrigeerde of terugdraaide.
Zes metrieken die echt bewegen#
| Metriek | Waarop letten | Betekent meestal |
|---|---|---|
| Slaagpercentage | Aanhoudende daling | Modelwissel, datadrift, gewijzigde API |
| Stappen per run | Langzame stijging | Toolfouten worden herhaald; retrieval verslechterd |
| Foutpercentage per tool | Piek bij één tool | Bovenliggend systeem kapot — niet de agent |
| Menselijke interventie | Stijgend | Vertrouwen daalt of nieuwe categorie |
| Ongefundeerde beweringen | Elke stijging | Retrieval faalt stil |
| Kosten per taak | Stijging bij gelijk volume | Opgeblazen context of meer retries |
Alarmeer op gedrag, niet alleen op fouten#
Een agent faalt zelden luidruchtig. Hij degradeert: iets meer stappen, iets meer retries, iets meer escalaties — en op een ochtend antwoordt hij uit verouderde documenten. Alarmeer op veranderingssnelheid in een schuivend venster en hang bij elk alarm de trace van een representatieve run.
Bemonster en lees elke dag echte runs#
Geen dashboard vervangt lezen. Kies dagelijks een handvol runs — een paar successen, elke escalatie, elke run die de limiet raakte — en lees ze helemaal.
Voeg alles wat verrast dezelfde dag toe aan de evaluatieset.
Veelgestelde vragen
Hoe lang volledige traces bewaren?
Lang genoeg voor debug en audit: gebruikelijk 30–90 dagen voor volledige contexten.
Wat is het waardevolste alarm?
Een stijging in escalaties of menselijke correcties: het vroegste eerlijke signaal van verschuiving.
Heb ik een speciale observability-tool nodig?
Niet om te beginnen. Een doorzoekbare tracetabel dekt het meeste.
agentmonitoringllm observabilityagenttracesai productiemetriekenagentdrift