Agents monitoren in productie: wat loggen en waarop alarmeren

Productie en beheer 9 min lezen

Een wand met dashboards in een stille operationele ruimte, één paneel uitgelicht
Groene dashboards en foute antwoorden gaan prima samen.

Een klassieke service is gezond als hij snel antwoordt en geen fouten gooit. Een agent kan beide doen en volledig fout zitten: elk verzoek in twee seconden beantwoord, en allemaal met een beleid dat in maart is ingetrokken.

Daarom is agentmonitoring een aparte discipline. Ze rust op twee dingen: een trace per run die gedetailleerd genoeg is om te reconstrueren wat er gebeurde, en een handvol gedragsmetrieken waarvan de beweging iets betekent.

Wat een bruikbare trace bevat#

  • Een run-ID op elke logregel, modelaanroep en uitgaand verzoek.
  • De exacte context die per stap naar het model ging.
  • Elke toolaanroep met argumenten, resultaat, duur en uitkomst.
  • Modelnaam en -versie per aanroep, plus tokenaantallen.
  • De stopreden: klaar, stappenlimiet, uitgavenlimiet, menselijke poort, fout.
  • De einduitvoer en of iemand die later corrigeerde of terugdraaide.

Zes metrieken die echt bewegen#

Agents monitoren in productie: wat loggen en waarop alarmeren — Zes metrieken die echt bewegen
MetriekWaarop lettenBetekent meestal
SlaagpercentageAanhoudende dalingModelwissel, datadrift, gewijzigde API
Stappen per runLangzame stijgingToolfouten worden herhaald; retrieval verslechterd
Foutpercentage per toolPiek bij één toolBovenliggend systeem kapot — niet de agent
Menselijke interventieStijgendVertrouwen daalt of nieuwe categorie
Ongefundeerde beweringenElke stijgingRetrieval faalt stil
Kosten per taakStijging bij gelijk volumeOpgeblazen context of meer retries

Alarmeer op gedrag, niet alleen op fouten#

Een agent faalt zelden luidruchtig. Hij degradeert: iets meer stappen, iets meer retries, iets meer escalaties — en op een ochtend antwoordt hij uit verouderde documenten. Alarmeer op veranderingssnelheid in een schuivend venster en hang bij elk alarm de trace van een representatieve run.

Bemonster en lees elke dag echte runs#

Geen dashboard vervangt lezen. Kies dagelijks een handvol runs — een paar successen, elke escalatie, elke run die de limiet raakte — en lees ze helemaal.

Voeg alles wat verrast dezelfde dag toe aan de evaluatieset.

Veelgestelde vragen

Hoe lang volledige traces bewaren?

Lang genoeg voor debug en audit: gebruikelijk 30–90 dagen voor volledige contexten.

Wat is het waardevolste alarm?

Een stijging in escalaties of menselijke correcties: het vroegste eerlijke signaal van verschuiving.

Heb ik een speciale observability-tool nodig?

Niet om te beginnen. Een doorzoekbare tracetabel dekt het meeste.

agentmonitoringllm observabilityagenttracesai productiemetriekenagentdrift

Alle gidsen

Laatst bijgewerkt 2026-08-04 door aiagentdevelopment.info · Over ons

Door bouwers geschreven

Elke gids is geschreven door engineers die agents in productie draaien, niet overgeschreven van andere sites.

Periodiek herzien

Dit vakgebied beweegt snel. Elke gids draagt de datum van de laatste herziening, ook als er niets veranderde.

Geen betaalde plaatsingen

Geen modelaanbieder, framework of agentplatform kan hier een vermelding, positie of link kopen.

Twaalf talen

Elke gids is vertaald, niet machinaal vervangen — elke taal heeft een eigen URL en eigen herzieningsdatum.

Grenzen benoemd

We zeggen ronduit wanneer een taak geen agent nodig heeft en een eenvoudig script goedkoper en betrouwbaarder is.