Att övervaka AI-agenter i produktion
En agent kan ha hundra procent tillgänglighet, tvåhundra millisekunders svarstid och noll fel i loggen medan den svarar fel på var femte fråga. Klassiska mått ser inte det, eftersom inget kraschade.
Övervakning av agenter måste därför mäta utfall och göra varje körning läsbar i efterhand.
Spåret ni måste ha#
- Ett stabilt kör-ID på varje loggrad, verktygsanrop och utgående begäran.
- En rad per varv: verktyg, argument, resultatstorlek, tokens, kostnad, latens.
- Prompt-version och modell-version stämplade på körningen.
- Hämtade dokument-ID:n när hämtning används.
- Avslutsorsak: mål nått, eskalerat, tak nått, fel.
Mått som faktiskt varnar#
| Mått | Varför det är känsligt |
|---|---|
| Andel körningar som når mål | Faller innan användarna klagar |
| Eskaleringsfrekvens | Stiger när agenten tappar fotfästet |
| Medelvarv per körning | Stiger tyst vid promptdrift |
| Andel ogiltiga verktygsargument | Första tecknet på modellbyte |
| Kostnad per körning, p95 | Fångar loopar innan fakturan gör det |
Larma på förändring, inte på nivå#
Absoluta trösklar är svåra att sätta och åldras snabbt. Larma i stället på avvikelser mot förra veckans baslinje för samma körningstyp, och alltid direkt på ökad andel skadliga utfall.
Ett dagligt urval om femtio körningar som en människa läser fångar sådant inget mått ser.
Sekretess i spåren#
Spår innehåller kunddata. Maskera vid inmatningen, sätt kort lagringstid på råa nyttolaster, behåll strukturen längre och begränsa åtkomsten som ni skulle gjort för en databas.
Vanliga frågor
Räcker vanlig APM?
Nej. Den ser latens och fel men inte om svaret var rätt.
Hur länge ska spår sparas?
Strukturen i månader, råa nyttolaster i dagar, med maskering.
Vilket är det tidigaste varningstecknet?
Stigande medelvarv per körning, oftast före allt annat.
agentövervakningllm-observerbarhetkörningsspårproduktionslarmagentmått