Monitorowanie agentów na produkcji: co zapisywać i na co alarmować
Klasyczna usługa jest zdrowa, gdy szybko odpowiada i nie rzuca błędów. Agent może robić jedno i drugie, będąc całkowicie w błędzie: każde żądanie odpowiedziane w dwie sekundy i każde cytujące politykę wycofaną w marcu.
Dlatego monitorowanie agentów to inna dyscyplina. Opiera się na dwóch rzeczach: śladzie na przebieg dość szczegółowym, by odtworzyć zdarzenia, i garstce metryk zachowania, których ruch coś znaczy.
Co zawiera użyteczny ślad#
- Identyfikator przebiegu w każdej linii logu, wywołaniu modelu i żądaniu wychodzącym.
- Dokładny kontekst wysłany do modelu na każdym kroku.
- Każde wywołanie narzędzia z argumentami, wynikiem, czasem i rezultatem.
- Nazwa i wersja modelu na wywołanie oraz liczba tokenów.
- Powód zatrzymania: ukończono, limit kroków, limit wydatków, ludzka bramka, błąd.
- Wynik końcowy i to, czy ktoś go potem poprawił lub cofnął.
Sześć metryk, które naprawdę się ruszają#
| Metryka | Na co patrzeć | Zwykle oznacza |
|---|---|---|
| Odsetek sukcesu | Trwały spadek | Zmiana modelu, dryf danych, zmiana API |
| Kroki na przebieg | Powolny wzrost | Błędy narzędzi są ponawiane; gorsze wyszukiwanie |
| Odsetek błędów na narzędzie | Skok przy jednym | Zepsuty system wyżej — nie agent |
| Interwencje ludzkie | Wzrost | Spada zaufanie albo nowa kategoria |
| Twierdzenia niepoparte | Każdy wzrost | Wyszukiwanie po cichu zawodzi |
| Koszt na zadanie | Wzrost przy stałym wolumenie | Rozdęty kontekst lub więcej ponowień |
Alarmujcie na zachowanie, nie tylko na błędy#
Agent rzadko zawodzi głośno. Degraduje się: trochę więcej kroków, trochę więcej ponowień, trochę więcej eskalacji — a któregoś ranka odpowiada ze starych dokumentów. Alarmujcie na tempo zmiany w oknie ruchomym i dołączajcie do alarmu ślad reprezentatywnego przebiegu.
Próbkujcie i czytajcie realne przebiegi codziennie#
Żaden pulpit nie zastąpi czytania. Wybierzcie codziennie kilka przebiegów — parę udanych, każdą eskalację, każdy przebieg z limitem — i przeczytajcie je w całości.
Wszystko zaskakujące dodajcie do zestawu ewaluacyjnego tego samego dnia.
Najczęstsze pytania
Jak długo trzymać pełne ślady?
Dość długo do debugowania i audytu: zwykle 30–90 dni dla pełnych kontekstów.
Jaki alarm jest najcenniejszy?
Wzrost eskalacji lub poprawek ludzkich: najwcześniejszy uczciwy sygnał dryfu.
Czy potrzebne jest dedykowane narzędzie observability?
Nie na start. Przeszukiwalna tabela śladów pokrywa większość potrzeb.
monitorowanie agentówobservability llmślady agentówmetryki ai na produkcjidryf agenta