Monitorowanie agentów na produkcji: co zapisywać i na co alarmować

Produkcja i utrzymanie 9 min czytania

Ściana pulpitów w cichej sali operacyjnej, jeden panel wyróżniony
Zielone pulpity i błędne odpowiedzi doskonale współistnieją.

Klasyczna usługa jest zdrowa, gdy szybko odpowiada i nie rzuca błędów. Agent może robić jedno i drugie, będąc całkowicie w błędzie: każde żądanie odpowiedziane w dwie sekundy i każde cytujące politykę wycofaną w marcu.

Dlatego monitorowanie agentów to inna dyscyplina. Opiera się na dwóch rzeczach: śladzie na przebieg dość szczegółowym, by odtworzyć zdarzenia, i garstce metryk zachowania, których ruch coś znaczy.

Co zawiera użyteczny ślad#

  • Identyfikator przebiegu w każdej linii logu, wywołaniu modelu i żądaniu wychodzącym.
  • Dokładny kontekst wysłany do modelu na każdym kroku.
  • Każde wywołanie narzędzia z argumentami, wynikiem, czasem i rezultatem.
  • Nazwa i wersja modelu na wywołanie oraz liczba tokenów.
  • Powód zatrzymania: ukończono, limit kroków, limit wydatków, ludzka bramka, błąd.
  • Wynik końcowy i to, czy ktoś go potem poprawił lub cofnął.

Sześć metryk, które naprawdę się ruszają#

Monitorowanie agentów na produkcji: co zapisywać i na co alarmować — Sześć metryk, które naprawdę się ruszają
MetrykaNa co patrzećZwykle oznacza
Odsetek sukcesuTrwały spadekZmiana modelu, dryf danych, zmiana API
Kroki na przebiegPowolny wzrostBłędy narzędzi są ponawiane; gorsze wyszukiwanie
Odsetek błędów na narzędzieSkok przy jednymZepsuty system wyżej — nie agent
Interwencje ludzkieWzrostSpada zaufanie albo nowa kategoria
Twierdzenia niepoparteKażdy wzrostWyszukiwanie po cichu zawodzi
Koszt na zadanieWzrost przy stałym wolumenieRozdęty kontekst lub więcej ponowień

Alarmujcie na zachowanie, nie tylko na błędy#

Agent rzadko zawodzi głośno. Degraduje się: trochę więcej kroków, trochę więcej ponowień, trochę więcej eskalacji — a któregoś ranka odpowiada ze starych dokumentów. Alarmujcie na tempo zmiany w oknie ruchomym i dołączajcie do alarmu ślad reprezentatywnego przebiegu.

Próbkujcie i czytajcie realne przebiegi codziennie#

Żaden pulpit nie zastąpi czytania. Wybierzcie codziennie kilka przebiegów — parę udanych, każdą eskalację, każdy przebieg z limitem — i przeczytajcie je w całości.

Wszystko zaskakujące dodajcie do zestawu ewaluacyjnego tego samego dnia.

Najczęstsze pytania

Jak długo trzymać pełne ślady?

Dość długo do debugowania i audytu: zwykle 30–90 dni dla pełnych kontekstów.

Jaki alarm jest najcenniejszy?

Wzrost eskalacji lub poprawek ludzkich: najwcześniejszy uczciwy sygnał dryfu.

Czy potrzebne jest dedykowane narzędzie observability?

Nie na start. Przeszukiwalna tabela śladów pokrywa większość potrzeb.

monitorowanie agentówobservability llmślady agentówmetryki ai na produkcjidryf agenta

Wszystkie przewodniki

Ostatnia aktualizacja 2026-08-04, aiagentdevelopment.info · O nas

Pisane przez budujących

Każdy przewodnik piszą inżynierowie utrzymujący agentów w produkcji, a nie przerabiają go z innych stron.

Regularne przeglądy

Ta dziedzina zmienia się szybko. Każdy przewodnik ma datę ostatniego przeglądu — publikujemy ją także wtedy, gdy nic się nie zmieniło.

Bez płatnych miejsc

Żaden dostawca modeli, framework ani platforma nie kupi wzmianki, pozycji ani linku.

Dwanaście języków

Każdy przewodnik jest tłumaczony, a nie podmieniany maszynowo — każdy język ma własny URL i własną datę przeglądu.

Granice nazwane

Mówimy wprost, kiedy zadanie nie wymaga agenta, a zwykły skrypt będzie tańszy i pewniejszy.