Monitorare gli agenti in produzione: cosa registrare e su cosa allertare
Un servizio classico è in salute se risponde in fretta e non solleva errori. Un agente può fare entrambe le cose ed essere completamente sbagliato: ogni richiesta risposta in due secondi, e tutte citando una policy ritirata a marzo.
Per questo monitorare gli agenti è un'altra disciplina. Poggia su due cose: una traccia per esecuzione abbastanza dettagliata da ricostruire cosa è successo, e una manciata di metriche di comportamento il cui movimento significa qualcosa.
Cosa contiene una traccia utile#
- Un identificativo di esecuzione su ogni riga di log, chiamata e richiesta in uscita.
- Il contesto esatto inviato al modello a ogni passo.
- Ogni chiamata a strumento con argomenti, risultato, durata ed esito.
- Nome e versione del modello per chiamata, più il conteggio dei token.
- Il motivo di arresto: completato, tetto passi, tetto spesa, cancello umano, errore.
- L'output finale e se qualcuno lo ha corretto o annullato dopo.
Sei metriche che si muovono davvero#
| Metrica | Cosa osservare | Di solito significa |
|---|---|---|
| Tasso di successo | Calo prolungato | Cambio di modello, deriva dei dati, API cambiata |
| Passi per esecuzione | Crescita lenta | Errori di strumento ritentati; recupero peggiorato |
| Errori per strumento | Picco su uno strumento | Sistema a monte rotto — non l'agente |
| Intervento umano | In aumento | Fiducia in calo o nuova categoria |
| Affermazioni non supportate | Qualsiasi aumento | Il recupero fallisce in silenzio |
| Costo per compito | Aumento a volume costante | Contesto gonfio o più ritentativi |
Allertate sul comportamento, non solo sugli errori#
Un agente raramente fallisce rumorosamente. Degrada: un po' più passi, un po' più ritentativi, un po' più escalation — e una mattina risponde da documenti stantii. Allertate sul ritmo di cambiamento in una finestra mobile e allegate a ogni allarme la traccia di un'esecuzione rappresentativa.
Campionate e leggete esecuzioni reali, ogni giorno#
Nessun cruscotto sostituisce la lettura. Scegliete ogni giorno alcune esecuzioni — qualche successo, tutte le escalation, tutte quelle arrivate al tetto — e leggetele per intero.
Aggiungete al set di valutazione, lo stesso giorno, tutto ciò che sorprende.
Domande frequenti
Per quanto conservare le tracce complete?
Abbastanza per debug e audit: di solito 30–90 giorni per i contesti completi.
Qual è l'allarme più prezioso?
Un aumento di escalation o correzioni umane: il segnale onesto più precoce di deriva.
Serve uno strumento di observability dedicato?
Non per iniziare. Una tabella di tracce interrogabile copre quasi tutto.
monitoraggio agentiobservability llmtracce degli agentimetriche ai produzionederiva dell'agente