Monitorizar agentes em produção: o que registar e sobre o que alertar
Um serviço clássico está saudável se responde depressa e não lança erros. Um agente pode fazer as duas coisas e estar completamente errado: cada pedido respondido em dois segundos, e todos a citar uma política retirada em março.
Por isso monitorizar agentes é outra disciplina. Assenta em duas coisas: um rasto por execução detalhado o suficiente para reconstituir o que aconteceu, e um punhado de métricas de comportamento cujo movimento significa alguma coisa.
O que um rasto útil contém#
- Um identificador de execução em cada linha de log, chamada e pedido de saída.
- O contexto exato enviado ao modelo em cada passo.
- Cada chamada de ferramenta com argumentos, resultado, duração e desfecho.
- Nome e versão do modelo por chamada e contagem de tokens.
- O motivo de paragem: concluído, teto de passos, teto de gasto, portão humano, erro.
- A saída final e se alguém a corrigiu ou reverteu depois.
Seis métricas que mexem mesmo#
| Métrica | O que observar | Costuma significar |
|---|---|---|
| Taxa de sucesso | Queda sustentada | Mudança de modelo, desvio de dados, API alterada |
| Passos por execução | Subida lenta | Erros de ferramenta repetidos; recuperação degradada |
| Taxa de erro por ferramenta | Pico numa | Sistema a montante partido — não o agente |
| Intervenção humana | A subir | Confiança a cair ou nova categoria |
| Afirmações sem suporte | Qualquer subida | A recuperação falha em silêncio |
| Custo por tarefa | Sobe com volume igual | Contexto inchado ou mais repetições |
Alertem sobre comportamento, não só sobre erros#
Um agente raramente falha ruidosamente. Degrada-se: um pouco mais de passos, um pouco mais de repetições, um pouco mais de escalamentos. Alertem sobre ritmo de mudança numa janela móvel e anexem a cada alerta o rasto de uma execução representativa.
Amostrem e leiam execuções reais todos os dias#
Nenhum painel substitui a leitura. Escolham diariamente algumas execuções e leiam-nas por inteiro.
Acrescentem ao conjunto de avaliação, no mesmo dia, tudo o que surpreender.
Perguntas frequentes
Quanto tempo guardar rastos completos?
O suficiente para depurar e auditar: normalmente 30–90 dias para contextos completos.
Qual é o alerta mais valioso?
Uma subida de escalamentos ou correções humanas.
É preciso uma ferramenta de observabilidade dedicada?
Não para começar. Uma tabela de rastos consultável cobre quase tudo.
monitorização de agentesobservabilidade llmrastos de agentesmétricas ia produçãodesvio do agente