Monitorizar agentes en producción: qué registrar y qué alertar
Un servicio convencional está sano si responde rápido y no lanza errores. Un agente puede hacer ambas cosas y estar completamente equivocado: cada petición contestada en dos segundos, y todas citando una política retirada en marzo.
Por eso monitorizar agentes es otra disciplina. Se apoya en dos cosas: una traza por ejecución con detalle suficiente para reconstruir lo ocurrido, y un puñado de métricas de comportamiento cuyo movimiento signifique algo. El resto es decoración.
Qué contiene una traza útil#
- Un identificador de ejecución en cada línea de log, llamada y petición saliente.
- El contexto exacto enviado al modelo en cada paso, o un hash y las partes montadas.
- Cada llamada con argumentos, resultado, duración y desenlace.
- Nombre y versión del modelo por llamada, y recuento de tokens.
- El motivo de parada: completado, tope de pasos, tope de gasto, puerta humana, error.
- La salida final y si alguien la corrigió o revirtió después.
Seis métricas que sí se mueven#
| Métrica | Qué vigilar | Suele significar |
|---|---|---|
| Tasa de éxito | Caída sostenida | Cambio de modelo, deriva de datos, API alterada |
| Pasos por ejecución | Subida lenta | Errores de herramienta reintentados; recuperación peor |
| Errores por herramienta | Pico en una | Sistema aguas arriba roto, no el agente |
| Intervención humana | Subida | Cae la confianza o hay una categoría nueva |
| Afirmaciones sin respaldo | Cualquier subida | La recuperación falla en silencio |
| Coste por tarea | Sube con volumen plano | Contexto hinchado o más reintentos |
Alerta sobre comportamiento, no solo sobre errores#
Un agente rara vez falla a gritos. Se degrada: algo más de pasos, algo más de reintentos, algo más de escalados, y una mañana responde con documentos caducados. Alerta sobre ritmo de cambio en ventana móvil en vez de umbrales absolutos. Y adjunta a cada alerta la traza de una ejecución representativa; una alerta que nadie puede investigar acaba silenciada.
Muestrea y lee ejecuciones reales, cada día#
Ningún panel sustituye a leer. Elige a diario unas cuantas ejecuciones — algunos éxitos, todos los escalados, todas las que tocaron tope — y léelas enteras. Cada problema serio que hemos encontrado en producción era visible en una traza antes que en una métrica. Rota quién lee: quien escribió el prompt es quien menos nota lo que hace mal.
Añade lo sorprendente al conjunto de evaluación el mismo día. Ese hábito convierte la monitorización en mejora.
Registrar sin recopilar lo que no debes#
Las trazas contienen datos de clientes por construcción. Enmascara identificadores al registrar y no en un trabajo posterior, da a los contextos completos una retención más corta que a las métricas y trata los argumentos de herramienta con los mismos controles de acceso que el sistema subyacente.
Preguntas frecuentes
¿Cuánto guardo las trazas completas?
Lo suficiente para depurar y auditar: suele ser de 30 a 90 días para contextos completos, mientras métricas y resúmenes duran mucho más. Decídelo a propósito: ahí está lo que escribieron tus usuarios.
¿Cuál es la alerta más valiosa?
Una subida de escalados o de correcciones humanas. Es la señal honesta más temprana de deriva y no requiere etiquetado: tus usuarios y operadores califican gratis.
¿Necesito una herramienta de observabilidad?
Para empezar, no. Una tabla de trazas consultable cubre casi todo. Las herramientas especializadas ayudan cuando comparar ejecuciones y versionar prompts es trabajo diario de varias personas.
monitorización de agentesobservabilidad llmtrazas de agentesmétricas ia producciónderiva de agentes