Monitorizar agentes en producción: qué registrar y qué alertar

Producción y operación 9 min de lectura

Una pared de paneles en una sala de operaciones tranquila, con uno destacado
Paneles en verde y respuestas equivocadas conviven perfectamente.

Un servicio convencional está sano si responde rápido y no lanza errores. Un agente puede hacer ambas cosas y estar completamente equivocado: cada petición contestada en dos segundos, y todas citando una política retirada en marzo.

Por eso monitorizar agentes es otra disciplina. Se apoya en dos cosas: una traza por ejecución con detalle suficiente para reconstruir lo ocurrido, y un puñado de métricas de comportamiento cuyo movimiento signifique algo. El resto es decoración.

Qué contiene una traza útil#

  • Un identificador de ejecución en cada línea de log, llamada y petición saliente.
  • El contexto exacto enviado al modelo en cada paso, o un hash y las partes montadas.
  • Cada llamada con argumentos, resultado, duración y desenlace.
  • Nombre y versión del modelo por llamada, y recuento de tokens.
  • El motivo de parada: completado, tope de pasos, tope de gasto, puerta humana, error.
  • La salida final y si alguien la corrigió o revirtió después.

Seis métricas que sí se mueven#

Monitorizar agentes en producción: qué registrar y qué alertar — Seis métricas que sí se mueven
MétricaQué vigilarSuele significar
Tasa de éxitoCaída sostenidaCambio de modelo, deriva de datos, API alterada
Pasos por ejecuciónSubida lentaErrores de herramienta reintentados; recuperación peor
Errores por herramientaPico en unaSistema aguas arriba roto, no el agente
Intervención humanaSubidaCae la confianza o hay una categoría nueva
Afirmaciones sin respaldoCualquier subidaLa recuperación falla en silencio
Coste por tareaSube con volumen planoContexto hinchado o más reintentos

Alerta sobre comportamiento, no solo sobre errores#

Un agente rara vez falla a gritos. Se degrada: algo más de pasos, algo más de reintentos, algo más de escalados, y una mañana responde con documentos caducados. Alerta sobre ritmo de cambio en ventana móvil en vez de umbrales absolutos. Y adjunta a cada alerta la traza de una ejecución representativa; una alerta que nadie puede investigar acaba silenciada.

Muestrea y lee ejecuciones reales, cada día#

Ningún panel sustituye a leer. Elige a diario unas cuantas ejecuciones — algunos éxitos, todos los escalados, todas las que tocaron tope — y léelas enteras. Cada problema serio que hemos encontrado en producción era visible en una traza antes que en una métrica. Rota quién lee: quien escribió el prompt es quien menos nota lo que hace mal.

Añade lo sorprendente al conjunto de evaluación el mismo día. Ese hábito convierte la monitorización en mejora.

Registrar sin recopilar lo que no debes#

Las trazas contienen datos de clientes por construcción. Enmascara identificadores al registrar y no en un trabajo posterior, da a los contextos completos una retención más corta que a las métricas y trata los argumentos de herramienta con los mismos controles de acceso que el sistema subyacente.

Preguntas frecuentes

¿Cuánto guardo las trazas completas?

Lo suficiente para depurar y auditar: suele ser de 30 a 90 días para contextos completos, mientras métricas y resúmenes duran mucho más. Decídelo a propósito: ahí está lo que escribieron tus usuarios.

¿Cuál es la alerta más valiosa?

Una subida de escalados o de correcciones humanas. Es la señal honesta más temprana de deriva y no requiere etiquetado: tus usuarios y operadores califican gratis.

¿Necesito una herramienta de observabilidad?

Para empezar, no. Una tabla de trazas consultable cubre casi todo. Las herramientas especializadas ayudan cuando comparar ejecuciones y versionar prompts es trabajo diario de varias personas.

monitorización de agentesobservabilidad llmtrazas de agentesmétricas ia producciónderiva de agentes

Todas las guías

Última actualización 2026-08-04 por aiagentdevelopment.info · Sobre nosotros

Escrito por quienes construyen

Cada guía la escriben ingenieros que operan agentes en producción, no se reescribe de otros sitios.

Revisado periódicamente

Este campo cambia rápido. Cada guía lleva la fecha de su última revisión, y la publicamos aunque no haya cambiado nada.

Sin espacios pagados

Ningún proveedor de modelos, framework o plataforma puede comprar una mención, una posición ni un enlace.

Doce idiomas

Cada guía se traduce, no se sustituye con una máquina: cada idioma tiene su URL y su fecha de revisión.

Límites explícitos

Decimos con claridad cuándo una tarea no necesita un agente y un script sencillo sería más barato y fiable.