Probar agentes de IA: un conjunto de evaluación que vale su coste

Producción y operación 9 min de lectura

Una cuadrícula de resultados en pantalla con aciertos y fallos, junto a una lista impresa de casos
El fichero poco vistoso que decide si tu agente sale alguna vez del piloto.

La pregunta que separa a los agentes que se lanzan de los que se pudren en piloto es simple: ¿cómo sabes si el cambio de ayer lo mejoró? Sin respuesta, cada retoque de prompt es una apuesta y cada regresión la descubre un cliente.

Un conjunto de evaluación es la respuesta y no requiere plataforma. Cincuenta casos en un fichero, un script que los ejecuta y una regla de calificación por caso dicen más que cualquier tabla pública, porque son tus casos.

Cómo es un caso#

Un caso es una entrada, el estado inicial del mundo y una expectativa comprobable. La expectativa casi nunca es una cadena exacta: un agente puede acertar con varias redacciones. Califica el resultado: ¿llamó a la herramienta de reembolso con el pedido 4471?; ¿contiene la respuesta la fecha correcta?; ¿se negó y preguntó, como debía? Donde importe la prosa, una rúbrica calificada por modelo vale si es corta y la revisas a mano de vez en cuando.

Guarda el estado que necesita cada caso junto al caso. Una prueba que solo pasa los martes por datos en vivo no es una prueba.

Cincuenta casos y de dónde salen#

Probar agentes de IA: un conjunto de evaluación que vale su coste — Cincuenta casos y de dónde salen
FuenteCuántosPor qué
Peticiones reales frecuentes20Protege el camino cotidiano
Fallos pasados conocidos10Evita que vuelvan las regresiones
Entradas ambiguas8Debe preguntar, no adivinar
Casos que debe rechazar6Fuera de alcance, sin permiso, inseguro
Resultados vacíos o rotos6El incidente real más común

Califica resultados, no caminos#

Dos ejecuciones que llegan al mismo resultado correcto por rutas distintas son ambas correctas, y una suite que exige una transcripción fallará sin motivo. Comprueba qué cambió y qué se dijo: las llamadas con efectos, los datos clave de la respuesta, si se pidió puerta humana. Guarda la traza completa para depurar, pero no la afirmes en las pruebas.

Cuatro números a seguir#

  1. Tasa de éxito global y por separado en el subconjunto que debe rechazar.
  2. Tasa de afirmaciones sin respaldo: respuestas con datos ausentes de las pruebas.
  3. Mediana y percentil 95 de coste y latencia por ejecución.
  4. Tasa de intervención humana: cuántas veces alguien tuvo que entrar y por qué.

Ejecútalo en la tubería y también tras el lanzamiento#

Ejecuta el conjunto ante cualquier cambio de prompts, herramientas, versión de modelo o configuración de recuperación: solo esas cuatro cosas alteran el comportamiento y todas cambian más de lo que se cree. Tras lanzar, sigue muestreando tráfico real: unas ejecuciones al día calificadas a mano y todo lo sorprendente al conjunto. Un conjunto que deja de crecer deja de representar a tus usuarios en un trimestre.

Preguntas frecuentes

¿Con cuántos casos empiezo?

Cincuenta atrapan regresiones reales y se escriben en un par de días. Veinte bastan para empezar. Importa más cubrir las categorías incómodas: ambiguas, de rechazo y resultados vacíos.

¿Puedo calificar con un modelo?

Sí, con cuidado. Dale criterios explícitos en vez de preguntar si la respuesta es buena, mantén la rúbrica corta y revisa muestras a mano. Los calificadores derivan, y uno derivado aprueba regresiones.

¿Debe bloquear despliegues?

Bloquea en el subconjunto crítico — rechazos y todo lo irreversible. Para calidad general sigue la tendencia y exige decisión humana ante una caída; un movimiento pequeño puede ser ruido.

evaluar agentes iapruebas de agentesconjunto de evaluación llmpruebas de regresión llmmétricas de calidad

Todas las guías

Última actualización 2026-08-04 por aiagentdevelopment.info · Sobre nosotros

Escrito por quienes construyen

Cada guía la escriben ingenieros que operan agentes en producción, no se reescribe de otros sitios.

Revisado periódicamente

Este campo cambia rápido. Cada guía lleva la fecha de su última revisión, y la publicamos aunque no haya cambiado nada.

Sin espacios pagados

Ningún proveedor de modelos, framework o plataforma puede comprar una mención, una posición ni un enlace.

Doce idiomas

Cada guía se traduce, no se sustituye con una máquina: cada idioma tiene su URL y su fecha de revisión.

Límites explícitos

Decimos con claridad cuándo una tarea no necesita un agente y un script sencillo sería más barato y fiable.