Probar agentes de IA: un conjunto de evaluación que vale su coste
La pregunta que separa a los agentes que se lanzan de los que se pudren en piloto es simple: ¿cómo sabes si el cambio de ayer lo mejoró? Sin respuesta, cada retoque de prompt es una apuesta y cada regresión la descubre un cliente.
Un conjunto de evaluación es la respuesta y no requiere plataforma. Cincuenta casos en un fichero, un script que los ejecuta y una regla de calificación por caso dicen más que cualquier tabla pública, porque son tus casos.
Cómo es un caso#
Un caso es una entrada, el estado inicial del mundo y una expectativa comprobable. La expectativa casi nunca es una cadena exacta: un agente puede acertar con varias redacciones. Califica el resultado: ¿llamó a la herramienta de reembolso con el pedido 4471?; ¿contiene la respuesta la fecha correcta?; ¿se negó y preguntó, como debía? Donde importe la prosa, una rúbrica calificada por modelo vale si es corta y la revisas a mano de vez en cuando.
Guarda el estado que necesita cada caso junto al caso. Una prueba que solo pasa los martes por datos en vivo no es una prueba.
Cincuenta casos y de dónde salen#
| Fuente | Cuántos | Por qué |
|---|---|---|
| Peticiones reales frecuentes | 20 | Protege el camino cotidiano |
| Fallos pasados conocidos | 10 | Evita que vuelvan las regresiones |
| Entradas ambiguas | 8 | Debe preguntar, no adivinar |
| Casos que debe rechazar | 6 | Fuera de alcance, sin permiso, inseguro |
| Resultados vacíos o rotos | 6 | El incidente real más común |
Califica resultados, no caminos#
Dos ejecuciones que llegan al mismo resultado correcto por rutas distintas son ambas correctas, y una suite que exige una transcripción fallará sin motivo. Comprueba qué cambió y qué se dijo: las llamadas con efectos, los datos clave de la respuesta, si se pidió puerta humana. Guarda la traza completa para depurar, pero no la afirmes en las pruebas.
Cuatro números a seguir#
- Tasa de éxito global y por separado en el subconjunto que debe rechazar.
- Tasa de afirmaciones sin respaldo: respuestas con datos ausentes de las pruebas.
- Mediana y percentil 95 de coste y latencia por ejecución.
- Tasa de intervención humana: cuántas veces alguien tuvo que entrar y por qué.
Ejecútalo en la tubería y también tras el lanzamiento#
Ejecuta el conjunto ante cualquier cambio de prompts, herramientas, versión de modelo o configuración de recuperación: solo esas cuatro cosas alteran el comportamiento y todas cambian más de lo que se cree. Tras lanzar, sigue muestreando tráfico real: unas ejecuciones al día calificadas a mano y todo lo sorprendente al conjunto. Un conjunto que deja de crecer deja de representar a tus usuarios en un trimestre.
Preguntas frecuentes
¿Con cuántos casos empiezo?
Cincuenta atrapan regresiones reales y se escriben en un par de días. Veinte bastan para empezar. Importa más cubrir las categorías incómodas: ambiguas, de rechazo y resultados vacíos.
¿Puedo calificar con un modelo?
Sí, con cuidado. Dale criterios explícitos en vez de preguntar si la respuesta es buena, mantén la rúbrica corta y revisa muestras a mano. Los calificadores derivan, y uno derivado aprueba regresiones.
¿Debe bloquear despliegues?
Bloquea en el subconjunto crítico — rechazos y todo lo irreversible. Para calidad general sigue la tendencia y exige decisión humana ante una caída; un movimiento pequeño puede ser ruido.
evaluar agentes iapruebas de agentesconjunto de evaluación llmpruebas de regresión llmmétricas de calidad