Testare gli agenti AI: un set di valutazione che vale il suo costo
La domanda che separa gli agenti che vanno in produzione da quelli che marciscono in pilota è semplice: come sapete se la modifica di ieri li ha migliorati? Senza risposta, ogni ritocco al prompt è una scommessa e ogni regressione la scopre un cliente.
Un set di valutazione è la risposta e non richiede una piattaforma. Cinquanta casi in un file, uno script che li esegue e una regola di valutazione per caso dicono più di qualsiasi classifica pubblica, perché sono i vostri casi.
Com'è fatto un caso#
Un caso è un input, lo stato iniziale del mondo e un'aspettativa verificabile. L'aspettativa non è quasi mai una stringa esatta: un agente può avere ragione in più formulazioni. Valutate l'esito: ha chiamato lo strumento di rimborso con l'ordine 4471; la risposta contiene la data corretta; ha rifiutato e chiesto, come doveva.
Salvate lo stato necessario insieme al caso. Un test che passa solo il martedì per via di dati live non è un test.
Cinquanta casi e da dove vengono#
| Fonte | Quanti circa | Perché |
|---|---|---|
| Richieste reali frequenti dai log | 20 | Protegge il percorso quotidiano |
| Guasti passati noti | 10 | Impedisce il ritorno delle regressioni |
| Input ambigui | 8 | Deve chiedere, non indovinare |
| Casi da rifiutare | 6 | Fuori perimetro, non autorizzati, non sicuri |
| Risultati vuoti o rotti | 6 | L'incidente reale più comune |
Valutate gli esiti, non i percorsi#
Due esecuzioni che arrivano allo stesso esito corretto per strade diverse sono entrambe corrette, e una suite che pretende una trascrizione fallirà di continuo senza motivo. Verificate cosa è cambiato e cosa è stato detto: le chiamate con effetti, i fatti chiave della risposta, se è stato richiesto un cancello umano.
Quattro numeri da seguire nel tempo#
- Tasso di successo sull'intero set e a parte sul sottoinsieme da rifiutare.
- Tasso di affermazioni non supportate.
- Mediana e 95° percentile di costo e latenza per esecuzione.
- Tasso di intervento umano: quanto spesso è servita una persona, e perché.
Eseguitelo nella pipeline e anche dopo il lancio#
Lanciate il set a ogni modifica di prompt, strumenti, versione del modello o configurazione del recupero. Dopo il lancio continuate a campionare traffico reale: qualche esecuzione al giorno valutata a mano, e tutto ciò che sorprende entra nel set.
Domande frequenti
Con quanti casi iniziare?
Cinquanta intercettano regressioni reali e si scrivono in un paio di giorni. Venti bastano per cominciare.
Posso far valutare da un modello?
Sì, con cura. Date criteri espliciti, tenete la griglia breve e controllate a mano un campione.
La valutazione deve bloccare i rilasci?
Bloccate sul sottoinsieme critico per la sicurezza. Per la qualità generale seguite la tendenza.
valutare agenti aitest degli agentiset di valutazione llmtest di regressione llmmetriche di qualità