Testare gli agenti AI: un set di valutazione che vale il suo costo

Produzione e operatività 9 min di lettura

Una griglia di risultati a schermo con superati e falliti, accanto a un elenco stampato di casi
Il file poco affascinante che decide se il vostro agente uscirà mai dal pilota.

La domanda che separa gli agenti che vanno in produzione da quelli che marciscono in pilota è semplice: come sapete se la modifica di ieri li ha migliorati? Senza risposta, ogni ritocco al prompt è una scommessa e ogni regressione la scopre un cliente.

Un set di valutazione è la risposta e non richiede una piattaforma. Cinquanta casi in un file, uno script che li esegue e una regola di valutazione per caso dicono più di qualsiasi classifica pubblica, perché sono i vostri casi.

Com'è fatto un caso#

Un caso è un input, lo stato iniziale del mondo e un'aspettativa verificabile. L'aspettativa non è quasi mai una stringa esatta: un agente può avere ragione in più formulazioni. Valutate l'esito: ha chiamato lo strumento di rimborso con l'ordine 4471; la risposta contiene la data corretta; ha rifiutato e chiesto, come doveva.

Salvate lo stato necessario insieme al caso. Un test che passa solo il martedì per via di dati live non è un test.

Cinquanta casi e da dove vengono#

Testare gli agenti AI: un set di valutazione che vale il suo costo — Cinquanta casi e da dove vengono
FonteQuanti circaPerché
Richieste reali frequenti dai log20Protegge il percorso quotidiano
Guasti passati noti10Impedisce il ritorno delle regressioni
Input ambigui8Deve chiedere, non indovinare
Casi da rifiutare6Fuori perimetro, non autorizzati, non sicuri
Risultati vuoti o rotti6L'incidente reale più comune

Valutate gli esiti, non i percorsi#

Due esecuzioni che arrivano allo stesso esito corretto per strade diverse sono entrambe corrette, e una suite che pretende una trascrizione fallirà di continuo senza motivo. Verificate cosa è cambiato e cosa è stato detto: le chiamate con effetti, i fatti chiave della risposta, se è stato richiesto un cancello umano.

Quattro numeri da seguire nel tempo#

  1. Tasso di successo sull'intero set e a parte sul sottoinsieme da rifiutare.
  2. Tasso di affermazioni non supportate.
  3. Mediana e 95° percentile di costo e latenza per esecuzione.
  4. Tasso di intervento umano: quanto spesso è servita una persona, e perché.

Eseguitelo nella pipeline e anche dopo il lancio#

Lanciate il set a ogni modifica di prompt, strumenti, versione del modello o configurazione del recupero. Dopo il lancio continuate a campionare traffico reale: qualche esecuzione al giorno valutata a mano, e tutto ciò che sorprende entra nel set.

Domande frequenti

Con quanti casi iniziare?

Cinquanta intercettano regressioni reali e si scrivono in un paio di giorni. Venti bastano per cominciare.

Posso far valutare da un modello?

Sì, con cura. Date criteri espliciti, tenete la griglia breve e controllate a mano un campione.

La valutazione deve bloccare i rilasci?

Bloccate sul sottoinsieme critico per la sicurezza. Per la qualità generale seguite la tendenza.

valutare agenti aitest degli agentiset di valutazione llmtest di regressione llmmetriche di qualità

Tutte le guide

Ultimo aggiornamento 2026-08-04 di aiagentdevelopment.info · Chi siamo

Scritto da chi costruisce

Ogni guida è scritta da ingegneri che gestiscono agenti in produzione, non rimaneggiata da altri siti.

Rivisto con regolarità

Il campo si muove in fretta. Ogni guida porta la data dell’ultima revisione, pubblicata anche quando non è cambiato nulla.

Nessuno spazio a pagamento

Nessun fornitore di modelli, framework o piattaforma può comprare una menzione, una posizione o un link.

Dodici lingue

Ogni guida è tradotta, non sostituita da una macchina: ogni lingua ha il proprio URL e la propria data di revisione.

Limiti dichiarati

Diciamo chiaramente quando un compito non ha bisogno di un agente e uno script semplice sarebbe più economico e affidabile.