Att testa och utvärdera AI-agenter innan de möter kunder
Den vanligaste orsaken till att ett agentprojekt fastnar är inte att modellen är för svag. Det är att teamet inte kan avgöra om gårdagens ändring gjorde saken bättre eller sämre, så varje beslut blir en åsikt.
Botemedlet är litet och tråkigt: en fast uppsättning verkliga fall, körd med ett kommando, med tre mått som alla i teamet förstår.
Mängden ni faktiskt behöver#
- Trettio till sextio fall hämtade ur riktiga loggar eller riktiga ärenden.
- Varje fall har indata, den kontext systemet skulle haft, och ett godkänt utfall.
- En tredjedel gränsfall: saknad data, motstridiga uppgifter, användare som ändrar sig.
- Minst fem fall där rätt beteende är att avstå eller eskalera.
- Fall som orsakat verkliga incidenter läggs till permanent.
Tre mått som räcker länge#
| Mått | Vad det fångar | Vad som är dåligt |
|---|---|---|
| Andel lösta utan människa | Om agenten gör nytta | Stiger när eskalering är trasig |
| Andel skadliga utfall | Fel som kostar pengar eller förtroende | Aldrig acceptabelt att ignorera |
| Kostnad och latens per körning | Om det går att skala | Dolt tills fakturan kommer |
Modell som domare, med disciplin#
Att låta en modell bedöma utfall fungerar när kriterierna är konkreta och ni kalibrerar domaren mot hundra manuellt märkta fall. Är domaren och den bedömda samma modell och prompt får ni beröm, inte mätning.
Behåll de manuella märkningarna. Domaren måste kalibreras om vid varje modellbyte.
Kör den där det gör skillnad#
Utvärderingen ska ligga i CI och blockera driftsättning vid regression på skadliga utfall. Ett urval bör också köras mot produktion dagligen, eftersom modeller och data driver även när er kod står still.
Vanliga frågor
Hur många fall behövs innan lansering?
Femtio noggrant valda fall slår femhundra slumpmässiga.
Kan jag använda en modell som bedömare?
Ja, kalibrerad mot manuella märkningar och helst en annan modell än den som testas.
Hur ofta uppdateras mängden?
Varje gång ett verkligt fel når produktion. Det felet blir ett permanent fall.
testa ai-agenteragentutvärderingllm-utvärderingregressionstest agentmodell som domare