AI-agents testen: een evaluatieset die zijn kosten waard is
De vraag die agents die live gaan scheidt van agents die in pilot wegkwijnen is simpel: hoe weet u of de wijziging van gisteren het beter maakte? Zonder antwoord is elke promptaanpassing een gok en wordt elke regressie door een klant ontdekt.
Een evaluatieset is het antwoord en vraagt geen platform. Vijftig cases in één bestand, een script dat ze draait en één beoordelingsregel per case zeggen meer dan elke ranglijst, want het zijn uw cases.
Hoe een case eruitziet#
Een case is een invoer, de begintoestand van de wereld en een toetsbare verwachting. Die verwachting is bijna nooit een exacte tekst — een agent kan in meerdere formuleringen gelijk hebben. Beoordeel de uitkomst: heeft hij de terugbetaaltool aangeroepen met bestelling 4471; bevat het eindantwoord de juiste datum; heeft hij geweigerd en doorgevraagd zoals het hoorde.
Bewaar de benodigde toestand bij de case. Een test die alleen op dinsdag slaagt door live data is geen test.
Vijftig cases en waar ze vandaan komen#
| Bron | Ongeveer hoeveel | Waarom |
|---|---|---|
| Veelvoorkomende echte verzoeken uit logs | 20 | Beschermt het dagelijkse pad |
| Bekende eerdere storingen | 10 | Voorkomt terugkerende regressies |
| Dubbelzinnige invoer | 8 | Moet doorvragen, niet gokken |
| Cases die geweigerd moeten worden | 6 | Buiten scope, onbevoegd, onveilig |
| Lege of kapotte toolresultaten | 6 | Het meest voorkomende echte incident |
Beoordeel uitkomsten, geen paden#
Twee runs die via andere paden dezelfde juiste uitkomst bereiken zijn allebei correct, en een suite die één transcriptie eist faalt voortdurend zonder reden. Controleer wat er veranderde en wat er gezegd is: aanroepen met bijwerking, de kernfeiten van het antwoord, of er een menselijke poort werd gevraagd.
Vier getallen om in de tijd te volgen#
- Slaagpercentage over de hele set en apart over de weiger-subset.
- Percentage ongefundeerde beweringen.
- Mediaan en 95e percentiel van kosten en latency per run.
- Percentage menselijke interventies: hoe vaak iemand moest ingrijpen, en waarom.
Draai hem in de pijplijn en ook na de lancering#
Draai de set bij elke wijziging van prompts, tools, modelversie of retrievalconfiguratie. Blijf na de lancering echt verkeer bemonsteren: een paar runs per dag met de hand beoordeeld, en alles wat verrast gaat de set in.
Veelgestelde vragen
Met hoeveel cases beginnen?
Vijftig vangen echte regressies en zijn in een paar dagen geschreven. Twintig volstaan om te starten.
Mag een model beoordelen?
Ja, met zorg. Geef expliciete criteria, houd de rubriek kort en controleer regelmatig een steekproef met de hand.
Moet evaluatie deploys blokkeren?
Blokkeer op de veiligheidskritische subset. Voor algemene kwaliteit volgt u de trend.
ai agents evaluerenagenttestsllm evaluatiesetllm regressietestskwaliteitsmetrieken