AI-agents testen: een evaluatieset die zijn kosten waard is

Productie en beheer 9 min lezen

Een resultatenraster op het scherm met geslaagd en gefaald, ernaast een geprinte caselijst
Het onopvallende bestand dat bepaalt of uw agent ooit uit de pilot komt.

De vraag die agents die live gaan scheidt van agents die in pilot wegkwijnen is simpel: hoe weet u of de wijziging van gisteren het beter maakte? Zonder antwoord is elke promptaanpassing een gok en wordt elke regressie door een klant ontdekt.

Een evaluatieset is het antwoord en vraagt geen platform. Vijftig cases in één bestand, een script dat ze draait en één beoordelingsregel per case zeggen meer dan elke ranglijst, want het zijn uw cases.

Hoe een case eruitziet#

Een case is een invoer, de begintoestand van de wereld en een toetsbare verwachting. Die verwachting is bijna nooit een exacte tekst — een agent kan in meerdere formuleringen gelijk hebben. Beoordeel de uitkomst: heeft hij de terugbetaaltool aangeroepen met bestelling 4471; bevat het eindantwoord de juiste datum; heeft hij geweigerd en doorgevraagd zoals het hoorde.

Bewaar de benodigde toestand bij de case. Een test die alleen op dinsdag slaagt door live data is geen test.

Vijftig cases en waar ze vandaan komen#

AI-agents testen: een evaluatieset die zijn kosten waard is — Vijftig cases en waar ze vandaan komen
BronOngeveer hoeveelWaarom
Veelvoorkomende echte verzoeken uit logs20Beschermt het dagelijkse pad
Bekende eerdere storingen10Voorkomt terugkerende regressies
Dubbelzinnige invoer8Moet doorvragen, niet gokken
Cases die geweigerd moeten worden6Buiten scope, onbevoegd, onveilig
Lege of kapotte toolresultaten6Het meest voorkomende echte incident

Beoordeel uitkomsten, geen paden#

Twee runs die via andere paden dezelfde juiste uitkomst bereiken zijn allebei correct, en een suite die één transcriptie eist faalt voortdurend zonder reden. Controleer wat er veranderde en wat er gezegd is: aanroepen met bijwerking, de kernfeiten van het antwoord, of er een menselijke poort werd gevraagd.

Vier getallen om in de tijd te volgen#

  1. Slaagpercentage over de hele set en apart over de weiger-subset.
  2. Percentage ongefundeerde beweringen.
  3. Mediaan en 95e percentiel van kosten en latency per run.
  4. Percentage menselijke interventies: hoe vaak iemand moest ingrijpen, en waarom.

Draai hem in de pijplijn en ook na de lancering#

Draai de set bij elke wijziging van prompts, tools, modelversie of retrievalconfiguratie. Blijf na de lancering echt verkeer bemonsteren: een paar runs per dag met de hand beoordeeld, en alles wat verrast gaat de set in.

Veelgestelde vragen

Met hoeveel cases beginnen?

Vijftig vangen echte regressies en zijn in een paar dagen geschreven. Twintig volstaan om te starten.

Mag een model beoordelen?

Ja, met zorg. Geef expliciete criteria, houd de rubriek kort en controleer regelmatig een steekproef met de hand.

Moet evaluatie deploys blokkeren?

Blokkeer op de veiligheidskritische subset. Voor algemene kwaliteit volgt u de trend.

ai agents evaluerenagenttestsllm evaluatiesetllm regressietestskwaliteitsmetrieken

Alle gidsen

Laatst bijgewerkt 2026-08-04 door aiagentdevelopment.info · Over ons

Door bouwers geschreven

Elke gids is geschreven door engineers die agents in productie draaien, niet overgeschreven van andere sites.

Periodiek herzien

Dit vakgebied beweegt snel. Elke gids draagt de datum van de laatste herziening, ook als er niets veranderde.

Geen betaalde plaatsingen

Geen modelaanbieder, framework of agentplatform kan hier een vermelding, positie of link kopen.

Twaalf talen

Elke gids is vertaald, niet machinaal vervangen — elke taal heeft een eigen URL en eigen herzieningsdatum.

Grenzen benoemd

We zeggen ronduit wanneer een taak geen agent nodig heeft en een eenvoudig script goedkoper en betrouwbaarder is.