Een model kiezen voor uw agent: vermogen, latency en kosten
De gestelde vraag is welk model het beste is voor agents. De vraag die een goed systeem oplevert is: welk model is het beste voor deze stap, op onze data, binnen ons latencybudget — en het antwoord is meestal meer dan één.
Een run is niet homogeen. De volgende actie kiezen vraagt redeneren. Drie velden uit een document halen niet. Een resultaat samenvatten voor de gebruiker ook niet. Alles als één inkoopbeslissing behandelen is hoe teams topprijzen betalen om JSON te herschikken.
Splits de run vóór u kiest#
| Stap | Wat het vraagt | Zinnig modelniveau |
|---|---|---|
| Plannen of actie kiezen | Redeneren, instructies volgen | Het sterkste dat u zich kunt veroorloven |
| Tool aanroepen met argumenten | Betrouwbare gestructureerde uitvoer | Middenklasse met strikte schema's |
| Velden uit een resultaat halen | Nauwkeurigheid op korte tekst | Klein en snel |
| Classificeren of routeren | Consistentie | Klein of afgestemde classifier |
| Het gebruikersantwoord schrijven | Toon en helderheid | Middenklasse |
Benchmarks maken de shortlist, niet de keuze#
Publieke benchmarks zeggen welke modellen plausibel zijn. Ze zeggen niet welk model uw schema's, documentformaten en lastige klanten aankan. Bouw dertig echte cases uit uw logs — inclusief de vijf gênante — en laat de shortlist daarop lopen.
Neem cases op waarin het juiste gedrag weigeren of doorvragen is. Modellen verschillen veel meer in weten wanneer te stoppen.
De drie beperkingen die echt knellen#
- Latencyvloer: elke aanroep heeft er een en een agent doet er meerdere. Meet de hele run.
- Betrouwbaarheid van gestructureerde uitvoer: 97% geldige argumenten breekt één op tien runs met drie aanroepen.
- Contextgedrag: lange context kost en verdunt aandacht; meet op de echte lengte.
Routing zonder onderzoeksproject#
Modelrouting klinkt geavanceerd en is meestal een configuratiebestand. Een standaardmodel per staptype, een override per tool, en loggen welk model welke beslissing produceerde. Begin met alleen extractie en classificatie een niveau lager.
Veelgestelde vragen
Overal het grootste model?
Alleen als u niet gemeten heeft. De beslisstap profiteert meestal; extractie, classificatie en opmaak zelden.
Werken open modellen voor agents?
Voor smalle stappen met strikte schema's vaak wel, en op volume is de economie overtuigend.
Hoe vaak herzien?
Bij elke versie die u zou kunnen overnemen, en verder ongeveer elke twee kwartalen.
llm kiezenmodelselectie agentsllm routingagentlatencygestructureerde uitvoer