Agentkosten verlagen zonder de kwaliteit te schaden
Als een tokenrekening iemand verrast is de reflex overal op een goedkoop model over te stappen en kwaliteitsverlies te accepteren. Dat is zelden nodig. In de systemen die wij doorlichtten kwam het meeste uit context die er niet hoefde te zijn en uit stappen die geen duur model nodig hadden.
De methode hieronder is saai en effectief: eerst meten, dan vier wijzigingen op volgorde van opbrengst, dan beslissen of er nog een probleem is. De meeste teams stoppen na de tweede.
Meet per run vóór u iets verandert#
Maandtotalen zeggen niets bruikbaars. Log per run: invoer- en uitvoertokens, aantal aanroepen, model per aanroep en taaktype. Kijk dan naar kosten per afgeronde taak, uitgesplitst naar type.
Tel mislukte runs mee in de noemer. Een retrylus die drie pogingen verbrandt is een kostenprobleem vermomd als kwaliteitsprobleem.
De vier wijzigingen, op opbrengst#
| Wijziging | Typische besparing | Risico |
|---|---|---|
| Context snoeien: gebruikte documenten weggooien, historie samenpersen | 20–40% | Laag als het doel vastgezet blijft |
| Goedkope stappen naar een kleiner model routeren | 20–40% | Laag, met evaluatie per stap |
| Het stabiele promptvoorvoegsel cachen | 10–30% bij herhaald verkeer | Laag |
| Stappen verminderen: betere tools, minder retries | 10–25% | Middel — vraagt toolwerk |
De rekening is de context#
Elke beurt stuurt de opgebouwde context opnieuw, dus een run van acht stappen kan hetzelfde document acht keer betalen. Drie gewoonten lossen het meeste op: gooi opgehaalde passages weg zodra hun stap klaar is; pers oude beurten samen tot feitelijke notities; snijd toolresultaten terug tot de gebruikte velden.
Routeer per stap, niet op gevoel#
Extractie, classificatie en opmaak hebben zelden uw sterkste model nodig; plannen en gebruikersproza vaak wel. Zet de eerste groep een niveau lager, draai de evaluatieset en houd de wijziging alleen als de cijfers standhouden.
- Begin bij de stap met het hoogste volume en het minste oordeel.
- Wijzig één stap tegelijk en draai de evaluatie opnieuw.
- Log welk model welke beslissing produceerde.
- Zet een uitgavenlimiet per run.
Veelgestelde vragen
Is caching de moeite waard?
Als uw runs een lang stabiel voorvoegsel delen, ja, en het is een van de goedkoopste winsten.
Fine-tunen om te besparen?
Alleen voor een stap met hoog volume, smal en stabiel, waar een klein afgestemd model een groot evenaart.
Hoe voorkom ik één peperdure run?
Limieten op stappen en uitgaven per run, detectie van identieke herhaalde aanroepen en stoppen met deelresultaat.
ai agentkostenllm kostenoptimalisatietokenkosten verlagenprompt cachingmodelrouting