Kostnadsoptimering: var pengarna faktiskt tar vägen
Team som blir förvånade av sin faktura har oftast optimerat fel sak. De jämförde tokenpriser mellan leverantörer när problemet var att medelkörningen tog nio varv och skickade med hela dokument som ingen läste.
Kostnad per körning är måttet. Allt annat är en delfaktor.
Var pengarna går#
| Orsak | Typisk andel | Åtgärd |
|---|---|---|
| Onödiga varv | Störst | Slå ihop verktyg, skärp stoppvillkor |
| Hela dokument i kontexten | Stor | Returnera fält, inte objekt |
| All historik varje varv | Stor | Sammanfatta och hämta selektivt |
| För stark modell på tråkiga steg | Medel | Nivåindela per steg |
| Blinda omförsök | Medel | Instruerande fel, tak på försök |
Ordningen som ger mest per timme#
- Mät kostnad per körning och per körningstyp i en vecka. Ni kommer att bli överraskade.
- Ta bort onödiga varv: överlappande verktyg är den vanligaste orsaken.
- Krymp det som skickas in: fält i stället för objekt, sammanfattning i stället för historik.
- Nivåindela modeller per steg.
- Aktivera promptcache för de stabila delarna av systemtexten.
- Sätt hårda tak per körning och larma på avvikelser.
Tak som skyddar mot mardrömmen#
En loop som inte kan sluta är en faktura som inte kan sluta. Varje agent behöver maxvarv, maxkostnad och maxväggtid, och ett avslut som lämnar över till en människa när något av taken nås.
Testa taken i CI. Ett tak ingen provat är en förhoppning.
Vad ni inte bör göra#
Sänk inte kvaliteten på beslutssteget för att spara. Det är det billigaste steget att göra bra och det dyraste att göra fel, eftersom ett dåligt beslut betalar för fler varv.
Vanliga frågor
Sänker en billigare modell kostnaden mest?
Sällan. Färre varv och mindre kontext ger oftast större effekt.
Hjälper promptcache?
Ja, när systemtexten är stabil och prefixet oförändrat mellan anrop.
Vad är en rimlig kostnad per körning?
Den som är lägre än det manuella arbetet den ersätter, med marginal.
agentkostnadllm-kostnadsoptimeringtokenkostnadpromptcachekostnad per körning