Ridurre il costo di un agente senza peggiorarlo
Quando una bolletta di token sorprende qualcuno, l'istinto è passare ovunque a un modello economico accettando la perdita di qualità. Raramente serve. Nei sistemi che abbiamo verificato, gran parte della spesa veniva da contesto che non doveva esserci e da passi che non richiedevano il modello costoso.
Il metodo qui sotto è noioso ed efficace: prima misurare, poi applicare quattro modifiche in ordine di resa, poi decidere se c'è ancora un problema. La maggior parte dei team si ferma dopo la seconda.
Misurate per esecuzione prima di cambiare qualcosa#
La spesa mensile aggregata non dice nulla di azionabile. Registrate per esecuzione: token in ingresso e in uscita, numero di chiamate, modello per chiamata e tipo di compito. Poi guardate il costo per compito completato, diviso per tipo.
Contate anche le esecuzioni fallite al denominatore. Un ciclo di ritentativi che brucia tre tentativi è un problema di costo travestito da qualità.
Le quattro modifiche, per resa#
| Modifica | Risparmio tipico | Rischio |
|---|---|---|
| Potare il contesto: scartare documenti usati, comprimere la cronologia | 20–40% | Basso se l'obiettivo resta fissato |
| Instradare i passi economici su un modello più piccolo | 20–40% | Basso, con valutazione per passo |
| Mettere in cache il prefisso stabile | 10–30% su traffico ripetuto | Basso |
| Ridurre i passi: strumenti migliori, meno ritentativi | 10–25% | Medio: richiede lavoro sugli strumenti |
La bolletta è il contesto#
Ogni turno rispedisce il contesto accumulato, quindi un'esecuzione di otto passi può pagare lo stesso documento otto volte. Tre abitudini risolvono quasi tutto: scartate i passaggi recuperati quando il loro passo è finito; comprimete i turni vecchi in note fattuali; tagliate i risultati degli strumenti ai campi usati.
Instradate per passo, non per gusto#
Estrazione, classificazione e formattazione raramente richiedono il modello più forte; pianificazione e prosa per l'utente spesso sì. Abbassate il primo gruppo di un livello, lanciate il set di valutazione e tenete la modifica solo se i numeri reggono.
- Iniziate dal passo con più volume e meno giudizio.
- Cambiate un passo alla volta e rilanciate la valutazione.
- Registrate quale modello ha prodotto quale decisione.
- Fissate un tetto di spesa per esecuzione.
Domande frequenti
La cache conviene?
Se le esecuzioni condividono un prefisso lungo e stabile, sì, ed è una delle vittorie più economiche.
Conviene il fine-tuning per risparmiare?
Solo per un passo ad alto volume, stretto e stabile in cui un modello piccolo affinato eguaglia uno grande.
Come evito un'esecuzione costosissima?
Tetti di passi e spesa per esecuzione, rilevazione di chiamate identiche ripetute e arresto con risultato parziale.
costi agenti aiottimizzazione costi llmridurre il costo dei tokencache dei promptrouting dei modelli