Ridurre il costo di un agente senza peggiorarlo

Produzione e operatività 8 min di lettura

Una linea discendente su un cruscotto accanto a una calcolatrice e ad appunti
Due modifiche spiegano di solito la maggior parte del calo, e nessuna tocca la qualità.

Quando una bolletta di token sorprende qualcuno, l'istinto è passare ovunque a un modello economico accettando la perdita di qualità. Raramente serve. Nei sistemi che abbiamo verificato, gran parte della spesa veniva da contesto che non doveva esserci e da passi che non richiedevano il modello costoso.

Il metodo qui sotto è noioso ed efficace: prima misurare, poi applicare quattro modifiche in ordine di resa, poi decidere se c'è ancora un problema. La maggior parte dei team si ferma dopo la seconda.

Misurate per esecuzione prima di cambiare qualcosa#

La spesa mensile aggregata non dice nulla di azionabile. Registrate per esecuzione: token in ingresso e in uscita, numero di chiamate, modello per chiamata e tipo di compito. Poi guardate il costo per compito completato, diviso per tipo.

Contate anche le esecuzioni fallite al denominatore. Un ciclo di ritentativi che brucia tre tentativi è un problema di costo travestito da qualità.

Le quattro modifiche, per resa#

Ridurre il costo di un agente senza peggiorarlo — Le quattro modifiche, per resa
ModificaRisparmio tipicoRischio
Potare il contesto: scartare documenti usati, comprimere la cronologia20–40%Basso se l'obiettivo resta fissato
Instradare i passi economici su un modello più piccolo20–40%Basso, con valutazione per passo
Mettere in cache il prefisso stabile10–30% su traffico ripetutoBasso
Ridurre i passi: strumenti migliori, meno ritentativi10–25%Medio: richiede lavoro sugli strumenti

La bolletta è il contesto#

Ogni turno rispedisce il contesto accumulato, quindi un'esecuzione di otto passi può pagare lo stesso documento otto volte. Tre abitudini risolvono quasi tutto: scartate i passaggi recuperati quando il loro passo è finito; comprimete i turni vecchi in note fattuali; tagliate i risultati degli strumenti ai campi usati.

Instradate per passo, non per gusto#

Estrazione, classificazione e formattazione raramente richiedono il modello più forte; pianificazione e prosa per l'utente spesso sì. Abbassate il primo gruppo di un livello, lanciate il set di valutazione e tenete la modifica solo se i numeri reggono.

  1. Iniziate dal passo con più volume e meno giudizio.
  2. Cambiate un passo alla volta e rilanciate la valutazione.
  3. Registrate quale modello ha prodotto quale decisione.
  4. Fissate un tetto di spesa per esecuzione.

Domande frequenti

La cache conviene?

Se le esecuzioni condividono un prefisso lungo e stabile, sì, ed è una delle vittorie più economiche.

Conviene il fine-tuning per risparmiare?

Solo per un passo ad alto volume, stretto e stabile in cui un modello piccolo affinato eguaglia uno grande.

Come evito un'esecuzione costosissima?

Tetti di passi e spesa per esecuzione, rilevazione di chiamate identiche ripetute e arresto con risultato parziale.

costi agenti aiottimizzazione costi llmridurre il costo dei tokencache dei promptrouting dei modelli

Tutte le guide

Ultimo aggiornamento 2026-08-04 di aiagentdevelopment.info · Chi siamo

Scritto da chi costruisce

Ogni guida è scritta da ingegneri che gestiscono agenti in produzione, non rimaneggiata da altri siti.

Rivisto con regolarità

Il campo si muove in fretta. Ogni guida porta la data dell’ultima revisione, pubblicata anche quando non è cambiato nulla.

Nessuno spazio a pagamento

Nessun fornitore di modelli, framework o piattaforma può comprare una menzione, una posizione o un link.

Dodici lingue

Ogni guida è tradotta, non sostituita da una macchina: ogni lingua ha il proprio URL e la propria data di revisione.

Limiti dichiarati

Diciamo chiaramente quando un compito non ha bisogno di un agente e uno script semplice sarebbe più economico e affidabile.