Scegliere il modello per il vostro agente: capacità, latenza e costo

Framework e modelli 8 min di lettura

Una bilancia disegnata su carta pesa velocità contro accuratezza, accanto a un portatile
Ogni passo dell'esecuzione ha la propria risposta a questa domanda.

La domanda che si sente è quale sia il modello migliore per gli agenti. Quella che produce un buon sistema è: quale modello è migliore per questo passo, sui nostri dati, nel nostro budget di latenza — e la risposta di solito è più di uno.

Un'esecuzione non è omogenea. Decidere l'azione successiva richiede ragionamento. Estrarre tre campi da un documento no. Riassumere un risultato per l'utente nemmeno. Trattare tutto come un unico acquisto è così che si finisce a pagare prezzi di punta per riformattare JSON.

Dividete l'esecuzione prima di scegliere#

Scegliere il modello per il vostro agente: capacità, latenza e costo — Dividete l'esecuzione prima di scegliere
PassoCosa richiedeLivello di modello sensato
Pianificare o scegliere l'azioneRagionamento, aderenza alle istruzioniIl più forte che potete permettervi
Chiamare uno strumento con argomentiOutput strutturato affidabileFascia media con schemi rigidi
Estrarre campi da un risultatoPrecisione su testo brevePiccolo e veloce
Classificare o instradareCoerenzaPiccolo o classificatore affinato
Scrivere la risposta all'utenteTono e chiarezzaFascia media

I benchmark fanno la rosa, non la decisione#

I benchmark pubblici dicono quali modelli sono plausibili. Non dicono quale regge i vostri schemi, i vostri formati e i vostri clienti difficili. Costruite trenta casi reali dai vostri log — inclusi i cinque imbarazzanti — e fate girare la rosa su quelli.

Includete casi in cui la condotta giusta è rifiutare o chiedere. I modelli differiscono molto di più sul sapere quando fermarsi.

I tre vincoli che stringono davvero#

  1. Pavimento di latenza: ogni chiamata ne ha uno e un agente ne fa parecchie. Misurate l'intera esecuzione.
  2. Affidabilità dell'output strutturato: il 97% di argomenti validi rompe un'esecuzione su dieci con tre chiamate.
  3. Gestione del contesto: il contesto lungo costa e diluisce l'attenzione; misurate alla lunghezza reale.

Routing senza progetto di ricerca#

Il routing dei modelli sembra sofisticato ed è di solito un file di configurazione. Modello predefinito per tipo di passo, override per strumento, e un log di quale modello ha prodotto quale decisione. Cominciate abbassando di un livello solo estrazione e classificazione.

Domande frequenti

Uso il modello più grande per tutto?

Solo se non avete misurato. Il passo decisionale di solito ne beneficia; estrazione, classificazione e formattazione raramente.

I modelli aperti funzionano per gli agenti?

Per passi stretti con schemi rigidi spesso sì, e a volume l'economia è convincente.

Ogni quanto rivedere la scelta?

A ogni versione che potreste adottare e, per il resto, circa ogni due trimestri.

scegliere llmselezione modello agentirouting modellilatenza agentioutput strutturato

Tutte le guide

Ultimo aggiornamento 2026-08-04 di aiagentdevelopment.info · Chi siamo

Scritto da chi costruisce

Ogni guida è scritta da ingegneri che gestiscono agenti in produzione, non rimaneggiata da altri siti.

Rivisto con regolarità

Il campo si muove in fretta. Ogni guida porta la data dell’ultima revisione, pubblicata anche quando non è cambiato nulla.

Nessuno spazio a pagamento

Nessun fornitore di modelli, framework o piattaforma può comprare una menzione, una posizione o un link.

Dodici lingue

Ogni guida è tradotta, non sostituita da una macchina: ogni lingua ha il proprio URL e la propria data di revisione.

Limiti dichiarati

Diciamo chiaramente quando un compito non ha bisogno di un agente e uno script semplice sarebbe più economico e affidabile.