Scegliere il modello per il vostro agente: capacità, latenza e costo
La domanda che si sente è quale sia il modello migliore per gli agenti. Quella che produce un buon sistema è: quale modello è migliore per questo passo, sui nostri dati, nel nostro budget di latenza — e la risposta di solito è più di uno.
Un'esecuzione non è omogenea. Decidere l'azione successiva richiede ragionamento. Estrarre tre campi da un documento no. Riassumere un risultato per l'utente nemmeno. Trattare tutto come un unico acquisto è così che si finisce a pagare prezzi di punta per riformattare JSON.
Dividete l'esecuzione prima di scegliere#
| Passo | Cosa richiede | Livello di modello sensato |
|---|---|---|
| Pianificare o scegliere l'azione | Ragionamento, aderenza alle istruzioni | Il più forte che potete permettervi |
| Chiamare uno strumento con argomenti | Output strutturato affidabile | Fascia media con schemi rigidi |
| Estrarre campi da un risultato | Precisione su testo breve | Piccolo e veloce |
| Classificare o instradare | Coerenza | Piccolo o classificatore affinato |
| Scrivere la risposta all'utente | Tono e chiarezza | Fascia media |
I benchmark fanno la rosa, non la decisione#
I benchmark pubblici dicono quali modelli sono plausibili. Non dicono quale regge i vostri schemi, i vostri formati e i vostri clienti difficili. Costruite trenta casi reali dai vostri log — inclusi i cinque imbarazzanti — e fate girare la rosa su quelli.
Includete casi in cui la condotta giusta è rifiutare o chiedere. I modelli differiscono molto di più sul sapere quando fermarsi.
I tre vincoli che stringono davvero#
- Pavimento di latenza: ogni chiamata ne ha uno e un agente ne fa parecchie. Misurate l'intera esecuzione.
- Affidabilità dell'output strutturato: il 97% di argomenti validi rompe un'esecuzione su dieci con tre chiamate.
- Gestione del contesto: il contesto lungo costa e diluisce l'attenzione; misurate alla lunghezza reale.
Routing senza progetto di ricerca#
Il routing dei modelli sembra sofisticato ed è di solito un file di configurazione. Modello predefinito per tipo di passo, override per strumento, e un log di quale modello ha prodotto quale decisione. Cominciate abbassando di un livello solo estrazione e classificazione.
Domande frequenti
Uso il modello più grande per tutto?
Solo se non avete misurato. Il passo decisionale di solito ne beneficia; estrazione, classificazione e formattazione raramente.
I modelli aperti funzionano per gli agenti?
Per passi stretti con schemi rigidi spesso sì, e a volume l'economia è convincente.
Ogni quanto rivedere la scelta?
A ogni versione che potreste adottare e, per il resto, circa ogni due trimestri.
scegliere llmselezione modello agentirouting modellilatenza agentioutput strutturato