Att välja modell till er agent: förmåga, latens och kostnad
Frågan som ställs är vilken modell som är bäst för agenter. Frågan som ger ett bra system är: vilken modell är bäst för det här steget, på våra data, inom vår latensbudget — och svaret är oftast fler än en.
En körning är inte homogen. Att välja nästa handling kräver resonemang. Att plocka tre fält ur ett dokument gör det inte.
Dela upp körningen innan ni väljer#
| Steg | Vad det kräver | Rimlig modellnivå |
|---|---|---|
| Planera eller välja handling | Resonemang, följa instruktioner | Den starkaste ni har råd med |
| Anropa verktyg med argument | Pålitlig strukturerad utdata | Mellanklass med strikta scheman |
| Plocka fält ur ett resultat | Träffsäkerhet på kort text | Liten och snabb |
| Klassificera eller routa | Konsekvens | Liten eller finjusterad klassificerare |
| Skriva användarsvaret | Ton och tydlighet | Mellanklass |
Benchmarks gör kortlistan, inte valet#
Publika benchmarks säger vilka modeller som är rimliga. De säger inte vilken som klarar era scheman, dokumentformat och besvärliga kunder. Bygg trettio verkliga fall ur era loggar och kör kortlistan mot dem.
Ta med fall där rätt beteende är att avstå eller fråga.
De tre begränsningar som verkligen biter#
- Latensgolv: varje anrop har ett, och en agent gör flera.
- Tillförlitlighet i strukturerad utdata: 97 % giltiga argument havererar en körning av tio med tre anrop.
- Kontextbeteende: lång kontext kostar och tunnar ut uppmärksamheten.
Routning utan forskningsprojekt#
Modellroutning låter avancerat och är oftast en konfigurationsfil. Standardmodell per stegtyp, åsidosättande per verktyg och en logg över vilken modell som gav vilket beslut.
Vanliga frågor
Ska jag använda största modellen överallt?
Bara om ni inte mätt. Beslutssteget vinner oftast; extraktion, klassificering och formatering sällan.
Duger öppna modeller för agenter?
För smala steg med strikta scheman ofta ja.
Hur ofta ska valet ses över?
Vid varje version ni skulle kunna anta, och annars ungefär varannat kvartal.
välja llmmodellval för agenterllm-routningagentlatensstrukturerad utdata