Att skala AI-agenter från pilot till full trafik
En pilot med femtio körningar om dagen döljer nästan varje skalningsproblem ni kommer att få. Vid femtusen körningar om dagen kommer problemen i en förutsägbar ordning, och de har mest att göra med er infrastruktur och era beroenden.
Flaskhalsarna i den ordning de kommer#
- Leverantörskvoter: begärningar och tokens per minut, ofta först och plötsligt.
- Samtidighet i era egna verktyg: den interna API:n som var lugn tar nu emot tio anrop per körning.
- Långa körningar som håller processer upptagna och blockerar kön.
- Kostnadens p95, som växer fortare än medelvärdet.
- Utvärderingstäckning som inte hängt med i verktygsytan.
Vad som brukar hjälpa#
| Problem | Åtgärd |
|---|---|
| Kvottak | Kö med hastighetsstyrning och avbrytare |
| Belastning på interna API:er | Cache av läsningar, samla anrop, timeouter |
| Långa körningar | Varaktiga steg, återupptagning, taggade tak |
| Toppar i kostnad | Tak per körning, nivåindelade modeller |
| Regressioner i tysthet | Utvärdering i CI och dagligt urval |
Nedgraderingsvägen#
Bestäm i förväg vad agenten gör när modellen är otillgänglig eller kvoten slut: kö och svara senare, växla till mindre modell, eller lämna direkt till en människa med kontext. Utan beslutet får ni det värsta av tre.
Skriv det i körboken och testa det med en avstängd nyckel.
Organisatorisk skala räknas också#
Vid full trafik behöver agenten en ägare, en jourrotation som förstår spåren och en rutin där varje verklig incident blir ett permanent utvärderingsfall.
Vanliga frågor
Vad går sönder först?
Nästan alltid leverantörskvoter, och nästan alltid vid fel tidpunkt.
Behöver jag flera leverantörer?
Bara om nedtid är dyrt. Håll i så fall prompter och scheman portabla.
Hur planeras kapacitet?
Utifrån körningar per minut i topp och medelantal modellanrop per körning.
skala agenterkapacitetsplaneringhastighetsbegränsningavbrytareagentinfrastruktur