Escalar agentes de IA: latência, concorrência e limites de ritmo
O primeiro pico de tráfego ensina a mesma lição a todas as equipas. Os servidores estão quase parados, a base de dados está bem e tudo está lento — porque cada pedido são várias chamadas de segundos a um fornecedor com quota.
Escalar agentes é, portanto, sobretudo teoria de filas e gestão de expectativas, mais um pouco de planeamento de capacidade.
Saibam qual dos três limites vos atinge#
| Sintoma | Limite provável | Correção |
|---|---|---|
| 429 do fornecedor | Pedidos ou tokens por minuto | Fila, backoff, distribuição por chaves ou regiões |
| Lento mas sem erros | Chamadas em série por execução | Paralelizar passos independentes |
| Memória ou ligações esgotadas | O vosso serviço | Trabalho de capacidade normal |
| Lento só no pico | Disputa de quota partilhada | Fila com prioridade |
Ponham em fila tudo o que não é interativo#
Dividam o tráfego em duas classes desde o primeiro dia. O trabalho interativo recebe prazo curto, teto de passos apertado e um modelo rápido onde a qualidade o permita. O trabalho de fundo vai para uma fila cuja concorrência controlam.
Encurtem a espera com honestidade#
- Transmitam a resposta à medida que é produzida.
- Mostrem o passo atual em linguagem simples.
- Ao atingir um teto, devolvam o resultado parcial útil e digam o que falta.
- Tirem do caminho crítico tudo o que não bloqueia.
A perceção de latência é tanto produto como engenharia.
Desenhem o modo degradado antes de precisar#
Decidam de antemão o que o agente faz quando o fornecedor está lento, sem quota ou em baixo. Uma escada sensata: agente completo, modelo alternativo mais barato, resposta só por recuperação sem ferramentas, e por fim desculpa honesta com passagem a uma pessoa.
Perguntas frequentes
Várias contas ou regiões do fornecedor?
Para escala ou resiliência reais, sim. Façam-no atrás de uma interface interna.
Como manter a latência interativa aceitável?
Tetos rígidos de passos, passos simples para um modelo rápido e transmissão.
O que parte primeiro com o crescimento?
Quase sempre os limites do fornecedor, depois a API interna da ferramenta mais usada.
escalar agentes ialimites de ritmo llmlatência de agentesfilas para llmmodo degradado