Reduzir o custo de um agente sem o piorar
Quando uma fatura de tokens surpreende alguém, o reflexo é passar a um modelo barato em todo o lado e aceitar a perda de qualidade. Raramente é preciso. Nos sistemas que auditámos, a maior parte da despesa vinha de contexto que não precisava de estar lá e de passos que não precisavam do modelo caro.
O método abaixo é aborrecido e eficaz: medir primeiro, depois aplicar quatro alterações por ordem de retorno.
Meçam por execução antes de mudar seja o que for#
O gasto mensal agregado não diz nada acionável. Registem por execução: tokens de entrada e saída, número de chamadas, modelo por chamada e tipo de tarefa. Depois olhem para o custo por tarefa concluída, por tipo.
Contem também as execuções falhadas no denominador.
As quatro alterações, por retorno#
| Alteração | Poupança típica | Risco |
|---|---|---|
| Podar o contexto: descartar documentos usados, comprimir histórico | 20–40% | Baixo se o objetivo continuar fixado |
| Encaminhar passos baratos para um modelo menor | 20–40% | Baixo, com avaliação por passo |
| Fazer cache do prefixo estável | 10–30% em tráfego repetido | Baixo |
| Reduzir passos: melhores ferramentas, menos repetições | 10–25% | Médio — exige trabalho nas ferramentas |
A fatura é o contexto#
Cada turno reenvia o contexto acumulado, por isso uma execução de oito passos pode pagar o mesmo documento oito vezes. Três hábitos resolvem quase tudo: descartar os excertos recuperados quando o seu passo acaba; comprimir turnos antigos em notas factuais; cortar os resultados das ferramentas aos campos usados.
Encaminhem por passo, não por gosto#
Extração, classificação e formatação raramente precisam do vosso modelo mais forte. Desçam o primeiro grupo um nível, corram o conjunto de avaliação e mantenham a alteração só se os números aguentarem.
- Comecem pelo passo de maior volume e menor juízo.
- Mudem um passo de cada vez e voltem a correr a avaliação.
- Registem que modelo produziu que decisão.
- Ponham um teto de gasto por execução.
Perguntas frequentes
Vale a pena o cache?
Se as execuções partilham um prefixo longo e estável, sim, e é das vitórias mais baratas.
Afinar para poupar?
Só para um passo de grande volume, estreito e estável.
Como evitar uma execução caríssima?
Tetos de passos e gasto por execução, deteção de chamadas idênticas repetidas e paragem com resultado parcial.
custos de agentes iaotimização de custos llmreduzir custo de tokenscache de promptsencaminhamento de modelos