Reduzir o custo de um agente sem o piorar

Produção e operação 8 min de leitura

Uma linha descendente num painel ao lado de uma calculadora e apontamentos
Duas alterações explicam normalmente a maior parte da descida, e nenhuma toca na qualidade.

Quando uma fatura de tokens surpreende alguém, o reflexo é passar a um modelo barato em todo o lado e aceitar a perda de qualidade. Raramente é preciso. Nos sistemas que auditámos, a maior parte da despesa vinha de contexto que não precisava de estar lá e de passos que não precisavam do modelo caro.

O método abaixo é aborrecido e eficaz: medir primeiro, depois aplicar quatro alterações por ordem de retorno.

Meçam por execução antes de mudar seja o que for#

O gasto mensal agregado não diz nada acionável. Registem por execução: tokens de entrada e saída, número de chamadas, modelo por chamada e tipo de tarefa. Depois olhem para o custo por tarefa concluída, por tipo.

Contem também as execuções falhadas no denominador.

As quatro alterações, por retorno#

Reduzir o custo de um agente sem o piorar — As quatro alterações, por retorno
AlteraçãoPoupança típicaRisco
Podar o contexto: descartar documentos usados, comprimir histórico20–40%Baixo se o objetivo continuar fixado
Encaminhar passos baratos para um modelo menor20–40%Baixo, com avaliação por passo
Fazer cache do prefixo estável10–30% em tráfego repetidoBaixo
Reduzir passos: melhores ferramentas, menos repetições10–25%Médio — exige trabalho nas ferramentas

A fatura é o contexto#

Cada turno reenvia o contexto acumulado, por isso uma execução de oito passos pode pagar o mesmo documento oito vezes. Três hábitos resolvem quase tudo: descartar os excertos recuperados quando o seu passo acaba; comprimir turnos antigos em notas factuais; cortar os resultados das ferramentas aos campos usados.

Encaminhem por passo, não por gosto#

Extração, classificação e formatação raramente precisam do vosso modelo mais forte. Desçam o primeiro grupo um nível, corram o conjunto de avaliação e mantenham a alteração só se os números aguentarem.

  1. Comecem pelo passo de maior volume e menor juízo.
  2. Mudem um passo de cada vez e voltem a correr a avaliação.
  3. Registem que modelo produziu que decisão.
  4. Ponham um teto de gasto por execução.

Perguntas frequentes

Vale a pena o cache?

Se as execuções partilham um prefixo longo e estável, sim, e é das vitórias mais baratas.

Afinar para poupar?

Só para um passo de grande volume, estreito e estável.

Como evitar uma execução caríssima?

Tetos de passos e gasto por execução, deteção de chamadas idênticas repetidas e paragem com resultado parcial.

custos de agentes iaotimização de custos llmreduzir custo de tokenscache de promptsencaminhamento de modelos

Todos os guias

Última atualização 2026-08-04 por aiagentdevelopment.info · Sobre nós

Escrito por quem constrói

Cada guia é escrito por engenheiros que operam agentes em produção, não reescrito a partir de outros sites.

Revisto com regularidade

A área muda depressa. Cada guia traz a data da última revisão, publicada mesmo quando nada mudou.

Sem espaços pagos

Nenhum fornecedor de modelos, framework ou plataforma pode comprar uma menção, uma posição ou uma ligação.

Doze idiomas

Cada guia é traduzido, não substituído por máquina — cada idioma tem o seu URL e a sua data de revisão.

Limites nomeados

Dizemos com clareza quando uma tarefa não precisa de agente e um script simples sairia mais barato e mais fiável.