Memória nos agentes de IA: o que guardar, comprimir e deitar fora
Numa chamada a um modelo não existe memória. Cada turno é um pedido novo e o modelo só sabe o que montaram desta vez. Tudo o que as pessoas descrevem como um agente que se esquece é uma decisão do vosso código sobre o que levar consigo.
Aceite isso, o desenho da memória torna-se um problema de engenharia familiar.
As quatro camadas#
| Camada | Conteúdo | Podada? | Tamanho típico |
|---|---|---|---|
| Fixada | Objetivo, restrições, identidade, política | Nunca | 200–500 tokens |
| Recente | Últimos turnos literais, com resultados | Janela deslizante | 2–5 turnos |
| Comprimida | Turnos antigos como notas factuais curtas | Reescrita ao crescer | Menos de 500 tokens |
| Recuperada | Documentos trazidos para este passo | Descartados após uso | Por passo |
Comprimam factos, não prosa#
O erro habitual é resumir turnos antigos como narrativa. Comprimam para os factos que um passo posterior possa precisar: encomenda 4471, estado enviado, reembolso pedido, política 30 dias, ainda sem reembolso.
Comprimam a um limiar, não em cada turno.
Recuperar não é recordar#
Documentos tirados de uma base de conhecimento pertencem ao passo que deles precisou. Mantê-los no contexto depois é o caminho mais rápido para uma execução inchada, cara e distraída.
Memória persistente entre sessões#
Agentes de vida longa acumulam factos úteis sobre uma pessoa ou conta. Guardem-nos de propósito, num pequeno registo estruturado com um passo de escrita explícito.
- Escrevam de propósito — uma chamada de ferramenta, não um efeito lateral.
- Guardem fonte e data ao lado de cada facto.
- Limitem o tamanho e façam expirar o que não se usa.
- Deixem a pessoa ver e corrigir o que está guardado sobre si.
Perguntas frequentes
Quanto histórico manter literal?
Três a cinco turnos cobrem quase todo o raciocínio sem dominar o contexto.
É preciso base vetorial para a memória?
Para recuperar documentos muitas vezes sim. Para o estado de uma execução não.
Como evitar memória persistente desatualizada?
Deem a cada facto fonte, data e validade, e façam o recuperado fresco ter prioridade.
memória de agentes iagestão de contextoresumo de conversamemória persistentejanela de contexto llm