Um roteiro de agentes de IA que chega mesmo a produção
O padrão de falha dos projetos de agentes não é técnico. É um bom protótipo na terceira semana, seguido de três meses de melhoria sem rumo e um cancelamento silencioso porque ninguém soube dizer se estava pronto.
Este roteiro corrige isso com testes de saída. Cada fase tem uma condição escrita antes de começar.
Fase 1 — Âmbito (1–2 semanas)#
Escrevam a tarefa como uma frase que alguém possa marcar certa ou errada. Listem as ferramentas com esquemas. Decidam que ações são irreversíveis. Reúnam vinte exemplos reais.
Teste de saída: uma colega que não esteve nas reuniões lê o briefing e avalia corretamente cinco execuções de exemplo.
Fase 2 — Protótipo (2–3 semanas)#
Construam o ciclo mais pequeno que faça a tarefa com ferramentas reais num ambiente de teste. Passem os vossos vinte casos e corrijam o desenho das ferramentas antes do prompt.
Teste de saída: 60% dos vinte casos passam ponta a ponta, e ao lado de cada falha há uma causa identificada.
Fase 3 — Endurecimento (3–5 semanas)#
É aqui que está a maior parte do trabalho real e onde morrem os projetos subfinanciados. Permissões sobre a identidade do utilizador final, portões antes do irreversível, validação de argumentos, rastos legíveis, monitorização, avaliação crescida para cinquenta casos e um modo degradado.
- Autorização verificada no servidor em cada chamada.
- Portão humano antes de cada ação irreversível.
- Tetos de passos e gasto e deteção de repetição.
- Rastos com identificador em cada chamada e retenção decidida de propósito.
- Casos adversariais na avaliação, corridos como qualquer teste.
Teste de saída: 85% no conjunto, 100% no subconjunto de recusas e nenhuma constatação de segurança em aberto.
Fase 4 — Lançamento (2 semanas, depois contínuo)#
Comecem com um público limitado. Leiam execuções todos os dias. Alarguem quando os números aguentarem duas semanas seguidas.
| Semana | Público | O que observam |
|---|---|---|
| 1 | Só equipa interna | Rastos, falhas óbvias, erros de ferramentas |
| 2 | 5% do tráfego real | Taxa de escalamento, taxa de sucesso |
| 3–4 | 25% | Custo por tarefa, latência no pico |
| 5+ | Total, se os números aguentarem | Desvio, novas categorias |
Perguntas frequentes
Doze semanas parece muito para uma demonstração de três dias.
A demonstração funcionou mesmo. As nove semanas restantes são permissões, avaliação, monitorização e caminhos de falha.
As fases podem sobrepor-se?
O endurecimento pode começar durante o protótipo. Não comecem o lançamento antes de passar o teste de endurecimento.
E se o protótipo falhar o teste?
Olhem para as causas anotadas. Se forem desenho de ferramentas e acesso a dados, corrijam.
roteiro agentes iaplano de projeto de agentesfases de projeto llmcalendário de entrega ialista de lançamento