Testar agentes de IA: um conjunto de avaliação que vale o custo

Produção e operação 9 min de leitura

Uma grelha de resultados no ecrã com aprovados e reprovados, ao lado de uma lista impressa de casos
O ficheiro pouco vistoso que decide se o vosso agente sai algum dia do piloto.

A pergunta que separa os agentes que vão para o ar dos que apodrecem em piloto é simples: como sabem se a alteração de ontem melhorou alguma coisa? Sem resposta, cada retoque de prompt é um palpite e cada regressão é descoberta por um cliente.

Um conjunto de avaliação é a resposta e não exige plataforma. Cinquenta casos num ficheiro, um script que os corre e uma regra de avaliação por caso dizem mais do que qualquer tabela pública, porque são os vossos casos.

Como é um caso#

Um caso é uma entrada, o estado inicial do mundo e uma expectativa verificável. Essa expectativa quase nunca é uma cadeia exata — um agente pode acertar em várias formulações. Avaliem o resultado: chamou a ferramenta de reembolso com a encomenda 4471; a resposta final tem a data certa; recusou e perguntou, como devia.

Guardem o estado necessário junto do caso.

Cinquenta casos e de onde vêm#

Testar agentes de IA: um conjunto de avaliação que vale o custo — Cinquenta casos e de onde vêm
FonteQuantos, mais ou menosPorquê
Pedidos reais frequentes dos registos20Protege o caminho do dia a dia
Falhas passadas conhecidas10Impede o regresso de regressões
Entradas ambíguas8Deve perguntar, não adivinhar
Casos a recusar6Fora de âmbito, sem permissão, inseguros
Resultados vazios ou partidos6O incidente real mais comum

Avaliem resultados, não caminhos#

Duas execuções que chegam ao mesmo resultado correto por caminhos diferentes estão ambas certas, e uma suíte que exige uma transcrição falhará sem razão. Verifiquem o que mudou e o que foi dito.

Quatro números para seguir ao longo do tempo#

  1. Taxa de sucesso no conjunto e em separado no subconjunto a recusar.
  2. Taxa de afirmações sem suporte.
  3. Mediana e percentil 95 de custo e latência por execução.
  4. Taxa de intervenção humana: quantas vezes alguém teve de entrar, e porquê.

Corram no pipeline e também depois do lançamento#

Corram o conjunto a cada alteração de prompts, ferramentas, versão do modelo ou configuração de recuperação. Depois do lançamento continuem a amostrar tráfego real.

Perguntas frequentes

Com quantos casos começar?

Cinquenta apanham regressões reais e escrevem-se em poucos dias. Vinte chegam para começar.

Pode um modelo avaliar?

Pode, com cuidado. Deem critérios explícitos e verifiquem uma amostra à mão.

A avaliação deve bloquear lançamentos?

Bloqueiem no subconjunto crítico de segurança. Para qualidade geral sigam a tendência.

avaliar agentes iatestes de agentesconjunto de avaliação llmtestes de regressão llmmétricas de qualidade

Todos os guias

Última atualização 2026-08-04 por aiagentdevelopment.info · Sobre nós

Escrito por quem constrói

Cada guia é escrito por engenheiros que operam agentes em produção, não reescrito a partir de outros sites.

Revisto com regularidade

A área muda depressa. Cada guia traz a data da última revisão, publicada mesmo quando nada mudou.

Sem espaços pagos

Nenhum fornecedor de modelos, framework ou plataforma pode comprar uma menção, uma posição ou uma ligação.

Doze idiomas

Cada guia é traduzido, não substituído por máquina — cada idioma tem o seu URL e a sua data de revisão.

Limites nomeados

Dizemos com clareza quando uma tarefa não precisa de agente e um script simples sairia mais barato e mais fiável.