Testar agentes de IA: um conjunto de avaliação que vale o custo
A pergunta que separa os agentes que vão para o ar dos que apodrecem em piloto é simples: como sabem se a alteração de ontem melhorou alguma coisa? Sem resposta, cada retoque de prompt é um palpite e cada regressão é descoberta por um cliente.
Um conjunto de avaliação é a resposta e não exige plataforma. Cinquenta casos num ficheiro, um script que os corre e uma regra de avaliação por caso dizem mais do que qualquer tabela pública, porque são os vossos casos.
Como é um caso#
Um caso é uma entrada, o estado inicial do mundo e uma expectativa verificável. Essa expectativa quase nunca é uma cadeia exata — um agente pode acertar em várias formulações. Avaliem o resultado: chamou a ferramenta de reembolso com a encomenda 4471; a resposta final tem a data certa; recusou e perguntou, como devia.
Guardem o estado necessário junto do caso.
Cinquenta casos e de onde vêm#
| Fonte | Quantos, mais ou menos | Porquê |
|---|---|---|
| Pedidos reais frequentes dos registos | 20 | Protege o caminho do dia a dia |
| Falhas passadas conhecidas | 10 | Impede o regresso de regressões |
| Entradas ambíguas | 8 | Deve perguntar, não adivinhar |
| Casos a recusar | 6 | Fora de âmbito, sem permissão, inseguros |
| Resultados vazios ou partidos | 6 | O incidente real mais comum |
Avaliem resultados, não caminhos#
Duas execuções que chegam ao mesmo resultado correto por caminhos diferentes estão ambas certas, e uma suíte que exige uma transcrição falhará sem razão. Verifiquem o que mudou e o que foi dito.
Quatro números para seguir ao longo do tempo#
- Taxa de sucesso no conjunto e em separado no subconjunto a recusar.
- Taxa de afirmações sem suporte.
- Mediana e percentil 95 de custo e latência por execução.
- Taxa de intervenção humana: quantas vezes alguém teve de entrar, e porquê.
Corram no pipeline e também depois do lançamento#
Corram o conjunto a cada alteração de prompts, ferramentas, versão do modelo ou configuração de recuperação. Depois do lançamento continuem a amostrar tráfego real.
Perguntas frequentes
Com quantos casos começar?
Cinquenta apanham regressões reais e escrevem-se em poucos dias. Vinte chegam para começar.
Pode um modelo avaliar?
Pode, com cuidado. Deem critérios explícitos e verifiquem uma amostra à mão.
A avaliação deve bloquear lançamentos?
Bloqueiem no subconjunto crítico de segurança. Para qualidade geral sigam a tendência.
avaliar agentes iatestes de agentesconjunto de avaliação llmtestes de regressão llmmétricas de qualidade