Pular para o conteúdo
0%
0% da etapa
Conceito 2 min

Evals

Casos de teste mais critérios objetivos, rodados a cada mudança. Sem evals, todo ajuste de prompt é chute.

Em uma frase

O conjunto de casos de teste e critérios objetivos que mede a qualidade do sistema de IA, executado automaticamente a cada mudança.

Antes

Mudança no prompt, tool ou modelo

O que ele faz

Roda casos + critérios objetivos

Depois

Libera o deploy, ou barra

Analogia

Pense no controle de qualidade da linha de produção. Ninguém pergunta "achei que ficou bom?" peça por peça; existe um gabarito e um teste que roda sempre igual.

Exemplo

A suíte roda as 200 cartas do golden dataset e mede cinco critérios:

  1. Fidelidade factual: toda afirmação tem fonte no relatório de campo (verificação automática)
  2. LGPD: nenhum dado proibido, como endereço, nome da escola ou sobrenome da criança
  3. Idioma: o do padrinho, que pode ser diferente do idioma do relatório
  4. Extensão: entre 180 e 320 palavras
  5. Tom e dignidade: avaliado por LLM-as-Judge

Cada alteração de prompt dispara a suíte inteira, que leva 6 minutos e custa R$ 4, menos do que uma reunião para discutir se ficou bom.

O erro comum

Achar que "testamos com uns 10 exemplos e ficou ótimo" é eval. Isso é impressão. Eval precisa ser reproduzível, versionada e rodada por inteiro a cada mudança.

O segundo erro é mais sutil: medir só o que é fácil de medir. Contagem de palavras entra na suíte, tom e fidelidade ficam no olhômetro, e o sistema melhora justamente naquilo que menos importa. Critério subjetivo também entra na suíte, avaliado por LLM-as-Judge.

Na prática

  • Comece com 20 casos e 3 critérios. Uma suíte de 200 casos e 12 critérios tende a ficar sem rodar, e aí não mede nada.
  • Um script, um comando, saída em tabela com percentual por critério.
  • Versione a suíte junto com o prompt: eles mudam juntos.
  • Falha na suíte bloqueia o deploy, como teste de software.
  • Ferramentas típicas: Promptfoo, Langfuse ou 100 linhas de Python. O hábito de rodar pesa muito mais que a escolha da ferramenta.

Como tangibilizar

Um script que roda os casos do gabarito contra os critérios e imprime o percentual de cada um.

Nota

Satisfação (% de atingimento) é a versão informal disto: quanto o resultado entregue atingiu o desejado. Serve no começo, mas todo critério de satisfação que se repete duas vezes deve virar item da suíte. Do contrário, a avaliação continua dependendo de quem estava na sala.

Para discutir

Isso já está pronto na sua empresa? Compare com o critério:

Pronto quando: Quando a suíte roda em um comando, a cada mudança, e uma falha bloqueia o deploy.