Pular para o conteúdo
0%
0% da etapa
Conceito 2 min

Monitoramento (Traces)

Eval é antes, em laboratório. Monitoramento é depois, em produção. Você precisa dos dois.

Em uma frase

O registro do que o agente fez em cada etapa (prompts, chamadas de ferramenta, custo, latência, falhas) enquanto ele roda em produção.

Antes

Agente rodando em produção

O que ele faz

Registra prompt, tool, custo e latência

Depois

Anomalia visível antes do padrinho

o que aparece aqui vira caso no gabarito

Analogia

A caixa-preta do avião. Ela não impede o acidente, mas permite entender o que houve e evitar que se repita.

Exemplo

O painel mostra, por carta: custo (R$ 0,42), tempo (38s), quantas vezes o agente reescreveu durante a auto verificação e se escalou para humano.

Na terceira semana o custo médio saltou para R$ 1,10. O trace mostrou a causa em dois minutos: relatórios de campo digitalizados como imagem estavam entrando inteiros no contexto. Sem trace, a frase teria sido "a conta subiu e não sabemos por quê", e a resposta provável seria desligar o projeto.

O erro comum

Confundir eval com monitoramento. Eval acontece antes, em laboratório, com casos conhecidos e perguntas que você escolhe. Monitoramento acontece depois, em produção, com casos reais que trazem as próprias perguntas.

Quem só tem eval descobre o problema pelo padrinho. Quem só tem monitoramento descobre depois de já ter enviado. Os dois são necessários, e o que o monitoramento pega em produção deve virar caso no golden dataset.

Na prática

  • Instrumente na primeira semana. Se o trace só começa depois do primeiro incidente, ele não ajuda a entender esse incidente.
  • Registre por execução: entrada, saída, ferramentas chamadas, tokens, custo, latência e versão do prompt.
  • Langfuse, LangSmith ou uma tabela no seu banco. O formato importa menos do que ter o registro.
  • Três alertas simples pegam quase tudo: custo médio 2× acima da semana anterior, taxa de escalada subindo, latência p95 estourando.

Como tangibilizar

Registro por execução (entrada, saída, tools, custo, latência) mais três alertas simples.

Para discutir

Isso já está pronto na sua empresa? Compare com o critério:

Pronto quando: Quando você descobre a anomalia pelo painel, e não pelo cliente.