Abertura
Você deixaria um agente enviar 4.000 cartas em nome da sua organização, sem ninguém ler nenhuma delas?
A resposta imediata é não, e ela não leva a lugar nenhum. A pergunta útil é outra:
O que precisaria ser verdade para essa resposta virar sim?
Este módulo responde a ela em oito conceitos. O que os liga vale para todo processo de toda Cognitive Enterprise: autonomia se concede por evidência, e não por confiança.
Quase todo projeto de IA que morre na empresa morre aqui, e não na parte técnica.
O agente funciona na demo. Todo mundo aplaude. Aí ele vai para um caso real, erra uma vez, e a organização não tem nenhum instrumento para responder a três perguntas básicas:
- Ele erra mais ou menos que nós? (baseline humano)
- Esse erro é exceção ou padrão? (evals, golden dataset)
- Se eu corrigir, eu quebro outra coisa? (regressão)
Sem instrumento, a resposta a qualquer erro é sempre a mesma: voltar tudo para o humano. O projeto acaba porque ninguém construiu um jeito de saber se a tecnologia estava funcionando.
Quem constrói esses instrumentos primeiro consegue delegar. Quem não constrói fica preso no nível 2 de autonomia para sempre, com agentes que sugerem e humanos que refazem.
