A conta que decide
Em algum momento a pergunta deixa de ser "funciona?" e passa a ser "vale?". A resposta vem de uma cadeia de três números, e quase todo mundo para no primeiro.
O custo por token é o que aparece na fatura, e é o menos útil dos três.
O custo por tarefa já inclui as iterações, o retrabalho e as chamadas de ferramenta, e começa a dizer alguma coisa.
O custo por resultado é o único que decide. Ele soma a escalada humana (os casos que o agente não resolveu e alguém teve que resolver) e compara com o baseline de antes.
Isso tem efeito prático. Um modelo mais barato que erra mais gera mais escalada humana e sai mais caro por resultado. Quem compara modelos por preço de token escolhe errado com frequência.
Essa conta só existe se a etapa 1 foi feita: sem baseline medido, o custo por resultado é um número solto que não prova nada.
