Token
O pedaço de texto que o modelo conta. É a unidade de cobrança e o que enche a janela de contexto, mas nunca a sua unidade de resultado.

Em uma frase
A unidade em que o modelo mede tudo: pedaços de palavra que ele conta na entrada e na saída. É por token que se cobra e é em token que a janela de contexto se enche.
Antes
Texto inteiro
O que ele faz
Quebrado em pedaços contáveis
Depois
Cobrado e somado à janela
Analogia
É o centavo da conta de luz. Ninguém liga a lâmpada pensando em quilowatt-hora; liga para enxergar. Mas a conta chega em kWh, e quem quer economizar precisa saber a conversão entre uma coisa e a outra.
Exemplo
"carta de vínculo" não vira três tokens, um por palavra: em português, uma palavra comum costuma virar dois ou três tokens, e nome próprio ou termo raro se quebra em mais pedaços ainda.
Isso tem consequência prática: um agente que relê o relatório de campo inteiro a cada carta gasta os mesmos tokens de leitura toda vez. Mil cartas depois, você pagou mil vezes pelo mesmo documento, e nenhuma dessas leituras melhorou a tradução.
O erro comum
Otimizar token e achar que otimizou custo. Token é a unidade de medida do modelo; a sua é o resultado. Um prompt enxuto que erra e precisa de três tentativas custa mais que um prompt gordo que acerta de primeira.
Se você não sabe quanto custa uma carta traduzida, saber quanto custa mil tokens não serve para decidir nada. Ver Unit Economics de Agente.
Na prática
- Meça custo por resultado, e use token só para investigar por que o custo
por resultado subiu.
- Olhe entrada e saída separadas. Quase sempre a surpresa está numa das duas.
- Se o mesmo documento entra em toda chamada, ele é candidato a cache: você paga uma
vez em vez de mil.
- Peça saída curta quando a saída for só uma decisão. Se um rótulo resolve, não
peça texto.
Como tangibilizar
Uma linha no registro de cada execução com tokens de entrada, tokens de saída e o custo daquela chamada. Sem isso, discutir custo é chute.
Nota
Entrada e saída custam diferente, e a saída costuma custar bem mais. Isso muda o desenho: pedir ao modelo um resumo curto de um texto longo é barato; pedir para ele reescrever o texto longo inteiro, não.
Também vale saber que o mesmo texto rende mais tokens em português do que em inglês, porque os modelos foram treinados com mais inglês, e o vocabulário reflete isso. Uma operação que roda em português paga um pouco mais pela mesma coisa.
