Token
O pedaço em que o texto é picado antes do modelo ler. Mais ou menos do tamanho de uma sílaba grande, não de uma palavra.
Onde você esbarra nisso
Quando você olha uma fatura de interface de programação (API) e não entende o número. Ele nunca vai bater com "quantas mensagens eu mandei". Bate com quanto texto passou.
Conecta com
O que é
O modelo não lê letra e não lê palavra. Ele lê token, que é um pedaço de texto de tamanho irregular: palavra comum vira um token só, palavra rara vira três ou quatro, e acento e emoji custam caro. Em português a conta é pior que em inglês, porque os modelos foram treinados com muito mais texto em inglês e picam o nosso idioma em pedaços menores.
Token é a unidade de tudo. O tamanho da janela é contado em token. O preço é por milhão de token. A velocidade é medida em token por segundo.
O que muda pro teu negócio
Todo custo de inteligência artificial que você vai pagar está nessa unidade, e ela não é intuitiva. "Mil palavras" não é um número que existe pro fornecedor.
Duas consequências práticas. A primeira: texto em português custa mais que o mesmo texto em inglês, porque rende mais token. A segunda: não chute a conta. Existe endpoint oficial pra contar token antes de mandar, e ferramenta de contagem de outro fornecedor conta errado, porque cada família de modelo pica o texto do seu jeito.
Fontes
docs.claude.com, contagem de token, que documenta o endpoint oficial de contagem.
Skill `claude-api` (cache 2026-06-24): o tokenizador mudou nos modelos novos, e o mesmo texto pode render de 1 a 1,35 vez mais token que antes. Contagem velha não vale.
AI Coding Dictionary, verbete "Token", Matt Pocock. Dele veio o alerta de que janela, custo e latência contam a mesma unidade, então otimizar uma mexe nas três.