Output tokens
O que o modelo escreve de volta. Custa cinco vezes mais que a entrada, e parte dele você nem vê.
Onde você esbarra nisso
"Mas eu só mandei uma pergunta curta." Mandou. Ele respondeu três parágrafos, pensou por mais dois, e a parte cara foi a dele.
Conecta com
O que é
Tudo que o modelo gera: o texto que você lê, o código que ele escreve, as chamadas de ferramenta, e o raciocínio que ele faz antes de responder.
Esse último item pega muita gente. O raciocínio é cobrado como saída mesmo quando a ferramenta não mostra ele pra você. Você paga por um pensamento que não leu.
Em todos os modelos atuais da Anthropic a saída custa exatamente cinco vezes a entrada.
O que muda pro teu negócio
Onde o dinheiro realmente vai. Uma resposta longa custa muito mais que um prompt longo, e resposta longa é o padrão de quem não pediu concisão.
Tem um caso que vale dinheiro de verdade em automação: um agente que reescreve o arquivo inteiro em vez de editar só a linha que mudou está gerando dez vezes mais saída pelo mesmo resultado. A instrução de "edite, não reescreva" é uma linha de prompt que corta a fatura.
Fontes
Skill `claude-api` (cache 2026-06-24): o raciocínio é faturado como saída mesmo quando não é exibido, e subir o esforço gasta mais desses tokens.
AI Coding Dictionary, verbete "Output tokens", Matt Pocock. Dele veio o exemplo do agente que reescreve arquivo inteiro em vez de aplicar edição, que é onde a conta explode na prática.