Context window
Quanto de texto o modelo consegue segurar de uma vez. Tudo que ele precisa saber pra te responder tem que caber ali dentro.
Onde você esbarra nisso
"Por que ele esqueceu o que eu falei lá em cima?"
Não esqueceu. Ou saiu da janela, ou foi comprimido pra caber. É a causa raiz de metade das reclamações de "a IA piorou no meio do trabalho", e explica por que começar uma conversa nova costuma resolver mais rápido que insistir na antiga.
Conecta com
O que é
A memória de trabalho de uma conversa. Não é o que o modelo sabe, isso veio do treino e está congelado. É o que ele está olhando agora: a tua instrução, o histórico da conversa, o arquivo que você colou, o resultado de cada ferramenta que ele chamou. Tudo isso disputa o mesmo espaço.
Os modelos atuais da Anthropic trabalham com 1 milhão de tokens de janela. O Haiku 4.5, que é o modelo rápido e barato, trabalha com 200 mil. Um milhão parece infinito até você jogar um repositório inteiro lá dentro e ver acabar.
O que muda pro teu negócio
A janela é orçamento, não depósito. Duas contas mudam:
Espaço. Cada coisa que você enfia lá é uma coisa a menos de espaço pro que importa. Colar o manual inteiro não deixa a resposta melhor, deixa a instrução mais difícil de achar no meio.
Dinheiro. Você paga por token de entrada em toda requisição, e a conversa inteira é reenviada a cada turno. Isso quer dizer que a mensagem número 40 custa mais que a número 2, porque ela carrega as 39 anteriores junto. Conversa longa não fica só mais lenta. Fica mais cara a cada linha.
Fontes
docs.claude.com, context windows
Skill `claude-api` (cache 2026-06-24), tabela de modelos: janela e preço por milhão de token.
AI Coding Dictionary, verbete "Context window", Matt Pocock. Dele veio o enquadramento de janela como orçamento disputado, e não como caixa que você enche.