02 · Sessão, contexto e turno18 / 62

Context window

Quanto de texto o modelo consegue segurar de uma vez. Tudo que ele precisa saber pra te responder tem que caber ali dentro.

Onde você esbarra nisso

"Por que ele esqueceu o que eu falei lá em cima?"

Não esqueceu. Ou saiu da janela, ou foi comprimido pra caber. É a causa raiz de metade das reclamações de "a IA piorou no meio do trabalho", e explica por que começar uma conversa nova costuma resolver mais rápido que insistir na antiga.

Conecta com

O que é

A memória de trabalho de uma conversa. Não é o que o modelo sabe, isso veio do treino e está congelado. É o que ele está olhando agora: a tua instrução, o histórico da conversa, o arquivo que você colou, o resultado de cada ferramenta que ele chamou. Tudo isso disputa o mesmo espaço.

Os modelos atuais da Anthropic trabalham com 1 milhão de tokens de janela. O Haiku 4.5, que é o modelo rápido e barato, trabalha com 200 mil. Um milhão parece infinito até você jogar um repositório inteiro lá dentro e ver acabar.

O que muda pro teu negócio

A janela é orçamento, não depósito. Duas contas mudam:

Espaço. Cada coisa que você enfia lá é uma coisa a menos de espaço pro que importa. Colar o manual inteiro não deixa a resposta melhor, deixa a instrução mais difícil de achar no meio.

Dinheiro. Você paga por token de entrada em toda requisição, e a conversa inteira é reenviada a cada turno. Isso quer dizer que a mensagem número 40 custa mais que a número 2, porque ela carrega as 39 anteriores junto. Conversa longa não fica só mais lenta. Fica mais cara a cada linha.

Fontes

docs.claude.com, context windows

Skill `claude-api` (cache 2026-06-24), tabela de modelos: janela e preço por milhão de token.

AI Coding Dictionary, verbete "Context window", Matt Pocock. Dele veio o enquadramento de janela como orçamento disputado, e não como caixa que você enche.