01 · O modelo10 / 62

Next-token prediction

A única coisa que o modelo faz: escolher a próxima palavrinha, colar no texto, e recomeçar.

Onde você esbarra nisso

Quando você lê uma resposta que começa bem e vai piorando. Não é cansaço. É cada palavra puxando a seguinte, sem ninguém no volante revisando o trajeto.

Conecta com

O que é

Não tem outro modo de operação. O modelo lê tudo que está na frente dele, calcula qual token tem mais chance de vir a seguir, escolhe um, cola no fim do texto e roda de novo com o texto um pouco maior.

Toda a aparência de raciocínio sai daí. Ele não planeja a resposta inteira antes de começar a escrever. Ele escreve um pedacinho de cada vez, e cada pedacinho novo influencia o próximo.

O que muda pro teu negócio

Isso explica dois comportamentos que parecem misteriosos e não são.

O primeiro: o modelo nunca checa se um token é verdadeiro antes de escrever. Ele só checa se é provável. Verdade e plausibilidade são coisas diferentes, e é dessa diferença que nasce a Hallucination.

O segundo: uma primeira frase confiante e errada empurra o resto da resposta pro lado errado, porque o que já foi escrito vira contexto pro que vem. Ele não volta atrás sozinho.

Daí a técnica que funciona: peça pra pensar antes de responder. Um raciocínio escrito primeiro muda o que é provável depois.

Fontes

Documentação da Anthropic para o mecanismo de amostragem token a token.

AI Coding Dictionary, verbete "Next-token prediction", Matt Pocock. A frase dele de que o modelo nunca verifica se um token é verdadeiro, só se é provável, é a formulação mais limpa disso.