Inference
O ato de rodar o modelo pra gerar uma resposta. É isso que você paga toda vez, e não o treino.
Onde você esbarra nisso
Na diferença entre a assinatura de um chat e a conta da interface de programação (API). A assinatura é o fornecedor apostando na média dos usuários. A conta é o custo real do que você consumiu.
Conecta com
O que é
Treinar um modelo é uma obra que já aconteceu, custou centenas de milhões de dólares e terminou. Inferência é usar o resultado: você manda texto, a máquina do fornecedor roda os números do modelo em cima dele e devolve a resposta.
Os parâmetros não mudam durante a inferência. O modelo não aprende com a tua pergunta, não guarda o que você disse e não fica melhor porque você usou. Ele calcula e esquece.
O que muda pro teu negócio
Explica a pergunta que todo dono de empresa faz: por que a conta cresce com o uso em vez de ser uma licença fixa por mês?
Porque cada resposta consome máquina de verdade agora. Não é software que você instala e roda de graça pra sempre. É mais parecido com energia elétrica: existe um custo por vez que você acende. Quem te vende "inteligência artificial ilimitada por 97 reais" ou está subsidiando com dinheiro de investidor, ou está te dando um modelo bem menor do que você imagina.
Fontes
docs.claude.com, visão geral dos modelos.
Skill `claude-api` (cache 2026-06-24): a inferência acontece no hardware do fornecedor a cada requisição, e é por isso que a fatura acompanha o uso.
AI Coding Dictionary, verbete "Inference", Matt Pocock. Dele veio a formulação de que o treino já aconteceu. O que se paga por requisição é inferência.