Effort
O botão de quanto o modelo pensa antes de responder. Pensar mais custa mais e demora mais.
Onde você esbarra nisso
Quando você acha que precisa de um modelo maior. Muitas vezes precisa é do mesmo modelo pensando mais, o que sai bem mais barato que trocar de modelo.
Conecta com
O que é
Um controle com níveis, de baixo até o máximo, que decide quanto raciocínio o modelo gasta antes de escrever a resposta. O padrão nos modelos da Anthropic é alto.
O raciocínio sai em token de saída, então esforço não é um ajuste abstrato: é literalmente autorizar o modelo a gastar mais do recurso mais caro. E ele produz um token por vez, então mais esforço também significa esperar mais pela resposta.
O que muda pro teu negócio
É o primeiro botão de custo que vale mexer depois do cache, e o único que troca qualidade por dinheiro de forma direta.
A parte contraintuitiva: o topo da escala só se paga em problema difícil. Tarefa repetitiva, classificação, resposta curta e conversa comum funcionam bem no nível baixo, e isso corta a conta sem ninguém perceber diferença. Código e trabalho longo com ferramenta são o oposto, e respondem forte a esforço alto.
Mede antes de subir. E mede por tarefa terminada, não por requisição: uma resposta mais barata que precisa de três tentativas não é mais barata.
Fontes
docs.claude.com, extended thinking.
Skill `claude-api` (cache 2026-06-24): níveis de esforço de baixo a máximo, com padrão alto. O raciocínio é faturado como saída. E a orientação é medir por tarefa concluída, não por requisição.
AI Coding Dictionary, verbete "Effort", Matt Pocock. Ele define esforço como troca explícita entre deliberação, velocidade e custo, que é o enquadramento certo pra decidir.