11 formas de gastar menos tokens: Claude Code e Claude Web
Por que o contexto fica caro, como cada uma das 11 estratégias reduz gasto de tokens no Claude Code e no Claude Web, e o padrão mental para sessões mais eficientes.
1. Por que o contexto fica caro
O mecanismo
Claude conta tokens. O custo de cada resposta depende do tamanho total do contexto naquele momento.
Contexto = tudo que está na conversa: suas mensagens, as respostas do Claude, arquivos lidos, resultados de ferramentas, instruções do sistema. Tudo junto.
Numa conversa curta, a mensagem 1 pode ter 200 tokens de contexto. Na mensagem 30, pode ter 50.000, mesmo que você tenha enviado mensagens curtas. O histórico vai acumulando.
Isso tem duas consequências diretas:
- Respostas ficam mais lentas conforme a conversa cresce (mais contexto para processar)
- No Claude Code com plano mensal, você usa o limite de uso mais rápido do que percebe
O custo oculto
O maior gasto de tokens raramente vem das mensagens que você vê. Vem de:
- Histórico longo que você esqueceu de limpar
- Arquivos grandes lidos pelo agente (e que ficam no contexto)
- CLAUDE.md com 800 linhas carregado em toda requisição
- Resultados de ferramentas verbosos (npm install, logs de teste)
- Subagentes que jogam tudo no contexto pai
Entender isso muda como você usa o Claude.
2. As 11 formas: mais contexto e exemplos
No Claude Code
1. /clear entre tarefas
Quando você termina uma tarefa e começa outra, o contexto da tarefa anterior ainda está lá, incluindo todos os arquivos que o Claude leu, todos os erros intermediários, toda a exploração que ele fez.
Esse contexto não ajuda a nova tarefa. Atrapalha: força o modelo a processar informação irrelevante e aumenta o custo de cada resposta.
/clear zera o contexto. O Claude não perde a "memória" do projeto (CLAUDE.md continua carregando), mas perde o histórico da conversa.
Nota: /clear não apaga o histórico visível para você. Você ainda consegue ler. Mas o Claude não carrega mais esse histórico nas próximas requisições.
2. Sonnet em vez de Opus
Opus é o modelo mais capaz e o que mais consome uso do plano. Para a maioria das tarefas do dia a dia (escrever código, refatorar, explicar algo, debug simples), Sonnet resolve com a mesma qualidade.
A regra prática: use Sonnet até o Claude não resolver. Se travar em algo complexo, mude para Opus só para aquela tarefa.
O Claude Code deixa você mudar de modelo no meio da conversa com /model. Não precisa reiniciar.
3. CLAUDE.md abaixo de 500 linhas
O CLAUDE.md é carregado em toda requisição. Se ele tem 1.000 linhas, você está pagando por 1.000 linhas de contexto em cada mensagem, mesmo quando a tarefa não precisa de nada disso.
A abordagem certa:
- Guarde só o que o Claude não pode inferir lendo o código
- Use
@arquivopara referenciar documentação específica só quando necessário, em vez de incluir tudo no CLAUDE.md - Divida em CLAUDE.md (raiz) + CLAUDE.md em subpastas: cada pasta carrega só as instruções relevantes ao escopo dela
4. /effort low em tarefas diretas
O effort controla o nível de raciocínio do modelo. Em níveis altos (max, xhigh), o Claude pensa antes de responder, e o raciocínio interno também consome tokens de saída.
Para tarefas mecânicas (renomear variável, reformatar arquivo, buscar texto, gerar boilerplate), esse raciocínio não agrega nada. /effort low desativa e a tarefa fica mais rápida e mais barata.
Reserve effort high ou max para debugging difícil, arquitetura complexa, algoritmos não triviais.
5. Trabalho verboso vai pra subagente
Quando o Claude roda testes, faz npm install, ou gera logs longos, tudo isso vai para o contexto da conversa. Se você está numa sessão longa, essa saída se acumula.
A alternativa: use subagentes para trabalho que gera muito output. O log do subagente fica no contexto dele, não no seu. Você recebe só o resultado final.
No Claude Code, você pode pedir explicitamente: "rode isso num subagente e me traga só o resultado."
No Claude Web
6. Edite o prompt em vez de reenviar
Esse é o maior multiplicador de contexto que existe no Claude Web.
Quando você reenvia um prompt (nova mensagem), a resposta anterior fica no contexto. Em 10 rodadas de correção, você acumulou 10 pares de mensagem+resposta, muito do qual é conteúdo que você descartou.
Quando você edita o prompt (botão de editar na mensagem original), o Claude apaga a resposta anterior e regenera. O contexto não cresce. Você paga só pela conversa útil.
Regra: toda vez que você ia dizer "na verdade, muda X", edite em vez de mandar nova mensagem.
7. Chat novo a cada 15–20 mensagens
Conversas longas ficam caras pelo acúmulo de contexto, independente do tamanho de cada mensagem individual.
A mensagem 1 de uma conversa tem contexto mínimo. A mensagem 30 carrega todo o histórico das 29 anteriores, mesmo os que já não são relevantes.
Abrir um chat novo é grátis. O custo está em continuar uma conversa longa quando você poderia começar uma nova com só o contexto relevante.
8. Modelo certo pra cada tarefa
| Modelo | Quando usar |
|---|---|
| Haiku | Resumos, classificações, extração de dados, respostas curtas, tarefas de formato fixo |
| Sonnet | Código, análise, explicações, debug intermediário, geração de conteúdo |
| Opus | Raciocínio complexo, arquitetura, problemas ambíguos, debugging difícil |
Haiku é significativamente mais barato que Sonnet, que é mais barato que Opus. Para tarefas repetitivas ou de baixa complexidade, Haiku entrega o mesmo resultado a uma fração do custo.
9. Configure Memória e Preferências
Toda vez que você abre um chat novo e explica seu contexto ("trabalho com Next.js, uso TypeScript estrito, prefiro funções pequenas"), você está gastando tokens para informação que o Claude vai usar em toda a conversa, mas que você poderia ter configurado uma vez.
As Preferências e Memórias do Claude Web ficam disponíveis em todas as conversas automaticamente. Configure uma vez, use sempre.
O que vale a pena configurar:
- Stack técnica principal
- Nível de detalhe preferido nas respostas
- Preferências de linguagem (PT-BR, inglês técnico, misturado)
- Restrições que você sempre repete ("não adicione comentários", "sem TypeScript any")
10. Desative o que não usa
O Claude Web tem conectores (Google Drive, Notion, GitHub), busca na web e Extended Thinking. Cada um ativo adiciona tokens ao contexto de toda requisição, mesmo quando você não precisou deles.
Se você não usa busca web no seu fluxo, desative. Se não conecta arquivos do Drive, desative. O padrão é ativado; você precisa explicitamente desligar.
Extended Thinking é o mais caro: ativa um processo de raciocínio interno que consome tokens antes de responder. Útil para raciocínio pesado. Desnecessário para a maioria das conversas.
11. A regra mais simples
Contexto enxuto = mais rápido e mais barato.
As outras 10 formas são variações desta: todas reduzem o contexto desnecessário que entra em cada requisição.
Quando você se perguntar "por que essa resposta demorou?" ou "por que gastei tanto uso hoje?", a resposta quase sempre está no contexto carregado, e não na mensagem que você enviou.
3. O padrão mental
Perguntas que valem antes de cada sessão
1. Preciso de contexto de sessão anterior, ou posso começar do zero?
→ Não: /clear ou chat novo antes de começar
2. A tarefa é mecânica ou exige raciocínio pesado?
→ Mecânica: /effort low ou Haiku
→ Pesada: Sonnet/Opus conforme necessidade
3. Esse trabalho vai gerar muito output (testes, logs, instalações)?
→ Sim: subagente
4. Estou repetindo o mesmo contexto que já expliquei antes?
→ Sim: configurar em Memória/Preferências / CLAUDE.mdO hábito que mais impacta
De todos os itens, o que mais reduz gasto de forma imediata é a combinação de /clear entre tarefas (Claude Code) e editar em vez de reenviar (Claude Web).
Esses dois hábitos atacam o maior acumulador de contexto despercebido, e não exigem nenhuma mudança no fluxo, só um gesto diferente.
@developer.israel · AI Engineering · Claude Code e Claude Web