A Anthropic publicou um balanço do que aprendeu ajudando empresas a reduzir o custo de aplicações que rodam sobre o Claude. O texto é técnico, mas a conclusão é fácil de entender e vale para qualquer pessoa que pague por uso da API.
A gente costuma assumir que preço e qualidade andam juntos, e que pagar menos significa aceitar uma resposta pior. A empresa diz que, na prática, não é bem assim. Muita aplicação consegue cortar custo e melhorar o resultado ao mesmo tempo, porque vinha pagando por três coisas que não ajudavam em nada: leitura refeita à toa, ordens que já não fazem sentido e um modelo pensando demais para uma pergunta simples.
As três alavancas
Repare que nenhuma delas troca o modelo por um mais fraco. Todas mexem no jeito de pedir.
Alavanca 1
Reaproveitar o contexto
Se o começo do pedido é sempre igual, não faz sentido o modelo ler tudo de novo, do zero, a cada chamada.
Alavanca 2
Limpar as instruções
Muita ordem no seu texto foi escrita para um modelo antigo. O modelo novo obedece ao pé da letra e faz trabalho extra que você nem queria pedir.
Alavanca 3
Calibrar o esforço
É quanto o modelo pode pensar antes de responder. Pensar demais e pensar de menos saem caro, cada um do seu jeito.
A parte cara é ler o pedido, não escrever a resposta
Isso costuma surpreender. Antes de escrever a primeira palavra, o modelo tem que passar por tudo que você mandou, as instruções, os documentos anexados e a conversa inteira até ali. É esse preparo, e não a resposta em si, que domina a conta. Imagine alguém que releia um dossiê de duzentas páginas antes de responder cada pergunta nova sobre ele. A leitura é que cansa, não a resposta.
O cache de prompt existe para evitar essa releitura. Quando o começo do pedido é exatamente o mesmo de antes, a API cobra bem menos para reprocessá-lo.
A condição é dura. O começo do pedido precisa ser idêntico, caractere por caractere, com o mesmo modelo e o mesmo esforço. Mudou uma vírgula lá no início e o desconto some para o pedido inteiro.
As cinco situações acima são as que mais fazem uma aplicação perder o desconto sem que ninguém perceba. A mais traiçoeira é a data no texto fixo: ela muda sozinha o tempo todo e invalida o cache a cada chamada.
Prompt do modelo antigo atrapalha o modelo novo
Quase todo prompt antigo tem remendo, uma frase que alguém acrescentou porque o modelo da época errava naquilo. O modelo novo já não erra, mas continua obedecendo. O remendo virou serviço extra, e serviço extra aparece na fatura.
- "verifique duas vezes"o modelo faz tudo duas vezes e cobra as duas
- "seja o mais completo possível"vira resposta longa e uma busca atrás da outra
- "pense passo a passo num rascunho"ele já pensa antes de responder, e você pediu para pensar mais uma vez
- exemplos longos do modelo antigoensinam um caminho longo que o modelo não precisa mais percorrer
- regras que se contradizemele tenta obedecer às duas ao mesmo tempo
- configuração datadaé uma opção que não existe mais, e a chamada falha
- Diga qual é a tarefa e o que você considera uma boa resposta.
- Diga o que não fazer. Uma vez só, sem reforçar depois.
- Deixe o modelo decidir quantos passos vai dar.
- Corte os exemplos que só ensinam um jeito antigo de trabalhar.
- Resolva a contradição no seu texto, em vez de deixar para o modelo.
- Confira se as opções que você usa ainda existem na versão atual.
Os dois números vêm do mesmo teste interno da empresa, então convém lê-los como indicação de ordem de grandeza, não como promessa. O ponto que interessa é a direção: o prompt encolheu e o acerto subiu.
Quanto o modelo deve pensar antes de responder
Esforço é o quanto o modelo delibera antes de responder, e dá para regular. Clique nas três posições para ver o que muda.
É o equilíbrio para a maior parte do trabalho. O modelo confere o quanto basta e para quando a resposta já se sustenta.
Vale como padrão até um teste mostrar que aquela tarefa pede outra coisa.
O ganho não sobe junto com o preço. Num dos testes citados, o Fable 5.1 no esforço baixo empatou com o Fable 5 no esforço alto, por cerca de um terço do custo. E ir do penúltimo para o último degrau chegou a render meio ponto de acerto a mais, com quase metade de conta a mais.
O que a empresa publicou junto
A Anthropic também abriu um conjunto de instruções para o próprio Claude fazer essa faxina sozinho, dentro do Claude Code. São três comandos: um audita o prompt em busca dos vícios, outro propõe cortes de custo e o terceiro testa variações até achar a melhor combinação. O material está no repositório de skills da Anthropic, em código aberto.
O número mais chamativo vem de um teste acadêmico
O artigo mostra 58% de corte de custo num teste chamado LegalBench, e o nome engana. É uma coletânea acadêmica de exercícios jurídicos em inglês, montada para comparar modelos entre si. Não tem relação com processo, tribunal ou prática brasileira, e não diz nada sobre desempenho do Claude em petição, contrato ou pesquisa de jurisprudência daqui.
O que interessa é o mecanismo, e não o percentual. Quem contrata desenvolvimento de alguma ferramenta que usa o Claude por trás, situação cada vez mais comum em departamento jurídico, agora tem três perguntas concretas para fazer a quem construiu: o cache está sendo aproveitado, o prompt foi revisado depois da última troca de modelo, e o esforço está calibrado para a tarefa. Quem usa o Claude pela assinatura do chat não tem esses botões, e não precisa mexer em nada.
Fonte: Anthropic, Reducing cost and improving performance with Claude Platform, e post da conta @ClaudeDevs, em 8 de setembro de 2026.