Análise Ferramentas 6 min de leitura

Anthropic diz que dá para gastar menos com o Claude sem piorar a resposta

A empresa publicou o que aprendeu ajudando clientes a cortar a conta da API. Boa parte do gasto não pagava por qualidade, e sim por trabalho repetido.

Capa editorial com a identidade visual do Claude, da Anthropic.

A Anthropic publicou um balanço do que aprendeu ajudando empresas a reduzir o custo de aplicações que rodam sobre o Claude. O texto é técnico, mas a conclusão é fácil de entender e vale para qualquer pessoa que pague por uso da API.

A gente costuma assumir que preço e qualidade andam juntos, e que pagar menos significa aceitar uma resposta pior. A empresa diz que, na prática, não é bem assim. Muita aplicação consegue cortar custo e melhorar o resultado ao mesmo tempo, porque vinha pagando por três coisas que não ajudavam em nada: leitura refeita à toa, ordens que já não fazem sentido e um modelo pensando demais para uma pergunta simples.

As três alavancas

Repare que nenhuma delas troca o modelo por um mais fraco. Todas mexem no jeito de pedir.

Alavanca 1

Reaproveitar o contexto

Se o começo do pedido é sempre igual, não faz sentido o modelo ler tudo de novo, do zero, a cada chamada.

Alavanca 2

Limpar as instruções

Muita ordem no seu texto foi escrita para um modelo antigo. O modelo novo obedece ao pé da letra e faz trabalho extra que você nem queria pedir.

Alavanca 3

Calibrar o esforço

É quanto o modelo pode pensar antes de responder. Pensar demais e pensar de menos saem caro, cada um do seu jeito.

A parte cara é ler o pedido, não escrever a resposta

Isso costuma surpreender. Antes de escrever a primeira palavra, o modelo tem que passar por tudo que você mandou, as instruções, os documentos anexados e a conversa inteira até ali. É esse preparo, e não a resposta em si, que domina a conta. Imagine alguém que releia um dossiê de duzentas páginas antes de responder cada pergunta nova sobre ele. A leitura é que cansa, não a resposta.

O cache de prompt existe para evitar essa releitura. Quando o começo do pedido é exatamente o mesmo de antes, a API cobra bem menos para reprocessá-lo.

Sem reaproveitar toda chamada relê tudo
preparar o texto (caro)
responder
Com cache de prompt o começo já foi processado
releitura barata
responder

A condição é dura. O começo do pedido precisa ser idêntico, caractere por caractere, com o mesmo modelo e o mesmo esforço. Mudou uma vírgula lá no início e o desconto some para o pedido inteiro.

Mudar o esforço no meio da conversa (o Opus 5 e o Fable 5.1 aguentam isso sem perder o cache)
Deixar data ou hora dentro das instruções fixas, que mudam sozinhas a cada chamada
Trocar a ordem em que as ferramentas são declaradas
Um auxiliar automático que monta o começo do pedido de outro jeito
Demorar mais de 5 minutos entre uma chamada e outra, que é a validade padrão

As cinco situações acima são as que mais fazem uma aplicação perder o desconto sem que ninguém perceba. A mais traiçoeira é a data no texto fixo: ela muda sozinha o tempo todo e invalida o cache a cada chamada.

Prompt do modelo antigo atrapalha o modelo novo

Quase todo prompt antigo tem remendo, uma frase que alguém acrescentou porque o modelo da época errava naquilo. O modelo novo já não erra, mas continua obedecendo. O remendo virou serviço extra, e serviço extra aparece na fatura.

Vícios herdados
  • "verifique duas vezes"o modelo faz tudo duas vezes e cobra as duas
  • "seja o mais completo possível"vira resposta longa e uma busca atrás da outra
  • "pense passo a passo num rascunho"ele já pensa antes de responder, e você pediu para pensar mais uma vez
  • exemplos longos do modelo antigoensinam um caminho longo que o modelo não precisa mais percorrer
  • regras que se contradizemele tenta obedecer às duas ao mesmo tempo
  • configuração datadaé uma opção que não existe mais, e a chamada falha
Depois da limpeza
  • Diga qual é a tarefa e o que você considera uma boa resposta.
  • Diga o que não fazer. Uma vez só, sem reforçar depois.
  • Deixe o modelo decidir quantos passos vai dar.
  • Corte os exemplos que só ensinam um jeito antigo de trabalhar.
  • Resolva a contradição no seu texto, em vez de deixar para o modelo.
  • Confira se as opções que você usa ainda existem na versão atual.
-14,6%
mais barato num teste interno da própria Anthropic, feito ao trocar o Opus 4.8 pelo Opus 5 e limpar o prompt na mesma ocasião
+5,3%
de acerto no mesmo teste. O prompt ficou mais curto e a resposta ficou melhor

Os dois números vêm do mesmo teste interno da empresa, então convém lê-los como indicação de ordem de grandeza, não como promessa. O ponto que interessa é a direção: o prompt encolheu e o acerto subiu.

Quanto o modelo deve pensar antes de responder

Esforço é o quanto o modelo delibera antes de responder, e dá para regular. Clique nas três posições para ver o que muda.

É o equilíbrio para a maior parte do trabalho. O modelo confere o quanto basta e para quando a resposta já se sustenta.

Vale como padrão até um teste mostrar que aquela tarefa pede outra coisa.

Customédio
Qualidadealta

O ganho não sobe junto com o preço. Num dos testes citados, o Fable 5.1 no esforço baixo empatou com o Fable 5 no esforço alto, por cerca de um terço do custo. E ir do penúltimo para o último degrau chegou a render meio ponto de acerto a mais, com quase metade de conta a mais.

O que a empresa publicou junto

A Anthropic também abriu um conjunto de instruções para o próprio Claude fazer essa faxina sozinho, dentro do Claude Code. São três comandos: um audita o prompt em busca dos vícios, outro propõe cortes de custo e o terceiro testa variações até achar a melhor combinação. O material está no repositório de skills da Anthropic, em código aberto.

O número mais chamativo vem de um teste acadêmico

O artigo mostra 58% de corte de custo num teste chamado LegalBench, e o nome engana. É uma coletânea acadêmica de exercícios jurídicos em inglês, montada para comparar modelos entre si. Não tem relação com processo, tribunal ou prática brasileira, e não diz nada sobre desempenho do Claude em petição, contrato ou pesquisa de jurisprudência daqui.

O que interessa é o mecanismo, e não o percentual. Quem contrata desenvolvimento de alguma ferramenta que usa o Claude por trás, situação cada vez mais comum em departamento jurídico, agora tem três perguntas concretas para fazer a quem construiu: o cache está sendo aproveitado, o prompt foi revisado depois da última troca de modelo, e o esforço está calibrado para a tarefa. Quem usa o Claude pela assinatura do chat não tem esses botões, e não precisa mexer em nada.

Fonte: Anthropic, Reducing cost and improving performance with Claude Platform, e post da conta @ClaudeDevs, em 8 de setembro de 2026.