Opinião Ferramentas 5 min de leitura

Opus 5 pontua bem em benchmarks e falha no raciocínio jurídico do dia a dia

Opinião. No trabalho intelectual de advocacia, o modelo novo parece um retrocesso prático frente ao 4.8. Como voltar ao modelo antigo no CLI.

Pasta e papéis em mesa; cartão com logo Claude.

O Claude Opus 5 chegou com números fortes em benchmarks e com a expectativa de ser o novo padrão de quem usa Anthropic no trabalho pesado. Na minha experiência no direito, e na de muita gente que usa modelo de linguagem para trabalho intelectual que não é desenvolvimento de sistema, o resultado prático foi outro. O modelo produz bastante texto, erra com frequência e fica impreciso quando a tarefa pede raciocínio estratégico, e não só redação.

No X a reação se divide. Em leaderboards e demos de programação o Opus 5 ainda aparece no topo ou perto dele. No uso diário, porém, repetem-se relatos de modelo difícil de controlar, que discute instrução, para no meio do caminho, gera linguagem confusa ou exige recomeçar o fluxo do zero para funcionar (ver, por exemplo, o vibe check da Every). Quem avalia conhecimento e escrita, e não só agente de código, descreve um meio-termo estranho: jeito de modelo “gênio”, teto instável no que importa no expediente.

Ponderação de argumentos no caso

Advocacia estratégica não é só redigir. É dar peso. Separar o que decide a causa do que é ruído. Comparar pedidos, prova e tese com a mesma régua. No Opus 5, o que mais me chamou atenção foi a falha de ponderação. O modelo confere importância demais a argumentos menores e não calibra o peso relativo dos pontos. A análise sai enviesada. O texto pode parecer completo e ainda assim conduzir mal o leitor sobre o que é central.

Benchmarks medem uma família de habilidades. O raciocínio jurídico de escritório pede outra: consistência na hierarquia dos argumentos, estabilidade quando o material é contraditório e disciplina para não inflar o acessório. Aí o Opus 5, no meu uso, recua em relação ao que o 4.8 entregava com mais previsibilidade.

Isso não significa que o modelo seja inútil em tudo. Para análise de caso, estratégia de peça e juízo de relevância, ele tem se mostrado um retrocesso prático. Quem migrou por padrão só porque “é o número mais novo” pode estar pagando mais instabilidade sem ganho real no produto jurídico.

Voltar ao Opus 4.8

Se o fluxo no Claude Code ou no CLI da Anthropic piorou depois do 5, não é obrigação aceitar o default. Dá para forçar o Opus 4.8, o modelo anterior que, no meu uso, mantém melhor utilidade para o tipo de raciocínio que a advocacia pede.

Comando no CLI

No ambiente de linha de comando em que o seletor de modelo responde a comandos com barra, digite:

/model claude-opus-4-8

Confirme se a sessão passou a indicar o Opus 4.8 antes de colar autos, minutas ou memórias longas. Se o time trabalha com perfil ou script de inicialização, registre o comando no procedimento interno para ninguém subir de modelo sem querer no meio de um caso.

Reavalie quando a Anthropic corrigir o comportamento ou quando testes no seu próprio material mostrarem ganho claro do 5 sobre o 4.8. Até lá, no meu fluxo, o 4.8 continua sendo a escolha mais segura para raciocínio jurídico de peso.

Fonte: Opinião do autor, com leitura de debates públicos no X sobre Opus 5 em trabalho intelectual (avaliações de uso prático após o lançamento; ex. vibe check Every / Dan Shipper). Não é parecer jurídico.