O Claude Opus 5 chegou com números fortes em benchmarks e com a expectativa de ser o novo padrão de quem usa Anthropic no trabalho pesado. Na minha experiência no direito, e na de muita gente que usa modelo de linguagem para trabalho intelectual que não é desenvolvimento de sistema, o resultado prático foi outro. O modelo produz bastante texto, erra com frequência e fica impreciso quando a tarefa pede raciocínio estratégico, e não só redação.
No X a reação se divide. Em leaderboards e demos de programação o Opus 5 ainda aparece no topo ou perto dele. No uso diário, porém, repetem-se relatos de modelo difícil de controlar, que discute instrução, para no meio do caminho, gera linguagem confusa ou exige recomeçar o fluxo do zero para funcionar (ver, por exemplo, o vibe check da Every). Quem avalia conhecimento e escrita, e não só agente de código, descreve um meio-termo estranho: jeito de modelo “gênio”, teto instável no que importa no expediente.
Ponderação de argumentos no caso
Advocacia estratégica não é só redigir. É dar peso. Separar o que decide a causa do que é ruído. Comparar pedidos, prova e tese com a mesma régua. No Opus 5, o que mais me chamou atenção foi a falha de ponderação. O modelo confere importância demais a argumentos menores e não calibra o peso relativo dos pontos. A análise sai enviesada. O texto pode parecer completo e ainda assim conduzir mal o leitor sobre o que é central.
Benchmarks medem uma família de habilidades. O raciocínio jurídico de escritório pede outra: consistência na hierarquia dos argumentos, estabilidade quando o material é contraditório e disciplina para não inflar o acessório. Aí o Opus 5, no meu uso, recua em relação ao que o 4.8 entregava com mais previsibilidade.
Isso não significa que o modelo seja inútil em tudo. Para análise de caso, estratégia de peça e juízo de relevância, ele tem se mostrado um retrocesso prático. Quem migrou por padrão só porque “é o número mais novo” pode estar pagando mais instabilidade sem ganho real no produto jurídico.
Voltar ao Opus 4.8
Se o fluxo no Claude Code ou no CLI da Anthropic piorou depois do 5, não é obrigação aceitar o default. Dá para forçar o Opus 4.8, o modelo anterior que, no meu uso, mantém melhor utilidade para o tipo de raciocínio que a advocacia pede.
Comando no CLI
No ambiente de linha de comando em que o seletor de modelo responde a comandos com barra, digite:
/model claude-opus-4-8
Confirme se a sessão passou a indicar o Opus 4.8 antes de colar autos, minutas ou memórias longas. Se o time trabalha com perfil ou script de inicialização, registre o comando no procedimento interno para ninguém subir de modelo sem querer no meio de um caso.
Reavalie quando a Anthropic corrigir o comportamento ou quando testes no seu próprio material mostrarem ganho claro do 5 sobre o 4.8. Até lá, no meu fluxo, o 4.8 continua sendo a escolha mais segura para raciocínio jurídico de peso.
Fonte: Opinião do autor, com leitura de debates públicos no X sobre Opus 5 em trabalho intelectual (avaliações de uso prático após o lançamento; ex. vibe check Every / Dan Shipper). Não é parecer jurídico.