Análise Ferramentas 6 min de leitura

Pesos abertos perto da fronteira. Kimi K3, Qwen3.8 e DeepSeek V4

Modelos open weight deixaram de ser “quase bons”. O que mudou em Kimi, Qwen e DeepSeek, e o efeito no custo e no controle do escritório.

Três cartões frosted K3, Q e DS sobre papéis em mesa clara.

Open weight são modelos cujos pesos (os arquivos treinados) podem ser baixados e rodados fora da API do fabricante, com a licença correspondente. Esse ciclo encurtou. Em poucas semanas, Kimi, Qwen e DeepSeek reforçaram a mesma ideia: dá para chegar perto dos modelos fechados de ponta sem depender só de Claude, GPT ou Gemini. Para o escritório, o ponto é custo, controle de dados e opção de fornecedor.

Kimi K3 (Moonshot)

Em 27 de julho de 2026, a conta oficial do Kimi anunciou a liberação dos pesos e do relatório técnico do Kimi K3. O modelo é descrito como MoE de 2,8 trilhões de parâmetros, com visão nativa e janela de contexto de 1 milhão de tokens. A Moonshot apresenta a arquitetura como ganho de inteligência por unidade de computação, não só “mais parâmetros”.

No mesmo dia, provedores de inferência (Together AI, Nebius Token Factory, DigitalOcean, entre outros) anunciaram acesso já no lançamento. Avaliações independentes citadas na praça, como o índice da Artificial Analysis, colocam o K3 no topo do campo open weight e a poucos pontos de modelos fechados fortes. Ranking é fotografia de bateria de testes, não veredito em petição ou parecer.

Na advocacia, o K3 serve como opção de API barata e como candidato a rodar em infra própria ou de parceiro, quando o escritório quiser volume alto de rascunho, triagem e pesquisa com menos dependência de um único fornecedor.

Qwen3.8-Max (Alibaba)

Em 3 de agosto de 2026, a conta oficial do Qwen apresentou o Qwen3.8-Max como modelo mais capaz da linha, com 2,4 trilhões de parâmetros. O anúncio promete pesos abertos do Max na semana seguinte, junto com o Qwen3.8-27B. Preço de API divulgado: US$ 2 por milhão de tokens de entrada e US$ 6 de saída, com cache implícito mais barato.

O discurso oficial enfatiza programação autônoma de longo prazo, multimodal e tarefas longas em trabalho conjunto com o modelo. OpenRouter e outros hubs já listaram o Max na API enquanto os arquivos no Hugging Face ainda eram promessa de calendário. Até a publicação dos pesos e da licença, o que está garantido é o acesso via API e o compromisso público de abertura.

Para o advogado, o 27B open weight é o pedaço mais realista de rodar perto do escritório (máquina local ou VPS). O Max de 2,4T, quando os pesos saírem, tende a viver em nuvem especializada. O efeito prático é pressionar preço e qualidade dos fechados, e permitir experimentação em fluxo sensível com provedor que aceite contrato e acordo de tratamento de dados.

DeepSeek V4-Flash e a liberação de pesos

Em 31 de julho de 2026, a DeepSeek colocou em beta pública a API oficial do DeepSeek-V4-Flash, com ênfase em capacidade de agente e suporte a formatos de API usados por ferramentas de programação. A empresa afirmou que o upgrade valia só para o Flash na API e que o V4-Pro oficial viria o mais rápido possível, com App e Web ainda inalterados naquele momento.

A linha V4 já vinha com preço baixo e contexto longo. Na comunidade open weight, o Flash 0731 apareceu em repositórios e hubs de quantização pouco depois do movimento de API, no padrão DeepSeek de aproximar release de API e liberação dos pesos. Confirme no Hugging Face oficial da DeepSeek a tag e a licença do checkpoint que o escritório for usar. Nome de quant de terceiros não substitui a ficha do modelo base.

No escritório, DeepSeek costuma servir bem onde o volume importa: resumo em lote, primeira passagem em autos longos, rascunho barato de ideias. Continua valendo conferir citação e fato na fonte, sobretudo em português jurídico.

Efeito no escritório

Open weight de verdade mexe em três coisas. Preço de inferência em provedores que hospedam o modelo. Possibilidade de rodar em ambiente sob contrato do escritório. Menos dependência de um único lab fechado quando o default piora, como em migrações forçadas de versão.

Não dispensa revisão humana nem transforma benchmark em prova. Modelos abertos grandes ainda exigem GPU séria ou API de terceiros. Licença, localização do servidor e política de log importam tanto quanto o nome do modelo na planilha de TI.

Teste rápido no acervo

Escolha três tarefas reais do seu acervo: resumo de decisão, esboço de tópicos de recurso e checagem de coerência de fatos. Rode no K3 (API), no Qwen3.8-Max (API) e no DeepSeek V4-Flash. Compare custo, latência e taxa de erro útil (citação inventada, peso errado de argumento, português truncado). Só depois discuta hospedar o 27B ou um quant do Flash por conta própria.

A Ponte.IA volta ao tema quando os pesos do Qwen3.8 e o V4-Pro da DeepSeek tiverem ficha técnica e repositório oficiais estáveis.

Fonte: Fontes primárias no X: Kimi K3 pesos e relatório (@Kimi_Moonshot, 27 jul 2026); Qwen3.8-Max e pesos abertos (@Alibaba_Qwen, 3 ago 2026); DeepSeek-V4-Flash API (@deepseek_ai, 31 jul 2026). Leitura complementar de parceiros de inferência (Together, Nebius, OpenRouter) e relatos de pesos no Hugging Face.