A Z.AI, laboratório por trás da família GLM, anunciou nesta quarta-feira (26) o GLM-5.3-Flash. No mesmo post, a empresa diz o que muitos já desconfiavam: o modelo tinha sido pré-visualizado como Ox Alpha.
Na nota de 22 de agosto, a Ponte.IA registrou o lançamento stealth no OpenRouter e o teste gratuito no OpenCode, ainda sem dono oficial. A hipótese mais repetida apontava a Zhipu e uma versão Flash da linha GLM. Agora a confirmação veio do canal da própria Z.AI.
O que a empresa anunciou
Segundo o blog e o post no X, o GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5: lê texto, imagem e vídeo. A janela de contexto fica em 1 milhão de tokens, o mesmo número que o Ox Alpha já anunciava.
A arquitetura citada tem 320 bilhões de parâmetros no total, com 18 bilhões ativos por vez. Os pesos saem sob licença MIT. A empresa também diz que o tráfego do período anônimo rodou em chips de IA chineses.
Na API, o preço padrão informado é US$ 0,15 por milhão de tokens de entrada e US$ 0,50 por milhão de saída (entrada em cache a US$ 0,03). Há pesos, chat, plano de código e API nas plataformas oficiais da Z.AI.
Onde usar agora
No OpenRouter, o modelo já aparece com o nome oficial `z-ai/glm-5.3-flash`. A página antiga do Ox Alpha passa a apontar para essa ficha. No lançamento havia desconto temporário no preço listado.
No OpenCode o quadro é outro. O rótulo Ox Alpha sumiu do catálogo. A conta OpenCode no X anunciou o GLM-5.3-Flash no plano Go, com uso em dobro por tempo limitado, mas, nesta checagem, o modelo ainda não aparecia no seletor. Quem dependia do teste gratuito quase ilimitado da semana passada deixa de ter essa porta, ao menos por enquanto.
Os testes oficiais
No blog de lançamento, a Z.AI publica três recortes. São números da própria empresa e de um índice externo citado por ela. Servem para ver o salto sobre o GLM-5.2 e a posição de preço, não para fechar comparação no uso real.
No Artificial Analysis Intelligence Index (v4.1.1), o Flash aparece com índice 57 a um custo por tarefa bem abaixo dos rivais de inteligência parecida. O gráfico coloca o modelo na ponta barata da curva.
Em seis testes de código e de tarefas longas com ferramentas, o Flash supera o GLM-5.2 com folga em vários eixos. Nos números do anúncio, chega perto do Claude Opus 4.8 no conjunto, e fica à frente em DeepSWE (63,4% contra 58,0%) e AutomationBench (48,8% contra 41,0%).
No Code Bench interno da Z.AI (rodado sobre o Claude Code), o Flash supera o GLM-5.2 em todos os níveis de esforço e, no nível máximo, chega a 29,0, perto do Opus 4.8 (29,5).
O que muda na comparação com a semana passada
O mistério da autoria fecha. O restante do quadro muda pouco em relação ao que o stealth já prometia: foco em código, tarefas longas em várias etapas e uso em produção, agora com nome, preço e licença. Falta conferência ampla de terceiros no produto com o nome oficial.
O que ainda observar
Vale acompanhar se o OpenCode de fato lista o GLM-5.3-Flash no seletor, se o uso em dobro no Go se estabiliza e como o modelo se comporta no uso pago no OpenRouter e na API da Z.AI.
Para quem acompanha pesos abertos, o ponto prático é outro: um modelo multimodal com 1 milhão de tokens de contexto e licença MIT, anunciado com preço agressivo. A Ponte.IA volta se a disponibilidade no OpenCode mudar ou se saírem medições independentes.
Fonte: Anúncio Z.AI no X (26 ago 2026). Blog e gráficos: GLM-5.3-Flash: Frontier Intelligence, Flash Cost. Ficha no OpenRouter. Post do OpenCode sobre o plano Go. Contexto na Ponte.IA: Ox Alpha como modelo stealth (22 ago).