Mistério revelado: a enigmática IA “Ox Alpha” era o GLM-5.3-Flash da chinesa Z.ai

Share
bits wizard anime

Mistério revelado: a enigmática IA “Ox Alpha” era o GLM-5.3-Flash da chinesa Z.ai

Mistério revelado: a enigmática IA “Ox Alpha” era o GLM-5.3-Flash da chinesa Z.ai

Sabe quando um personagem misterioso surge do nada, impressiona todo mundo e só depois revela sua identidade? Foi exatamente isso que aconteceu no universo da inteligência artificial. Um modelo anônimo batizado de Ox Alpha apareceu de graça na plataforma OpenRouter, sem criador declarado, e mesmo assim quebrou recordes históricos de uso.

Depois de dias de especulação, a identidade foi finalmente confirmada: o tal Ox Alpha era, na verdade, o GLM-5.3-Flash, novo modelo de IA criado pela empresa chinesa Z.ai (a conhecida Zhipu AI). Junto com a revelação vieram duas novidades de peso: os pesos do modelo foram liberados globalmente sob a licença MIT e toda a infraestrutura roda sobre chips fabricados na China.

Do anonimato ao fenômeno: a saga do modelo oculto

A história começou de forma discreta. Na última semana, um stealth model (modelo oculto) surgiu no catálogo do OpenRouter, plataforma que reúne diversas inteligências artificiais para desenvolvedores testarem. Ninguém sabia quem estava por trás daquele código sem nome, mas o desempenho logo levantou suspeitas de que algo grande se escondia ali.

E não era impressão. O modelo impressionava pela velocidade, pela capacidade de raciocínio e pelo suporte a fluxos agênticos e programação. Para completar, trazia uma janela de contexto gigantesca de 1 milhão de tokens — espaço suficiente para analisar livros inteiros, bases de código extensas ou longas conversas em uma única tacada.

Liberado gratuitamente para testes, o Ox Alpha virou febre entre desenvolvedores. O tráfego foi tão monumental que o próprio CEO da Stripe, Patrick Collison, publicou nas redes sociais que a IA era “muito impressionante”. Os números confirmaram o hype: segundo a OpenRouter, o modelo processou mais de 20 trilhões de tokens em apenas seis dias, tornando-se o maior da história da plataforma.

As pistas, aliás, já apontavam para a China. A Z.ai já havia usado a mesma estratégia no passado, liberando o codinome Pony Alpha pouco antes de anunciar a família GLM-5. Quem acompanha o setor de perto desconfiou rapidamente — e acertou em cheio.

Afinal, o que é o GLM-5.3-Flash?

Com a identidade revelada, a Z.ai abriu o jogo e detalhou as especificações técnicas do seu mais novo lançamento. Trata-se do primeiro modelo multimodal nativo da linha GLM-5, e os números merecem destaque:

  • Arquitetura 320B-A18B: utiliza a técnica Mixture-of-Experts (MoE), com 320 bilhões de parâmetros totais e apenas 18 bilhões ativos por inferência. Na prática, isso garante equilíbrio entre eficiência computacional e precisão;
  • Multimodal nativo: processa texto, imagens e vídeos em conjunto dentro da janela de contexto de 1 milhão de tokens;
  • Licença MIT: pesos totalmente liberados para uso comercial e acadêmico irrestrito;
  • Hardware 100% chinês: treinamento e execução rodam inteiramente sobre chips de IA fabricados localmente.

A versão de testes não era a versão final

Um detalhe curioso: aquele modelo veloz que encantou a comunidade nem era o produto completo. Zixuan Li, membro da equipe da Z.ai, explicou na rede social X que o Ox Alpha era apenas uma compilação inicial do GLM-5.3-Flash. Segundo ele, o lançamento oficial entrega desempenho mais forte e estabilidade significativamente melhor. A equipe também agradeceu à OpenCode e à OpenRouter pela disponibilização, além dos usuários que levaram o modelo “ao limite” durante os testes anônimos.

Chips chineses: o recado estratégico do lançamento

Talvez o aspecto mais interessante dessa história não esteja nos benchmarks, mas no hardware. Todo o treinamento e toda a execução do GLM-5.3-Flash foram construídos sobre chips de IA de fabricação chinesa. Em tempos de sanções e restrições ocidentais aos semicondutores, o gesto funciona quase como uma declaração pública: o ecossistema chinês de IA alcançou maturidade para competir de igual para igual, sem depender das grandes fabricantes americanas.

Preços agressivos e onde experimentar

Além do download gratuito dos pesos no Hugging Face (zai-org/GLM-5.3-Flash), a Z.ai disponibilizou o modelo via API com valores bem competitivos frente aos concorrentes do mercado:

  • Entrada (input): US$ 0,15 por 1 milhão de tokens;
  • Saída (output): US$ 0,50 por 1 milhão de tokens;
  • Entrada em cache (cached input): US$ 0,03 por 1 milhão de tokens.

Quer colocar as mãos na massa? O GLM-5.3-Flash já está disponível no chat oficial da desenvolvedora (chat.z.ai), no ambiente de desenvolvimento ZCode (zcode.z.ai), via OpenRouter e nas principais plataformas de integração de LLMs.

Fica a reflexão: se um modelo “anônimo” foi capaz de bater recordes de uso em menos de uma semana, imagine o potencial agora que ele se mostrou por completo. A corrida da inteligência artificial ficou ainda mais emocionante — e a China deixou claro que veio para ficar.