本文へスキップ
MameTechNews
AI

Z.ai、GLM-5.3-Flashを公開 320B/活性18BのMITマルチモーダル

## POINTS

  • 活性18Bの多モーダルMoEで長文コストを抑えつつ、1Mコンテキストを維持できる。
  • 重みはMIT公開で、SGLangやvLLMでのローカル運用が公式に案内されている。
  • 匿名公開時に人気化した実績があり、API費用削減の有力な比較候補になりうる製品だ。

Z.aiは2026年8月26日、GLM-5.3-Flashを発表した。GLM-5シリーズ初のネイティブマルチモーダルで、総パラメータ3,200億・活性180億のMoE構成。コンテキストは100万トークン。線形とスパースを組み合わせたハイブリッドアテンションやmHCを導入し、同社GLM-5.3比でアテンション計算量を約3分の1、KVキャッシュを約4.4分の1に抑えたとする。

公開前はOpenCode/OpenRouter上で「ox-alpha」として匿名提供され、中国製AIチップ上でも週間人気1位になった。Artificial Analysis Intelligence Index v4.1.1ではスコア57をタスクあたり約0.045ドル(割引時)で達成したと主張。コーディング・エージェント系ベンチではGLM-5.2を上回り、自社Code Benchでは最大努力時にClaude Opus 4.8(29.5)に近い29.0とした。視覚をコーディングループに組み込み、画面や成果物の自己検証も強化している。

重みはHugging FaceでMIT公開。SGLang、vLLM、TokenSpeed等でローカル推論でき、GLM Coding Plan利用者にはGLM-5.3比で約3倍の利用枠も案内された。コスト重視のコーディング/エージェント用途で、既存クローズドAPIの代替比較に値する。