何が起きたか
Z.aiはGLM-5.3を公開した。GLM-5.2と同じベースモデルを使い、改善は後学習のスケール(環境数・タスク多様性・学習計算量)に由来すると説明している。社内Z.ai Code BenchではGLM-5.2比で50%向上とし、Terminal-Bench 3.0は4.6から28.3、DeepSWE v1.1は46.2から66.9など長時間タスク系で伸びが大きい。
背景・なぜ今重要か
コーディングだけでなく脆弱性発見・エクスプロイト系ベンチでも向上が報告され、CyberGymは84.5%とされた。ウェイトは安全性評価後に約2週間で公開予定。APIではreasoning_effortがlow/high/maxの3段階で、thinkingの無効化はサポートされない。
エンジニアへの影響
コーディングエージェントの候補比較に加わる一方、セキュリティ用途では能力向上が両刃である。既存クライアントがthinking.type: disabledのままだとリクエスト失敗するため、モデルID更新前にパラメータ移行が必須だ。