智譜AIがGLM-5.3-Flashをオープンソース化:中国製チップクラスターで稼働、価格はClaude Opus 4.8の約40分の1 — BigGo ファイナンス

8月26日夜、智譜AI(02513.HK)はGLM-5.3-Flashを正式に発表し、オープンソース化した。このモデルは、これに先立ちOx-Alpha名義でOpenRouterとOpenCodeプラットフォーム上で6日間の匿名テストが行われていた。総パラメータ数320B、アクティブ18Bで、GLM-5シリーズ初のネイティブ・マルチモーダルモデルとなる。API価格はGLM-5.3のわずか10分の1、期間限定割引中はさらに20分の1まで下がり、Anthropicの旗艦モデルClaude Opus 4.8と比較すると約40分の1となる。

Artificial AnalysisのIntelligence Index総合知能指数において、GLM-5.3-Flashは57点を獲得し、Claude Opus 4.8と並んだ。後者の公式API標準価格は100万トークンあたり入力5ドル(約800円)、出力25ドル(約4,000円)。智譜AIが自社開発したZ.ai Code Benchによる体感評価でも、両者のプログラミングにおける実際の使用感は同水準にあることが示された。

これは、オープンソースモデルが、これまで主に高価格のクローズドな旗艦モデルが占めていた能力領域に到達したことを意味する。ただし智譜AI側は、GLM-5.3-FlashがすべてのタスクでOpus 4.8と完全に同等であるとは主張しておらず、個別のベンチマーク、長時間タスクの安定性、実際のエージェントタスクでは依然として差が生じる可能性があるとしている。

中国製チップクラスターが初めて世界の実トラフィックを担う

GLM-5.3-Flashの発表は、Ox-Alphaをめぐる最大の謎——これほど大規模な海外向け無料テストの計算能力が一体どこから来ていたのか——の答えも明らかにした。

智譜AIは、正式発表前にGLM-5.3-FlashがOx-Alpha名義でOpenCodeとOpenRouter上で匿名テストを実施していたことを確認した。モデルは公開後すぐにその週で最も人気のあるモデルとなり、両プラットフォームで呼び出し量の新記録を樹立。OpenRouterプラットフォームでは、わずか6日間で20兆トークン超を処理した。第三者統計によると、8月25日時点でOx-AlphaはOpenRouterの直近7日間で約23.2兆トークンを処理し、第1位。同期間のDeepSeek V4 Flash 0731の約11.6兆トークンの2倍に相当する。

公式には具体的なチップ枚数は公表されていないが、智譜AIが初めて大規模な中国製チップクラスターを用いて、世界中の開発者からの実トラフィックを直接担ったことは確認された。匿名テスト期間中、ユーザーはモデルの背後に誰がいるのか、どのチップが使われているのかを知らず、速度・安定性・性能のみに基づいて継続利用を判断した。中国製の計算能力は、ラボ環境でのピーク性能のデモではなく、持続的な実トラフィックによるテストを受けたことになる。

最先端モデルを実際に中国製チップ上で動かすため、智譜AIは推論システムに大規模なカスタマイズを施した。中国製チップ1枚が現在直面する主なボトルネックはメモリ容量と帯域幅であり、GLM-5.3-Flashは最大1Mコンテキストをネイティブサポートするため、ビデオメモリと通信への要求がさらに高まる。智譜AIはSGLangをベースに専用推論エンジンを構築し、ノード内テンソル並列、ReplaySSM、W8A8量子化、INT8/FP8/BF16混合キャッシュ量子化、Layer Splitなどの技術を導入。計算力で帯域幅を補い、通信でビデオメモリを補う方式でハードウェア制約を低減した。

クラスターレベルでは、智譜AIはEncode-Prefill-Decode(EPD)分離アーキテクチャを採用し、マルチモーダルエンコーディング、プロンプトのプリフィル、トークンごとのデコードを、独立してスケジューリング・スケーリング可能な3つのワークプールに分割。各段階がそれぞれの計算特性に応じて動作するようにした。智譜AIの公表データによると、同一ハードウェア上の初期ベースラインと比較して、このソリューションはエンドツーエンドのサービス性能を3倍向上させ、ハードウェア効率と1トークンあたりのコストは主流のNVIDIA GPUと同等水準に達したという。

強調すべきは、いわゆる40分の1という価格は、中国製チップのハードウェア推論コストが海外GPUの40分の1であることを意味するわけではない点だ。より正確な理解は次の通り:すべて中国製チップクラスターで稼働する最先端モデルサービスが、ユーザー向け価格をClaude Opus 4.8の約40分の1にまで引き下げた、ということである。

単なる縮小版ではないアーキテクチャ再構築

GLM-5.3-Flashの登場は、Flashシリーズがこれまで「旗艦モデルの簡易版」に過ぎなかったという位置づけを打ち破った。

パラメータ構造を見ると、GLM-5.3-Flashは総パラメータ数320B、トークンごとに18Bのパラメータをアクティブ化し、全45層。参考までに、GLM-4.5は総パラメータ数355B、アクティブ32B、全92層だった。GLMの初期旗艦アーキテクチャと比較して、トークンごとに実際に計算に参加するパラメータ数とネットワーク深度はともに明確に低下している。しかし智譜AIが公表したベンチマークと実際の使用結果によれば、GLM-5.3-Flashの総合能力は、パラメータ規模がより大きいGLM-5.2をむしろ上回っている。

鍵となる変化はアーキテクチャレベルの再設計にある。GLM-5.3-Flashは、スパース注意と線形注意のハイブリッドアーキテクチャを採用した初のオープンソース最先端モデルである。線形注意は再帰メカニズムによって局所的な依存関係を処理し、スパース注意は軽量インデクサーを用いて長いコンテキストの中で本当に計算が必要なグローバル情報を呼び出す。1Mコンテキストにおけるインデクサー自体のメモリとレイテンシの問題に対し、智譜AIはIndexPoolメカニズムを導入し、重み付きプーリングによってインデクサーが持つ4つのキャッシュベクトルを1つに圧縮した。

智譜AIの試算によると、GLM-5.3と比較してGLM-5.3-Flashの注意計算量は3.01倍削減され、KVキャッシュサイズは4.44倍削減された。智譜AIが挙げたGLM-5.3、DeepSeek-V4-Flash、Kimi-K3などのベースラインモデルの中で、GLM-5.3-Flashの注意計算量は最も低い。

このデータは、価格がなぜ大幅に下げられるのかを直接的に説明している。特にコーディングやエージェントタスクでは、1つのタスクが数十分から数時間連続して実行されることがあり、モデルはコード、履歴会話、ツールの返却結果を読み込み続け、コンテキストが持続的に増加する。注意計算量とKVキャッシュは、長時間タスクがどれだけのビデオメモリ、計算力、推論コストを消費するかを直接決定する。

GLM-5.3-Flashはまた、多様体制約ハイパーコネクション(Manifold-Constrained Hyper-Connections、mHC)を導入し、30Tトークンのマルチモーダル事前学習コーパスを使用。パラメータ数と計算量を削減しながらモデルのスケーリング能力を向上させ続けている。最終的に形成されたのは、単に小さいモデルではなく、低コスト推論を中心に再設計されたモデルアーキテクチャである。

視覚能力がエージェントのクローズドループを支える

GLM-5シリーズ初のネイティブ・マルチモーダルモデルとして、GLM-5.3-Flashに視覚能力が追加された目的は、単純な画像認識ではなく、コーディングとエージェントのシナリオに直接貢献することにある。ウェブページ、ゲーム、3Dモデリングなどのタスクでは、モデルが最終的に生成するのはコードだけでなく、実際に画面に表示されるページ、インタラクション、仮想シーンである。モデルが自分自身の生成結果を再び「見る」ことができて初めて、ボタンがずれていないか、ページが本当に正しくレンダリングされたか、3Dシーンが期待通りかを判断し、修正を続けることができる。

智譜AIはそのため、モデルの自己視覚判断能力とテスト時改善能力を特別に訓練し、モデルが生成後に結果を観察し続け、環境フィードバックに基づいて反復できるようにした。公式が公開した事例では、GLM-5.3-Flashが外部素材なしで16時間自律的に動作し、Blender上で約400平方メートルのプロフェッショナルなシェフ用住宅とテストキッチンを構築した。

同様のメカニズムはPPTX、PDF、DOCX、XLSX、そして金融・法律などの専門タスクにも拡張されている。モデルはコンテンツを生成するだけでなく、視覚的な結果を通じて自身の出力をチェックし修正し続けることができる。金融分野では、ソースベースの金融リサーチ、レポート生成から金融モデリング・分析までの一連のフローをカバー。法律分野では、契約書の費用、口座、責任条項を審査し、弁護士の慣例に従って注釈を残すことができる。

現在、GLM-5.3-FlashはMITライセンスでオープンソース化され、ZCodeなどのコーディングプラットフォームに統合。GLM Coding Plan(毎日10,000枚の体験カードを限定配布)に組み込まれ、API呼び出しも同時に開放された。最先端モデルの能力、オープンウェイト、中国製チップによる大規模オンライン稼働、極めて低いAPI価格——これらの要素が1つの製品に同時に揃ったのは初めてのことである。

業界の視点から見れば、この出来事の意義は単一モデルの発表を超えている。過去1週間の匿名テストは、中国製チップが最先端モデルを安定的かつ経済的に支え、世界中の実開発者に直接サービスを提供できるかどうかを実際に検証した。このモデルが持続可能であれば、AI推論コストの価格決定ロジック、そして中国製計算能力のグローバルAIインフラにおける位置づけを変える可能性がある。