Zhipuは、オープンな320B混合専門家モデル(18Bアクティブ)の速度調整版であるGLM-5.3-FlashXをリリースし、約10万台の国産アクセラレータ全体で約200トークン/秒を提供していると主張している。これに加え、提供スタックを調整するインフラエージェントも組み合わされている。
見出しの数字はスループットだが、真のシグナルはその実行場所にある。フロンティアクラスのオープンモデルが中国製シリコン上で本番推論を実行している――実験室のデモではなく大規模に――という事実は、国産アクセラレータエコシステムが提供ワークロードにおいて実用可能から競争力のあるレベルへ移行したことを示唆している。Nvidia以外のハードウェアでのトレーニングはより困難な課題だが、推論こそがボリュームと継続的コストが存在する領域である。中国のプロバイダーが品質を維持しながら提供におけるNvidia依存を削減できれば、輸出規制の締め付けは経済的に最も重要なマージンで緩むことになる。これがアジア全域で推論価格を圧縮し、フロンティア展開には欧米製GPUが必要だという前提に圧力をかけることが予想される。
オープンウェイトと自己最適化提供エージェントの組み合わせこそ、戦略家が注目すべき部分である。これにより、誰でも入手可能なシリコン上で有能なモデルを立ち上げる障壁が下がり、市場は単一のハードウェア標準から、ソフトウェアによって調整された複数のアクセラレータのポートフォリオへと分散していく。これはハードウェアの希少性に基づく価格支配力への直接的な脅威である。
日本の企業やSIerにとって、これは主権AI議論の再構築を意味する。従来の計画――希少なNvidia容量をレンタルするか割り当てを待つ――には今や目に見える代替モデルが存在する。それは、オーケストレーションレイヤーが重い作業を担当し、多様化したシリコン上で提供されるオープンウェイトである。基盤モデルAPIの統合に依存してきた日本のSIerは、提供スタックの専門知識(MoEルーティング、量子化、スループット調整)を差別化要素として扱うべきだ。なぜなら、モデル層は展開層よりも速く商品化しているからである。また調達上の注意点もある。中国のオープンウェイトと国産アクセラレータへの依存は、規制対象である日本のセクター――金融、政府、医療――が簡単に承認できないガバナンス、ライセンス、データレジデンシーの問題を伴う。現実的な姿勢は、アーキテクチャと推論経済を綿密に研究しながら、モデルとハードウェアの調達をコンプライアンスと地政学的リスクに整合させることである。RPAや社内開発チームにとっては、より安価な高スループット推論により、エージェント型自動化が2024年時代の予算で想定されていたよりも早く経済的に現実的になる――今すぐベースラインを見直す価値がある。