XiaomiのMiMo-v2.5-Pro-UltraSpeedは、1兆パラメータアーキテクチャと約毎秒1000トークンという見出しスループットを組み合わせたもので、これは典型的な大規模モデル提供の約10倍の速度である。ベンチマークよりも戦略的シグナルの方が重要だ。最前線は生のパラメータ数から推論経済学へとシフトしており、レイテンシとトークン当たりコストが、モデルが大規模に展開可能かどうかを決定する。
これは競争地図を書き換える。ほとんどの企業にとって、ボトルネックはもはやモデルが十分に有能かどうかではない—GPTクラスの品質はますますコモディティ化している—むしろ、数百万の同時リクエストを損益計算書に耐えうるマージンで処理できるかどうかである。高速かつ低コストで動作する1兆パラメータモデルは、顧客が品質に対してプレミアムを支払うことを前提とするOpenAIやAnthropicといったAPI既存勢力の価格決定力を脅かす。速度最適化された提供スタック(Groq、Cerebras、SambaNova)や投機的デコーディングや積極的スパース性といったアーキテクチャ上のトリックが、真の差別化要因になりつつある。
グローバル経営幹部が過小評価しているのは、コンシューマーハードウェアの側面である。Xiaomiは年間数億台のデバイスを出荷しており、高スループットの自社モデルは、外国のAPI利用料を支払うことなく、スマートフォン、家電製品、EVにAIを組み込むための戦略である。このような垂直統合—自社流通に最適化されたシリコン対応モデル—は、AppleやSamsungが追随を余儀なくされるテンプレートであり、最先端AI価値が一握りの米国研究所にのみ集約されるという前提に圧力をかける。
3つの注意点が誇大宣伝を和らげる。スループット主張は、完全なコンテキスト長と並行性での独立した再現にほとんど耐えられない。1兆パラメータという数字は、実際に稼働するパラメータがはるかに小さいスパース混合専門家設計を隠していることが多い。そして、中国由来のモデルが欧米企業調達に入る際には地政学的精査が続くだろう。中立的なハードウェアで検証されるまで、見出しの数字はマーケティング成果物として扱うべきである。
推奨アクション:AIスタックを構築する企業は、リーダーボードスコアではなく、タスク当たりコストとテールレイテンシでベンチマークを行い、プロバイダー間で裁定取引できるようモデルポータビリティを考慮して設計すべきである。投資家は、APIベンダー間のマージン圧縮と推論最適化レイヤーの価値上昇に注目すべきである。永続的な教訓は、2025年のAI優位性は、最も大きくトレーニングする者ではなく、最も安価にインテリジェンスを提供する者に属するということだ。