業界が2年間にわたって抱いてきた「大きいほど良い」という強迫観念が、より厳しい現実と衝突している。大半の企業AIワークロードにはフロンティアモデルは不要なのだ。GoogleがリリースしたコンパクトでエンコーダーフリーのマルチモーダルモデルGemma 4 12B(オープンウェイト)は、CFOたちがパイロット予算を超えて膨れ上がった推論コストの監査を始めたまさにそのタイミングで登場した。戦略的な問いは、もはや「これができるか?」ではなく、「これを許容可能なレベルで実行できる最も安価なモデルは何か?」となっている。

プレミアムAPIプロバイダーにとって、その数字は厳しい。オンプレミスまたは汎用GPUで動作する12Bオープンモデルを経由したタスクは、分類、抽出、要約、ルーティングにおいて同等の精度でありながら、フロンティアAPIコールの10分の1から20分の1のコストで済む。推論が訓練ではなく、デプロイされたAIのライフタイムコストの大部分を占めるようになると、そのギャップは何百万もの日々のコールにわたって複利的に積み上がる。これは、クラウドコンピューティングとストレージでプレミアム価格を空洞化させたのと同じダウンマーケット移行である。

ここでの勝者は、モデルルーターとオーケストレーション層だ。簡単なクエリを安価なモデルにインテリジェントに振り分け、本当に難しい推論にのみ高価なモデルを使う企業である。「モデル裁定」ツールの急増が予想され、OpenAIとAnthropicはフラッグシップ収益をカニバライズせずに安価な階層を提供しようと防衛的に奮闘するだろう。Google、Meta、Mistralのオープンウェイトは、企業に初めて価格交渉における真の交渉力を与えることになる。

反対圧力となっているのは、TSMCがキャパシティを拡大してもAIチップ需要を満たせないと警告していることだ。コンピューティングリソースの希少性により、効率性は贅沢ではなく生存特性となる。より小型のモデルに移行したワークロードは、本当に必要とされるタスクのためにシリコンを解放する。これがBroadcomの決算がAI取引を冷やした理由だ。投資家たちは、価値が純粋な能力の販売から効率性の販売へとシフトするにつれて、マージン圧縮を織り込み始めている。

推奨アクション:企業は今すぐ階層化されたモデルポートフォリオを構築し、実際のワークロードにおいてオープンウェイトを既存APIと比較ベンチマークし、単一ベンダーのフロンティアモデル依存を集中リスクとして扱うべきである。投資家は、価格決定力が静かに侵食されつつある純粋なフロンティアラボよりも、オーケストレーション、ファインチューニング、推論最適化に注目すべきだ。