Together AI'sの6億ドルSeries Cは、戦略的な転換点を示している。AIの経済性が決まる戦場は訓練ではなく推論になりつつある。同社はLlama、Mistral、DBRXのようなオープンウェイトモデルの提供に特化することで、モデルとアプリケーションの間にあるレイヤーがコモディティ化し、トークン単価をゼロへ近づける者が企業支出を勝ち取ると賭けている。

圧力はハイパースケーラーに真正面からかかる。AWS BedrockとAzure OpenAI Serviceは標準的な買い手選択の地位を享受してきたが、推論はいま本番AI運用コストのおよそ60〜70%を占める。価格で下回れる集中型チャレンジャーは、これらの契約を粘着的なものから再交渉可能なものへ変える。2026年予算を組むグローバル企業は、年間推論コストが30〜40%下がると想定し、それを受け身の棚ぼたではなく調達上の交渉材料として扱うべきだ。

より持続的な変化はアーキテクチャである。モデル開発と推論インフラのアンバンドリングだ。提供が競争的なマルチベンダー市場になるほど、賢い動きはモデル抽象化レイヤー、LiteLLM、LangChain、または同等の仕組みを置き、プロバイダー間のルーティングを2年契約ではなくランタイムの判断にすることだ。単一APIへ固定されたままの企業は、18カ月以内に後悔するスイッチングコストを積み上げている。

勝者と敗者は明確である。独立系モデルビルダーは恩恵を受ける。推論のコモディティ化により、希少な資源をモデル品質とドメイン深度の差別化へ集中できるからだ。主権クラウドやナショナルクラウドの取り組みはより難しい計算を迫られる。世界規模の専門業者に純粋な価格で勝つことはできないため、生き残りは機微データ、すなわち金融、医療、防衛に対する規制適合、言語・ドメイン調整、柔軟なハイブリッドまたはオンプレミス展開に依存する。純粋なコスト競争は負け筋であり、意図的に離脱すべき立場である。

CIOとCTOへの推奨行動は次の通りだ。第一に、主要LLMワークロードを少なくとも3つの推論バックエンド、ハイパースケーラー、専門業者、地域プロバイダーでベンチマークし、四半期ごとに更新する。第二に、抽象化レイヤーを社内標準として義務化し、ロックインを無力化する。第三に、データ機微性分類を正式化し、推論プロバイダーに対応付けることで、コストと管理のトレードオフを経営が明示的に統制できるようにする。推論主権はいまやベンダー選定の脚注ではなく、取締役会レベルの競争力問題である。