サービングノード間でトランスフォーマーKVキャッシュを予測的に事前複製し、GPUを恒久的に過剰プロビジョニングすることなく急激なトラフィック急増を吸収できるようにする開発者提案は、単一の実験をはるかに超える大きな問題を指し示している。
それが明らかにする戦略的真実は、AI経済性が大規模で勝敗を分けるのは訓練ではなく推論であるということだ。訓練は資本支出イベントだが、サービングは永続的な運営費の流出であり、支配的なコスト要因はピーク負荷に備えて確保された遊休容量である。本番環境のLLMトラフィックは本質的に急増しやすい——バイラル機能、バッチジョブ、地域の朝のラッシュなど——ほとんどの運用者はピーク時に合わせてクラスターをサイジングし、その後1日のほとんどでほぼアイドル状態のGPUに対して支払いを続ける。30~40%の稼働率は珍しくない。1ポイントの改善が粗利益に直結するため、Together AI、Fireworks、Groq、Basetenのようなサービング専門企業は、生のモデル品質ではなくレイテンシーあたりのコストで競争している。
KVキャッシュは過小評価されているボトルネックだ。コンテキスト長と同時実行数に比例して増加し、希少なHBMを消費し、ノード間の移動にコストがかかる。投機的または予測的複製、プレフィックスキャッシング、分離されたプリフィル/デコード(vLLM、NVIDIA Dynamo、Mooncake型アーキテクチャで既に見られる)などの技術は、同じ洞察に収束しつつある。計算ではなくメモリ移動が、ますますスループットのゲートとなっているのだ。キャッシュ配置をインテリジェントに管理できる者が、同じシリコンでより多くのユーザーにサービスを提供できる。
経営幹部にとって、3つの示唆がある。第一に、推論効率をエンジニアリングの詳細ではなく取締役会レベルのコスト指標として扱うこと——2倍のサービング改善は、新規資金調達ラウンドに匹敵するインパクトをもたらし得る。第二に、AIベンダーをベンチマークスコアだけでなく稼働率とバースト処理能力で精査すること。市場が商品化するにつれ、より優れたキャッシュとバッチング経済性を持つベンダーが競合を価格面で下回る。第三に、これをコモディティハードウェアで動作する効率的なオープンモデルへのシフトと組み合わせること——ローカルまたは安価なアクセラレーターでバーストする能力は、クラウド専用の価格支配力を侵食する。
予測:18か月以内に、推論オーケストレーション——キャッシュ管理、オートスケーリング、バースト吸収——が独立した防御可能なソフトウェアレイヤーとなり、ハイパースケーラーとGPUクラウドプロバイダーによる買収競争がそれを所有しようと加速する。ピーク容量を購入し続ける企業は、弾力性を工学的に実現せず、勝つことのできない価格戦争に構造的に悪い単位経済性を抱えて突入することになる。