AI推論スタートアップのInfinityは、Touring Capital、Principal VC、およびOpenAIとAnthropicに関連する研究者らの支援を受け、評価額約1億ドルで1,500万ドルを調達した。規模は控えめだが、シグナルは軽視できない。

AIの重心は訓練から推論へと移行しつつある。訓練が見出しを飾る一方、製品が出荷された後に継続的コストが存在するのは推論の領域だ。企業がパイロットから本番環境へ移行するにつれ、クエリあたりの経済性がAI機能をマージンエンジンにするか補助金にするかを決定する。フロンティアラボの研究者が推論レイヤーに個人資本を投じる時、彼らは事実上、モデル品質が収斂しつつあり、持続可能な優位性はレイテンシー、スループット、トークンあたりコストにあると認めているのだ。これは小切手の額面以上の価値を持つ構造的な見方である。

既存企業にとって、これは収益性の高い前提を圧縮する。NVIDIAの評価額は、コンピュート需要が採用と線形にスケールするという信念に部分的に依存している。効率的な推論オーケストレーション、バッチ処理、キャッシング、量子化、投機的デコーディングは、GPU時間あたりより多くの出力を抽出することでその結びつきを断ち切る。同じダイナミクスは、顧客が生の容量に過剰支払いすることでAIマージンが成り立つハイパースケーラーにも圧力をかける。AWS、Azure、Google Cloudがソフトウェアレイヤーを譲り渡すのではなく粗利益を守るために推論最適化スタートアップを吸収し続けることが予想される。

その機会は、モデルとアプリケーション間の真のミドルウェア市場である。オープンモデルとクローズドモデル間のルーティング、クラウド間のスポット価格、コスト上限に合わせた調整を標準化する者は、ウェブ時代のCDNに類似した通行料的ポジションに座ることになる。モデルの断片化(Qwen、Kimi、Llama、GPT、Claude)は、中立的な推論レイヤーの価値を低下させるのではなく、むしろ高める。

推奨アクション:企業は推論コストを第一級のKPIとして扱い、単一ベンダーのロックインを避けるべきだ。投資家は利用成長ではなくAI機能の粗利益を精査すべきだ。そしてインフラプロバイダーは、次のサイクルを定義するのは希少性ではなく効率性の向上だと想定すべきだ。勝利するチームは、ベンチマークではなく請求額を最適化する。