Replicate'sの5億ドル調達報道は、構造変化を鮮明にしている。生成AIの経済性はモデル訓練から推論へ移りつつある。AIで稼がれるお金はますますAPIコールの時点、すなわち推論単価にトラフィックを掛けた場所で生まれており、このチョークポイントを握る者がAIインフラスタックの料金所になる。
Replicate、Together AI、Fireworks AI、Modalのような専門企業の台頭は、AWS、Azure、GCPが残した隙間に持続的なニッチがあることを証明している。低いロックインでオープンモデルに集中する領域だ。企業にとって、これは内製か購入かの計算を組み替える。NVIDIA H100/H200のリードタイムはいまだ6〜9カ月に及び、減価償却を含めた実効的なユニットコストは月額7,000ドル前後に近い。一方、従量課金APIはLlama級の推論を100万トークンあたり数ドルまで押し下げてきた。継続稼働でおよそ8基未満のGPUを使うワークロードは、今や所有するより借りる方が圧倒的に安い。すべてのCFOは設備投資を承認する前に、この閾値をモデル化すべきだ。
第二の軸はデータ主権である。銀行、保険、医療、防衛、政府といった規制産業は、顧客データを米国籍の推論APIへルーティングすることで契約上のエクスポージャーを負う。標準になるのは二分化されたアーキテクチャだろう。機微なワークロードには主権型またはオンプレミス推論を使い、一般コンテンツや開発者ツールにはコモディティ化した海外APIを使う。地域データレジデンシーと軽量で省電力なモデルを提供する事業者は、純粋な性能に関係なく、コンプライアンス主導のセグメントを勝ち取る。
第三はロックイン回避だ。OpenAIへの単一プロバイダー依存は、すでに世界的に後退している。LiteLLM、LangChain、Portkeyのようなルーティングレイヤーは、複数プロバイダー間の動的切り替えを標準化しつつある。CTOは3つのKPIを運用に組み込むべきだ。コスト、レイテンシ、品質に関するモデル別SLAの可視性、定量化された切り替えコスト、そしてファインチューニング済みオープンモデルを自社資産に変える出口戦略である。
推奨される行動は次の通りだ。推論を独立した予算項目として切り出し、CFOレベルで月次監視する。セキュリティガバナンスを通じて、ワークロードの機微性別にプロバイダー方針を正式化する。そして冗長性の標準として、少なくとも2つの稼働中API接続を義務化する。2026年には推論専門企業の買収や撤退を含む再編波が起こる可能性があり、マルチベンダーの耐性は任意のヘッジではなく実務上の標準になる。