5520億パラメータのオープンウェイトモデルが、デスクトップクラスのNVIDIA DGX Spark 4台で約494トークン/秒を処理する――これは静かだが重要なデータポイントである。見出しは単純な速度ではない。大規模なフロンティアクラスモデルでクラウド並みのスループットを実現するために、もはやデータセンター契約も専用推論プロバイダーも、独自トークンの外部流出も必要ないという点だ。
グローバルに見て、これは本格的な推論は他社のAPI背後に存在しなければならないという根本的前提を崩しつつある。過去2年間、経済性は全員をホスト型フロンティアモデルへと押しやった。資本支出の回避、弾力的なスケール、運用負担ゼロ。しかし隠れたコストは、外向きに流れるデータ重力と、単なる使用量ではなく成功に比例する従量課金だった。自社保有シリコン上の有能なオープンウェイトモデルはこれを逆転させる。100万件目のクエリの限界費用は電気代に近づき、データは決して施設外に出ない。規制業界――法務、医療、防衛、金融――にとって、この制御の忠実性という論点は、マネージドエンドポイントの利便性をますます上回る。
ハイパースケーラーと推論プロバイダー層にとっての戦略的リスクは現実だが緩やかだ。オンプレミスは、弾力性こそが全てであるバースト型の消費者向けワークロードでクラウドを置き換えることはない。打撃を受けるのは、企業が賃貸ではなく資産化できる、定常的で機密性が高く予測可能な量のワークロードだ。それこそがAPIベンダーにとって最も利幅の厚いセグメントである。
日本市場にとって、これは肥沃な土壌に着地する。日本企業は長年、データ所在性、APPI準拠、組織的リスク回避のためオンプレミスおよびプライベートクラウド体制を好んできた。これが、パブリッククラウドネイティブなAI採用が米国に遅れをとってきた理由の一部だ。コンパクトなエアギャップ環境で使用可能なスループットを提供するオープンウェイトモデルは、機密データを米国ホスト型フロンティアAPIに送信するよりも、日本企業の快適ゾーンにはるかに適合する。また、ドル建てトークン課金の円建て痛手も回避できる。
SIerにとって、これは真剣に受け止める価値のある機会だ。オンプレミスシステムの統合、運用、長期保守という歴史的なSIerの価値提案は、新たな事業分野とほぼ完璧に一致する。パブリックAPIエンドポイントを決して受け入れないクライアント向けに、プライベート推論クラスタを仕様策定、構築、保護、運用することだ。モデル選定、量子化、ハードウェアサイジング、継続的なMLOpsは、他社クラウドの薄い再販マージンではなく、請求可能な統合業務となる。生成AIを純粋にAPIラッパー型ビジネスとして扱うのではなく、真の意味でのオープンウェイト展開能力を今構築する企業は、この変化の正しい側に位置することになる。
2つの注意点が熱狂を和らげる。ピークスループットは同時負荷下での持続的な本番スループットではなく、総所有コストには人材、保守、モデル更新頻度が含まれる――これらは日本のIT組織が歴史的に手薄な領域だ。機会は本物だが、それを捉えるための運用成熟度が制約要因となる。