Groqの第2世代LPUがMetaのLlama 4 Scoutで毎秒およそ2,000トークンに達したことは、ベンチマークの見出しというより、AIコンピュートスタックが二分化しているシグナルだ。かつて学習と推論は同じ汎用GPUで賄われていた。今では、それぞれ異なる経済性、サプライヤー、減価償却曲線を持つ別個のシリコンカテゴリへ分岐している。経営者にとって、"AIインフラ"を単一の費目として扱うのをやめるべき瞬間である。

技術的な論理は明快だが重大だ。DRAMではなくSRAMベースの決定論的パイプラインを使うことで、推論特化チップはバッチサイズ1でも高いスループットを維持できる。これはリアルタイムエージェントや会話AIのワークロード特性そのものだ。NVIDIAのH100/H200は学習の柔軟性ではなお比肩するものがないが、Groq、Cerebras、SambaNova、Tenstorrentに加え、AmazonのInferentia、GoogleのTPUといった拡大する陣営が、展開済みAIの実際の継続コストが発生する推論層を争っている。

短期的なリスクは、1つのアーキテクチャですべてのニーズに対応できるという前提で数十億ドル規模のGPUクラスターを確保した運用者にある。推論がASICへ移るにつれ、ワークロードを学習とサービングにきれいに分割できない限り、それらの資産は加速的な減損リスクに直面する。SoftBankのGroq提携とStargate構想は、まさにこのコスト曲線にかかっている。トークンあたり推論経済性が成立しなければ、超知能の物語は意味を持たない。

機会も同じくらい具体的だ。OpenAIやAnthropicのAPIで大量の推論を回している企業は、オープンウェイトのLlama級モデルを専門プロバイダー経由でルーティングすることで、特定ワークロードのコストを30〜70%圧縮できる可能性がある。クラウド事業者は専用推論インスタンスを拡大し、GPUの償却スケジュールを見直すべきだ。一方、Tokyo Electron、Disco、CoWoS隣接プレイヤーなどの先端パッケージングと後工程サプライヤーは、ASICベンダーの拡大により多様化した需要サイクルを得る。

推奨アクション:企業は明示的なマルチベンダー推論戦略を採用し、6カ月ごとにトークン経済性を再計算すべきだ。エッジ推論プレイヤーは、安価なクラウド推論がオンデバイスの論理を侵食する前に、低遅延、データ主権、電力効率を中心に自らの堀を再定義しなければならない。コンピュートコストの地盤は2025年後半に本格的に動く。それに合わせて位置取りすべきだ。