AMDは、AIモデルの重みを汎用GPUにロードするのではなく、シリコンに物理的にエッチングするチップを開発するスタートアップTaalasを買収した。価格よりも戦略的シグナルの方が重要だ。業界の重心は学習から推論へと移行しており、そこでは実際の資金が1日に数百万回費やされている。
汎用アクセラレータは極めて柔軟だが、重みがメモリと演算の間を絶えず往復するため、電力とレイテンシーの面で代償を払う。モデルをハードワイヤリングすることでそのオーバーヘッドを解消し、トークンあたりワット数で桁違いの向上が期待できる。トレードオフは硬直性だ。シリコンに焼き込まれたモデルはパッチ適用や入れ替えができない。この緊張関係が賭けの本質を定義する。フロンティアアーキテクチャが十分に安定し、特定のモデルが12〜18ヶ月の量産期間に値するほど固定化する場合にのみ機能する。Etched、Groq、Cerebrasは異なる角度から同じ仮説を追求している。Google、Amazon、Microsoftはすでに社内でカスタム推論シリコンを運用している。
AMDにとって、これはNvidiaに対する側面攻撃だ。AMDはCUDAのソフトウェア堀に対する正面からのGPU戦争には勝てないため、競合が意図的に攻勢を弱めているカテゴリーでオプション性を買っている。推論がトークンあたりコストで測定されるコモディティユーティリティになれば、最も安価な提供基盤を持つ者がボリュームを獲得し、推論はボリュームに依存する。
買い手にとってのリスクは資本の座礁だ。今日のモデルをチップ群にエッチングした顧客は、次の四半期に大幅に優れたアーキテクチャが出荷されれば損失にさらされる。ハイブリッド展開が予想される。実験や変動の激しいワークロードには柔軟なGPU、検索、レコメンデーション、音声などの安定した高スループットエンドポイントには固定機能シリコンという組み合わせだ。
推奨アクション:ハイパースケーラーと大規模AI製品チームは、最も安定した最大ボリュームのモデルで固定機能推論を今すぐパイロット運用し、アーキテクチャの変動をヘッジするリフレッシュ条件を交渉すべきだ。投資家は、学習FLOPsだけでなく、どのシリコン戦略が複利効果を生むかの先行指標として推論提供コスト曲線を追跡すべきだ。勝者は、単一の選択肢に標準化する者ではなく、ワークロードの変動性を適切なハードウェアにマッチングする者となるだろう。