Groqの第2世代LPUは、Llama級スループットで秒間約1,800トークンをデモしているが、重要なのは素の速度より、それが示唆するものだ。推論専用ASICは、量産規模でGPUに対し一桁のコスト優位へ近づいている。この一つのシグナルが、今日のAI建設ラッシュを支える財務前提を不安定にしている。

最も露出しているのは、H100/H200のフリートを5-7年の減価償却スケジュールで急いで配備したGPUクラウド事業者だ。トークン当たり推論コストがサイクル半ばで半分または3分の1下がれば、回収モデルは壊れる。これは欧州やアジアの地域クラウド事業者から、GPU不足価格が続くという命題全体に依存するCoreWeaveやLambdaのような米国の中堅neocloudまで、世界的な問題だ。2026年以降、推論がAI収益を支配すると予測されるため、そのワークロードで価格決定力を失うことは表面的ではなく存立に関わる。

半導体への示唆は二方向に切れる。'クラウド推論は高いからローカルで処理する'と売ってきたエッジAIベンダーは中核の主張を失う。クラウドの単位コストが崩れると、エッジの経済性はADAS、工場自動化、医療機器のような本物の遅延・帯域制約へ狭まる。汎用エッジAIから、真にミリ秒が重要なニッチへの戦略的縮小が予想される。一方で、推論シリコン陣営は広い。Cerebras、SambaNova、AWS Trainium/Inferentia、Google TPUが同時に進んでおり、これは単一ベンダーの出来事ではなく構造変化だ。

明確な勝者はアプリケーション層にいる。SaaS企業にとって推論は粗利率を直接圧縮する変動費だ。トークン価格が3-5分の1に下がれば、長文書分析、エージェント型ワークフロー、リアルタイム会話を、これまで単位経済性に阻まれていた標準機能として出荷できる。AIマージンの薄いソフトウェア企業には、構造的なマージン拡大が見込まれる。

経営者と投資家への三つの行動はこうだ。第一に、2026年予算では単一ベンダー、つまりNVIDIA既定の調達を捨て、ASIC、クラウド、オンプレミスにまたがるマルチシリコン設計へ移る。第二に、AIベンダー契約へ市場指数連動の価格引き下げ条項を組み込み、下落するコストを取り込む。第三に、あらゆるデータセンター設備投資レビューで、推論コストが年40-50%低下する前提の感応度分析を義務化する。GPU独占プレミアムはいま、減価する資産である。