Googleの主張は今や数字で裏付けられている。急増するクラウド収益は、数年にわたるAI設備投資の成果であり、新しいGemini 3.x FlashおよびFlash-Liteモデルはそれを複利的に拡大させる手段である。戦略的な動きはモデル自体ではなく価格設定にある。最先端に近い性能をコモディティコストに近づけることで、Googleは推論を十分に安価にし、開発者がデフォルトで自社スタックを選ぶようにした上で、周辺のコンピューティング、ストレージ、データの重力から収益化を図っている。
これは、すべてのハイパースケーラーの決算説明会を悩ませてきた設備投資論争を再定義する。投資家たちは、AIインフラへの数百億ドルの支出が利益率に転換されるかどうかを疑問視してきた。Googleの答えは、この支出はコストセンターではなく、需要側も支配している市場の供給側であるというものだ。Microsoftは OpenAIと企業向けOffice販売網に依存し、AmazonはBedrockの中立性とTraniumに依存している。Googleの差別化要因は、TPUシリコンからモデル、クラウドまでの全領域を所有していることで、API専業の再販業者が被るようなマージン流出なしに価格で競合を下回ることを可能にしている。
プレッシャーは純粋なモデル研究所と中堅推論プロバイダーに最も厳しく降りかかる。ハイパースケーラーがクラウドと広告の利益で高性能なFlashクラスのモデルを補助できる場合、独立系APIのマージンはゼロに向かって圧縮される。AnthropicとOpenAIは、コモディティの底辺から脱却するために、独自の販売チャネルまたはプレミアム推論層をますます必要としている。Kimi K3のような強力で低コストの中国モデルの並行的な出現が、同じデフレを世界規模で加速させている。
企業の購買担当者にとって、機会は現実的だがロックインも同様である。トークンの低価格化はAI機能のコストを実質的に削減するが、1つのベンダーの価格/レイテンシ曲線に合わせて調整されたワークロードは移行コストが高い。経営幹部はモデル選択をポートフォリオ決定として扱い、少なくとも2つのクラウド間でFlashクラスのオプションをベンチマークし、ルーティング層の背後に推論を抽象化し、プロバイダーがシェアを競い合っている今のうちにコミット支出割引を交渉すべきである。
推奨される姿勢:ここでは素早い追随者が勝つ。大量で低リスクのタスクには安価な層を採用し、収益重視の経路にはプレミアム推論モデルを確保し、単一プロバイダーにデータパイプラインを深く構築して、切り替えコストが今獲得した節約分を相殺するような事態は避けるべきである。