AI インフラの重心が静かに移行している。3年間、決定的な指標はアクセラレーター数だった——より多くの GPU、より大規模なクラスター、より大きな学習実行。エージェント型 AI はこのロジックを打ち破る。自律型エージェントが数十の推論ステップを連鎖させ、ツールを呼び出し、単一のタスクを完了するためにコンテキストを再クエリする場合、制約要因は所有するコンピュート量ではなく、ワットあたり、ドルあたり何個の有用なトークンを抽出できるかになる。H3C が Apsara でトークンを中心に議論を組み立てたことは、ハードウェアベンダーの会話が調達量からスループット経済学へ移行しているシグナルである。
グローバルには、これは勝者を再定義する。トークン効率——見出しの FLOPS ではなく——が単価を決定するなら、優位性はフルスタックを最適化する者に流れる:推論最適化シリコン、KV キャッシュ管理、投機的デコーディング、バッチ処理、そして簡単なクエリを小規模モデルに、難しいクエリをフロンティアモデルに振り分けるモデルルーティング。これは購入者の計算も変える。冗長な推論にひっそりとトークンを消費するエージェント型ワークフローは、有望なパイロットを損益の負債に変えうる。企業 AI 支出の次のフェーズは、能力への羨望よりも、完了タスクあたりコストの規律によって統制される。
日本企業にとって、これは AI 競争のより歓迎すべき枠組みである。日本は構造的に資本集約的な GPU 構築に慎重だった——電力、データセンター立地、そしてスケール前に実証可能な投資対効果を求める企業文化に制約されて。トークン効率パラダイムは、まさにその慎重さを報いる。生のコンピュート軍拡競争に勝てなかった企業は、エージェントワークフローをいかに緊密に設計し、不要な推論ループを剪定し、モデルサイズをタスク価値に合わせるかで競争できる。
SI ベンダーへの示唆はさらに鮮明である。国内インテグレーション事業は長らく人員数とシステム納品で収益化してきた;新たな機会はトークンガバナンスである——すべての推論ステップが正当化され、キャッシングが積極的で、モデルルーティングが意図的なエージェントパイプラインを設計すること。クライアントのエージェント型システムが予測可能なトークン単価で成果を提供することを保証できる SI ベンダーは、汎用クラウド再販では対抗できない防御可能なポジションを持つ。FinOps が独立した「TokenOps」実践へ拡大することが予想される。
RPA ベンダーは最も明確な戦略的分岐点に直面している。レガシーなルールベース自動化はエージェント型として再定義されているが、素朴な LLM 駆動エージェントは決定論的スクリプトよりアクションあたりはるかにコストが高い。日本のプロセス自動化市場の持続可能な設計はハイブリッドである:予測可能な80%には安価な決定論的実行、本物の例外には高価な推論を留保する。トークンを無料のコンピュートではなく従量制ユーティリティとして扱うチームが、次の自動化サイクルの経済性を定義するだろう。