DeepSeekはDSecを発表した。これはエージェント型強化学習システムの訓練のため、1日約300万個の一時的サンドボックスを立ち上げる弾力的な計算プラットフォームであり、ピーク時には38万個以上のインスタンスが同時稼働し、毎秒5,000個を超える生成レートを記録する。

この見出しの数字は、戦略的なポイントから目をそらすものだ。最先端のラボが静的な次トークン予測から、行動し、観察し、反復するエージェントへとシフトするにつれ、ボトルネックは生のGPU時間から、エージェントが実践する環境へと移行する。バグ報告、取引執行、コードベースのナビゲーションをエージェントに教えることは、テキストを与えるだけではできない。エージェントには、何百万回も失敗できる安全で使い捨て可能な世界が必要だ。DSecは本質的に、そうした世界の工場である。これはAI軍拡競争を再定義する:持続可能な堀は、重みそのものではなく、惑星規模で実行環境をプロビジョニングし、隔離し、破棄するオーケストレーション層へとますますシフトしている。重みは流出し、蒸留される。1日300万個のクリーンなサンドボックスを確実に製造するパイプラインは、はるかにコピーが困難だ。

これは、自律エージェントが実システムを侵害するという今週のセキュリティ論調とも直結する。有用なコーディングエージェントを訓練する同じサンドボックスインフラが、実際のターゲットを調査できるエージェントも訓練する。訓練環境と本番環境の攻撃面との間のギャップは、ほとんどの企業が想定するよりも薄く、DSec級のツールは、良くも悪くも、世界で行動するエージェントを構築するコストを下げる。

日本企業やSIerにとって、この意味するところは不快だが明確である。国内の議論は、どの基盤モデルを採用するかに固執し、AI戦略を調達として捉えてきた。DSecが示唆するのは、より価値の高い仕事は環境的なものだということだ:エージェントが企業の実際のワークフローに対して訓練・検証できる、模擬台帳、モックERPインスタンス、合成運用サンドボックスの構築である。NTTデータ、NRI、富士通などのSIerは、モデルラボが持たないもの――日本の銀行、製造業、政府システムが実際にどう動くかについての深く複雑な知識――をすでに持っている。そのドメイン現実を再現可能なエージェント訓練・評価環境にパッケージ化することは、ハイパースケーラーが海外から簡単に複製できない防御可能なビジネスである。

RPA既存企業は、より厳しい再考を迫られる。ルールベースの自動化は安定したスクリプト化された世界を前提としていた。エージェント型強化学習は、シミュレート可能でエージェントに学習させられる世界を前提とする。RPAを自動化の天井と扱ってきた日本企業は、サンドボックスベースのエージェント訓練を次の床と扱うべきだ。勝者となるのは、どのモデルが最も賢いかを問うのをやめ、自社のエージェントが能力を獲得する環境を構築し、さらにそれと同じ能力が自社に向けられないようなガバナンスを構築するチームだろう。