AI進化の最も有用な指標は最先端のデモではなく、モデルがいまだ失敗する平凡な作業である。現在Core Automationを率い、かつてOpenAIの研究責任者だったJerry Tworekは、見出しを飾る能力が、AIが実務を担えるかを決定づける領域での停滞を覆い隠していると主張する。この視点は、いま企業のAI導入に関するあらゆる議論の中心に置かれるべきだ。

世界的な意味合いは、能力と信頼性の格差拡大である。基盤モデルは目を見張る試験形式の閾値を次々とクリアする一方で、脆弱で華のない作業——複数ステップのフォーム入力、3文前に述べられた制約の遵守、わからないときにハルシネーションを起こさないこと——でつまずく。ベンダーは天井を売り、購入者は床で生活する。そして床こそ、政府システムを調査する自律エージェントに関する同じ週のニュースが重くのしかかる場所だ。脆弱性を見つける経路を発見できるほど有能だが、予測不可能に行動するほど信頼性に欠けるエージェントは、生産性の物語ではなくガバナンスの問題である。いま希少な投入要素は、生の知能ではなく信頼性なのだ。

これはROI計算を再定義する。エージェント型パイロットを承認する取締役会は、事実上モデルのピークとワーストケースの差分を引き受けている。コストはAPI利用料ではなく、簡単な作業の失敗を捕捉するために必要な人間の監視層と、エージェントが本来行動すべきでない場所で行動するテールリスクである。AIネイティブスタートアップを追う投資家は、デモウェアと信頼できるシステムの差を相応に価格に織り込むべきだ。

日本企業とSIerにとって、これは異例に良いニュースであり、構造的な強みを活かすものだ。国内市場の慎重さ——しばしば導入の遅さとして批判される——は、実は派手さより信頼性への需要であり、その需要こそがいま正しい本能である。常に厳格な統合、テスト、稼働時間への説明責任に価値を置いてきたSIerは、最先端ベンダーが提供不足な要素——信頼性に欠けるモデルを実際のビジネスプロセス内で予測可能に動作させるラストマイル・エンジニアリング——を売る立場にある。

国内の開発チームやRPA運用者にとっての実践的な転換は、派手な概念実証でAIを評価するのをやめ、決定論的RPAがすでに優れている退屈な作業——データ入力、承認ルーティング、例外処理——を中心に障害モードのテストスイートを構築することだ。日本のシステムにとっての勝利アーキテクチャは純粋なエージェントではなく、RPAとルールがガードレールを強制し、LLMが判断を担い、人間が継ぎ目でループに入るハイブリッドパイプラインになるだろう。Tworekの警告を調達チェックリストとして扱い——ベンダーを最高のデモではなく最も弱い簡単な作業で測定する——企業は、他社がこれから学ぶ高価な教訓を回避できる。