ある開発者が自身のパーソナルAIアシスタントを約2,000人の攻撃志願者に公開し、彼らがどのようにシステムを破ろうとしたかを記録した。この実験は規模こそ小さいものの、その意味合いは大きい。実際の攻撃者がエージェント型システムをどのように調査するかについて、稀有で透明性の高いマップを提供しており、その知見は2025年における企業のAI導入アプローチを再構築すべきものとなっている。
核心的な教訓は、AIエージェントの脅威モデルが従来のソフトウェアとは根本的に異なるということだ。従来のセキュリティは、コードとデータの間に明確な境界があることを前提としている。大規模言語モデルはその境界を崩壊させる——命令とコンテンツが同じチャネルを流れるため、プロンプトインジェクションはパッチ可能なバグではなく構造的な脆弱性となる。エージェントがツールを呼び出したり、ブラウジングしたり、アクションを実行できるようになると、すべての信頼できない入力が潜在的なコマンドとなる。これが、レッドチーム演習でデモ時には堅牢に見えたガードレールが一貫して回避される理由だ。
タイミングも重要だ。AnthropicのClaudeが有料ユーザーの間でシェアを獲得し、企業がエージェントをCRM、コードベース、決済システムに接続する競争を繰り広げる中、攻撃対象領域は防御ツールよりも速く拡大している。同じ週にPolymarketとKlueでの侵害が発生したことは、サードパーティシステムとAI媒介システムが今や主要な標的となっていることを思い起こさせる。内部システムへのAPIアクセス権を持つエージェントは、事実上、機械的速度かつ攻撃者にとってゼロコストでソーシャルエンジニアリングが可能な特権従業員なのだ。
経営幹部にとって、3つの行動が導き出される。第一に、すべてのエージェント導入を最小権限の問題として扱うこと:ツールアクセスを狭く制限し、不可逆的なアクションには人間の確認を要求し、すべてをログに記録する。第二に、継続的な敵対的テストに予算を割り当てること——公開バグバウンティ型のレッドチームは、内部QAが見逃す失敗モードを明らかにする。第三に、調達前にAIベンダーから曖昧な安全性マーケティングではなく、インジェクション耐性の証拠を要求すること。Microsoft、Google、Anthropicはすべてガードレール層を提供しているが、どれも完全防水ではない。
より広範なシグナル:AIセキュリティは研究上の好奇心から取締役会レベルの運用リスクへと移行している。このような公開実験から学ぶ企業——本番環境でギャップを発見するのではなく——は、エージェント型AIがパイロットからミッションクリティカルなワークフローへ移行する中で、決定的な信頼上の優位性を保持することになるだろう。