University of Texas at AustinのチームはAgingBenchを公開した。これは直感に反する失敗モード、すなわちAIエージェントが長時間セッションでメモリを蓄積するにつれ推論精度を失うことを定量化するベンチマークである。ベンダーが競って出荷した機能、永続的な長期メモリそのものが、静かに性能を侵食するメカニズムかもしれない。

これが重要なのは、2024~2025年のエージェントをめぐる物語全体が、メモリを堀として構築されていたからだ。Anthropic、OpenAI、Googleはいずれもコンテキスト保持を差別化要因として位置づけ、RAGとエージェントオーケストレーションをめぐる企業アーキテクチャは、履歴が多いほど能力も高いと仮定している。AgingBenchはその仮定を反転させる。膨れたコンテキストウィンドウとノイズの多い履歴データは、組織知というより認知的な散らかりとして振る舞う。大規模に検証されれば、継続稼働エージェントの設計、監視、契約のあり方の再考を迫る。

運用上のエクスポージャーは、常時オンのデプロイに集中する。コールセンター、金融助言ボット、医療トリアージ、社内copilotのように、SLAとKPIが時間を通じて安定した性能を前提にしている領域だ。ヘルプデスクエージェントの精度が数週間にわたって静かに下方ドリフトするなら、多くの組織が検知する計測器を持たない盲点が生まれる。規制産業では、検知されない劣化は品質問題にとどまらない。コンプライアンスと責任の問題である。

機会はMLOpsとオブザーバビリティの真ん中にある。Datadog、New Relic、新興エージェント監視専門企業には、'エージェントヘルス'ツール、劣化検知、定期的なメモリ剪定、管理サービスとしての周期的再キャリブレーションを構築する明確な開口部がある。システムインテグレーターはこれを継続保守収益へ転換でき、選択的忘却、保持するものと捨てるものを決めることを解くモデルベンダーは、単にコンテキストを抱え込むベンダーより持続的な優位を持つ。

経営者は今行動すべきだ。本番エージェントに対して四半期ごとのAgingBench型性能監査を制度化すること。メモリリセットの頻度と保持選択ポリシーを運用ランブックに明文化すること。そしてベンダー契約を再交渉し、明示的な性能維持義務とリフレッシュ条項を含めること。エージェントを設定して忘れるインフラではなく、定期的な'健康診断'を要するシステムとして扱うチームは、迫り来る静かで累積的な信頼性障害の波を避けられる。