ひとつのURLが10年後も解決されるかどうかを問う公開の賭けは、些細に聞こえる。だが、そうではない。これは、大半の経営幹部が他人事として扱っている構造的な弱点を結晶化している。ウェブには記憶の保証がなく、企業がますます依存する資産は、デフォルトで劣化するインフラ上にホストされているのだ。
その規模は過小評価されやすい。Pew Research CenterとHarvardのLibrary Innovation Labによる調査では、過去10年間のウェブページの約4分の1が消失しており、古い文書内のリンクの大半はもはや解決されないことが判明している。製品、コンプライアンス記録、知識ベースが外部ソースを参照している組織にとって、これはアーカイブの些事ではなく、業務上および法的なエクスポージャーである。規制当局への提出書類は無効なURLを引用している。サポート文書は廃止されたページを指している。契約書は、静かに404を返すリンクにホストされた条項を参照している。
AIによってリスクは急激に高まる。大規模モデルは継続的に上書きされるウェブのスナップショットで訓練され、検索拡張システムは予告なく消失または変異する可能性のあるライブソースを照会する。出所——モデルが何から学習したか、そのソースがまだ存在するかを知ること——はガバナンス要件となりつつあり、単なる美徳ではない。訓練データが再構築できない場合、監査可能性は崩壊し、それはまさにEUなどの規制当局が向かっている方向である。
ここでの機会は、慎重な者に有利に働く。耐久性のあるコンテンツアドレス指定ストレージと検証可能なアーカイビングを提供するベンダー——Internet Archiveとの提携、Perma.cc型のパーマリンク、新興の暗号タイムスタンプ——は、ニッチから必須へと移行する。不変で改ざん防止の保持を組み込むクラウドプロバイダー(AWS、Azure、Google Cloudはすべてオブジェクトロックの変種を提供)は、保存を単なる安価なストレージではなく、コンプライアンス製品として位置づけることができる。
推奨される対策:外部依存をサプライチェーンリスクとして扱い、棚卸しを行う。コンプライアンス、契約、製品主張に関わるリンクすべてについて、アーカイブスナップショットを義務付ける。AIチームには、訓練および検索ソースを取得しバージョン管理して、系統がソースより長く存続するようにする。次の10年に勝つ企業は、ウェブが忘却すると想定し、それでも記憶するシステムを構築した企業である。