MozillaのData Collectiveは、これまでデータを無秩序に採掘される公共財として扱ってきた市場において、逆張りの立場を取っている。その前提はシンプルだが急進的だ。オープンウェブをスクレイピングして後から訴訟に対処するのではなく、明示的な同意、透明な出所、そして報酬への道筋を持つデータを収集する。より困難な問いは、支配的プレイヤーがすでにインターネット全体を無償で学習した市場において、信頼優先のモデルが生き残れるかどうかだ。

このタイミングは偶然ではない。無差別なスクレイピングを支える法的基盤は侵食されつつある。New York Times対OpenAI訴訟、GettyによるStability AIへの訴訟、そしてEU AI法の学習データ透明性義務は、一つのメッセージに収束している。出所証明は後付けではなく、コンプライアンス上の資産になりつつある。生成AIを展開する企業は今や、ベンダーが何で学習したかについて潜在的責任を負っている。これはほとんどの取締役会が価格に織り込んでいないリスクだ。認証された同意ベースのデータ層は、リスク回避的な金融、医療、政府の買い手が最終的に求めるであろう、補償に適したサプライチェーンそのものだ。

これは真の商業的突破口を生み出す。機会は、生トークン数でOpenAIやGoogleを凌駕することではなく、ライセンスが法的にクリーンで品質が検証可能な、高信頼性のドメイン固有データ層を所有することだ。Adobeのfireflyは、ライセンス取得済みおよび所有コンテンツで学習され、すでに「安全に展開可能」が企業が対価を払う機能であることを実証した。Mozillaはこのロジックを共有インフラに一般化しようとしている。ベンダーというよりデータ協同組合に近い。

実行リスクは高い。同意ベースの収集は、スクレイピングと比較して遅く、断片的で、コストがかかる。ネットワーク効果は、Mozillaが持たない広告とクラウド収益で無料モデルに補助金を出せる既存企業に有利に働く。報酬メカニズム、つまり誰がいくら支払われ、どのように価値が貢献者に還元されるかは、以前のデータ配当スキームを沈没させた未解決の問題のままだ。規制対象企業からの真の需要側の牽引力がなければ、この集団は市場インフラではなく倫理的ブティックになるリスクがある。

経営幹部にとって、戦略的な解釈は、データの出所証明をCSRの話題ではなく、短期的な調達基準として扱うことだ。学習データの証明を要求するベンダー契約を構築し、規制対象または顧客対応ワークロードに触れるあらゆるモデルについてライセンス取得データソースを試行し、買い手が「クリーンな」データに価格プレミアムで報いるかどうかを注視すべきだ。もしそうなれば、Mozillaの賭け、そして同意ベースのデータサプライヤーの並行市場は、理想主義からAIスタックの構造層へと移行する。