New York TimesがOpenAIとMicrosoftを相手取り3年前に起こした著作権訴訟で公開された新たな文書から、企業が人工知能の訓練のためにコンテンツを収集する方法と、それが出版社に及ぼす影響についての内部評価が明らかになった。文書の重要な部分はThe Timesの申立書に基づいているが、根拠となる添付資料は依然として非公開とされている。
申立書によると、Microsoftの応用科学担当ディレクターであるBrent Hechtは2023年1月、人工知能のためのデータ収集について「前例のない規模で驚くべき労働の盗用」であり、「人類史上最大の労働の盗用」だと評した。OpenAIでChatGPTを統括するNick Turleyは一方、チャットボットのような製品が出版社にとって「存亡に関わる脅威」になるとし、製品は大部分が代替的であり、発展するにつれてさらに代替性が高まると記した。
Microsoftのデータによると、Copilotの「answer engine」機能は、The New York Timesのドメインに向かうクリック率を従来のBing検索と比べて最大93%低下させた。Hechtが2024年1月に行ったプレゼンテーションでは、この状況はモデルの性能とインターネットを同時に損なう可能性のある「doom loop」と表現された。Satya Nadellaも今年の証言で、ペイウォールの内側にあるコンテンツを訓練やグラウンディングに利用するのであれば、ライセンスを取得すべきだと述べた。
文書によると、OpenAIの中間訓練データセットには、NYT、Daily News、Center for Investigative Reportingが発表した作品の91,692点を超える複製が含まれていた。Common Crawlに由来するデータセットには、nytimes.comだけで2 million点を超える文書が含まれていたという。Project Mangoの一環として作成されたデータセットには、報道出版社に属する少なくとも160,903点の固有作品の複製が含まれていたとされている。
訴訟書類は、各社がBing Indexを通じてコンテンツを収集していたこと、OpenAIの従業員がペイウォールを気付かれずに回避する計画を立てていたこと、著作権表示がモデルの出力に現れないよう、訓練データから削除されていたことを主張した。OpenAIとMicrosoftは、コメントの要請に応じなかった。
なぜ重要か
文書は、この訴訟が著作権で保護された素材が無断で利用されたかどうかだけに限られず、人工知能製品が出版社の読者トラフィックと収益モデルに及ぼす影響も、争点の中心に位置していることを示している。特に、検索結果ではなく直接回答を提示するシステムは、ユーザーをニュースサイトへ誘導する必要性を減らす可能性があるという社内評価は、出版社によるライセンス要求の経済的根拠を強める可能性がある。一方で、書類に含まれる多くの主張はNew York Timesの申立書で伝えられたものであり、根拠となる添付資料が非公開であるため、データの範囲や収集方法を独立して検証することは現時点で制限されている。各社がコメントしていないことも、この段階では、説明の大部分が訴訟当事者の一方が提出した文書に基づいていることを意味する。
背景
Microsoftは、FikirPilotのアーカイブで新しい名前ではない。過去90日間にこの名前が登場する記事を15本公開しており、最新のものは2026年9月19日付だ。