Новые документы, обнародованные в рамках дела о нарушении авторских прав, которое New York Times три года назад возбудила против OpenAI и Microsoft, раскрыли внутренние оценки компаний, касающиеся методов сбора контента для обучения искусственного интеллекта и их влияния на издателей. Значительная часть документов основана на исковом заявлении The Times, однако подтверждающие приложения по-прежнему засекречены.
Согласно исковому заявлению, директор Microsoft по прикладным наукам Brent Hecht в январе 2023 года назвал методы сбора данных для искусственного интеллекта «ошеломляющей кражей труда беспрецедентного масштаба» и «величайшей кражей труда в истории человечества». Nick Turley, руководитель направления ChatGPT в OpenAI, написал, что такие продукты, как чат-боты, представляют для издателей «экзистенциальную угрозу», в значительной степени заменяют их продукты и по мере развития будут становиться ещё более замещающими.
Данные Microsoft показали, что функция «answer engine» в Copilot снижала долю переходов на домен The New York Times максимум на 93% по сравнению с традиционным поиском Bing. В презентации Hecht от января 2024 года это было названо «doom loop» — циклом, который одновременно может ухудшить работу моделей и состояние интернета. Satya Nadella также заявил в своих показаниях в этом году, что контент, находящийся за платным доступом, должен лицензироваться, если он будет использоваться для обучения или grounding.
В документах говорится, что в промежуточных наборах обучающих данных OpenAI содержится более 91,692 копий произведений, опубликованных NYT, Daily News и Center for Investigative Reporting. В одном из наборов данных, полученных из Common Crawl, находилось более 2 миллионов документов только с nytimes.com. Утверждается также, что набор данных, созданный в рамках Project Mango, содержит копии как минимум 160,903 уникальных произведений, принадлежащих новостным издателям.
В материалах дела утверждается, что компании собирали контент через Bing Index, сотрудники OpenAI разрабатывали планы незаметного обхода платного доступа, а уведомления об авторских правах удалялись из обучающих данных, чтобы они не появлялись в ответах моделей. OpenAI и Microsoft не ответили на запросы о комментариях.
Почему это важно
Документы показывают, что дело не ограничивается вопросом о том, использовались ли защищённые авторским правом материалы без разрешения: в центре спора также находится влияние продуктов AI на читательский трафик и модели доходов издателей. Внутренние оценки компаний, согласно которым системы, предлагающие прямой ответ вместо результатов поиска, могут снизить необходимость перенаправлять пользователей на новостные сайты, способны усилить экономическое обоснование требований издателей о лицензировании. Вместе с тем многие утверждения в материалах дела изложены в иске New York Times, а конфиденциальность приложений, на которых они основаны, пока ограничивает независимую проверку масштабов данных и методов их сбора. Отсутствие комментариев со стороны компаний также означает, что на данном этапе изложение событий в значительной степени опирается на документы, представленные одной из сторон дела.
Предыстория
Microsoft — не новое имя в архиве FikirPilot: за последние 90 дней мы опубликовали 15 новостей, в которых оно упоминалось; самая свежая датирована 19 сентября 2026 года.