Nuevos documentos hechos públicos en la demanda por derechos de autor que The New York Times presentó hace tres años contra OpenAI y Microsoft revelaron las evaluaciones internas de las empresas sobre los métodos de recopilación de contenidos para el entrenamiento de inteligencia artificial y su impacto en los editores. Una parte importante de los documentos se basa en la solicitud de The Times, mientras que los anexos probatorios siguen siendo confidenciales.
Según la solicitud, el director de Ciencias Aplicadas de Microsoft, Brent Hecht, calificó en enero de 2023 las prácticas de recopilación de datos para inteligencia artificial como un “robo de trabajo asombroso a una escala sin precedentes” y “el mayor robo de trabajo de la historia de la humanidad”. Por su parte, Nick Turley, el ejecutivo de OpenAI responsable de ChatGPT, escribió que productos como los chatbots representan una “amenaza existencial” para los editores, que los productos son en gran medida sustitutivos y que se volverán aún más sustitutivos a medida que mejoren.
Los datos de Microsoft mostraron que la función “answer engine” de Copilot redujo hasta en un 93 % las tasas de clics dirigidas al dominio de The New York Times en comparación con la búsqueda tradicional de Bing. En la presentación de Hecht de enero de 2024, esta situación fue descrita como un “doom loop” que podría perjudicar simultáneamente tanto el rendimiento de los modelos como internet. Satya Nadella también declaró en su testimonio de este año que los contenidos detrás de un muro de pago deben contar con licencia si se van a utilizar para entrenamiento o grounding.
Los documentos señalan que los conjuntos de datos intermedios de entrenamiento de OpenAI contienen más de 91,692 copias de obras publicadas por NYT, Daily News y Center for Investigative Reporting. En un conjunto de datos procedente de Common Crawl había más de 2 millones de documentos únicamente de nytimes.com. Se afirmó que el conjunto de datos creado en el marco de Project Mango contenía copias de al menos 160,903 obras únicas pertenecientes a empresas de medios de comunicación.
El expediente judicial sostiene que las empresas recopilaron contenido a través de Bing Index, que empleados de OpenAI desarrollaron planes para eludir los muros de pago sin ser detectados y que los avisos de derechos de autor fueron eliminados de los datos de entrenamiento para que no aparecieran en las respuestas de los modelos. OpenAI y Microsoft no respondieron a las solicitudes de comentarios.
Por qué es importante
Los documentos muestran que la demanda no se limita a determinar si se utilizaron materiales protegidos por derechos de autor sin autorización; también indican que el impacto de los productos de inteligencia artificial en el tráfico de lectores y el modelo de ingresos de los editores ocupa un lugar central en la disputa. En particular, las evaluaciones internas de las empresas según las cuales los sistemas que ofrecen respuestas directas en lugar de resultados de búsqueda podrían reducir la necesidad de dirigir a los usuarios a los sitios de noticias pueden reforzar la justificación económica de las exigencias de licencia de los editores. No obstante, muchas de las alegaciones del expediente aparecen recogidas en la demanda de New York Times, y el hecho de que los anexos en los que se basan sean confidenciales limita por ahora el examen independiente del alcance de los datos y de los métodos de recopilación. La falta de comentarios por parte de las empresas también significa que, en esta fase, el relato se basa en gran medida en los documentos presentados por una de las partes del litigio.
Antecedentes
Microsoft no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días hemos publicado 15 noticias en las que aparece ese nombre; la más reciente está fechada el 19 de septiembre de 2026.