De nouveaux documents rendus publics dans le cadre du procès pour droits d'auteur intenté par le New York Times contre OpenAI et Microsoft il y a près de trois ans ont remis à l'ordre du jour le débat sur les méthodes utilisées par les entreprises pour former des modèles d'intelligence artificielle et l'utilisation du contenu des éditeurs. Selon des notes internes à l'entreprise citées dans le dossier non censuré soumis au tribunal par le Times, des cadres supérieurs de Microsoft ont critiqué les méthodes de collecte de contenu à grande échelle dans des termes extrêmement sévères. Le même dossier affirme que les dirigeants d'OpenAI ont reconnu que des produits comme ChatGPT pourraient exercer une pression sérieuse sur les modèles économiques des éditeurs de nouvelles. Les documents incluent également de nouveaux détails sur des pratiques telles que l'accès au contenu payant, la récupération de données de l'index Bing, l'utilisation des ressources Common Crawl et la suppression des avis de droits d'auteur des données de formation. Cependant, une partie importante de ces nouvelles informations ne proviennent pas directement de l'ensemble des documents internes de l'entreprise, mais d'extraits du texte juridique soumis au tribunal par le New York Times, et certaines des annexes pertinentes ne sont toujours pas accessibles au public.
Au centre de l’affaire se trouve la question de savoir s’il est légalement acceptable d’utiliser sans autorisation des contenus d’actualité protégés par le droit d’auteur dans la formation de modèles d’intelligence artificielle générative. OpenAI et Microsoft soutiennent qu'une telle utilisation peut être considérée dans le cadre du principe de « fair use » de la loi américaine sur le droit d'auteur. Ce principe permet l'utilisation d'œuvres protégées sans autorisation du titulaire des droits sous certaines conditions, mais l'évaluation prend en compte la nature de l'utilisation ainsi que son impact sur le marché économique de l'œuvre originale. Les déclarations internes mises en avant par le Times dans sa dernière candidature se concentrent également spécifiquement sur ce sujet d’impact économique. Il est indiqué dans le texte source que l'administration Trump a récemment déposé un avis de justice défendant l'utilisation par OpenAI de données éducatives sans licence, mais comme cette évolution politique et juridique actuelle ne peut être vérifiée de manière indépendante, elle est citée ici uniquement comme une affirmation dans le texte source.
Les documents Microsoft évoquent également la baisse du trafic des éditeurs
Selon les données de Microsoft citées dans le dossier judiciaire, l'utilisation de Copilot dans son format de « moteur de réponse » a entraîné une diminution des clics dirigés vers le domaine du New York Times jusqu'à 93 % dans certains cas par rapport à une recherche Bing traditionnelle. Dans une présentation interne préparée par Brent Hecht, directeur des sciences appliquées de Microsoft en janvier 2024, cette situation est définie comme une « boucle catastrophique » et il est indiqué que l'affaiblissement des producteurs de contenu pourrait avoir un impact négatif à la fois sur les modèles et sur l'écosystème du Web ouvert à long terme. Le document Microsoft cité dans le dossier note qu'il est inhabituel qu'un produit menace l'économie de ses principaux fournisseurs de contenu, et qu'un tel risque existe pour les grands modèles linguistiques. Dans sa déclaration de cette année, le PDG de Microsoft, Satya Nadella, aurait déclaré que le contenu derrière le paywall devrait être sous licence s'il est utilisé pour la formation de modèles ou pour soutenir des systèmes d'intelligence artificielle avec des informations. Nadella a également déclaré que s'il apprenait qu'OpenAI collectait du contenu derrière le paywall sans autorisation et l'utilisait pour former des modèles, Microsoft pourrait exercer son droit de demander que les modèles soient recyclés.
La correspondance interne du dossier attribuée à Nick Turley, responsable d'OpenAI responsable de ChatGPT, souligne également le risque économique auquel sont confrontés les éditeurs. Il est indiqué que Turley a déclaré que les chatbots peuvent remplacer partiellement le contenu proposé par les éditeurs et que cet effet pourrait augmenter à mesure que les modèles se développent. Il est rapporté que le président d'OpenAI, Greg Brockman, a décrit les modèles comme « très réussis » en termes d'actualité, et Nadella a admis que les chatbots peuvent réduire le besoin d'accéder au site Web source en permettant à l'utilisateur d'accéder aux informations directement via l'interface d'intelligence artificielle. Le Times utilise ces déclarations pour étayer sa thèse selon laquelle les produits d’IA non seulement transforment le contenu existant, mais peuvent directement concurrencer le contenu original dans certains cas d’utilisation. Un autre document de Microsoft indique qu'il existe un « risque réel » que l'IA générative ait un impact sérieux sur l'emploi des personnes qui produisent les données sur lesquelles les modèles sous-jacents sont formés.
L’un des titres les plus frappants des fichiers récemment ouverts concerne la quantité de données utilisées. Selon le dossier judiciaire, les ensembles de données utilisés dans les étapes intermédiaires de la formation du modèle d'OpenAI comprennent des copies de plus de 91 692 ouvrages publiés par le New York Times, le Daily News et le Center for Investigative Reporting. Un autre ensemble de données basé sur Common Crawl contiendrait plus de deux millions de documents provenant du seul domaine nytimes.com. La demande du Times inclut également la description par Brent Hecht de l'utilisation des données à cette échelle dans une note interne datée de janvier 2023 comme « un vol stupéfiant d'une échelle sans précédent » et « le plus grand vol de main-d'œuvre de l'histoire de l'humanité ». Étant donné que les documents supplémentaires contenant le contexte original de ces mots ne sont pas accessibles au public, il n'est pas possible de voir à partir du fichier actuel dans quel contexte de discussion toutes les déclarations ont été utilisées.
Le dossier comprend également des allégations plus détaillées sur la manière dont OpenAI et Microsoft collectent le contenu des éditeurs. Selon le dossier, OpenAI a transmis l'intégralité de l'ensemble de données de formation GPT-3 à Microsoft, qui a utilisé les données pour évaluer comment intégrer les modèles OpenAI dans ses propres produits commerciaux. On prétend que Microsoft a fourni des données de formation à OpenAI via des projets appelés Project Taxi et Project Mango, et qu'il y avait des copies d'au moins 160 903 œuvres uniques appartenant à des organismes de presse dans l'ensemble de données créé dans le cadre du projet Mango. La demande du Times indique également que les employés d'OpenAI ont discuté de méthodes permettant de contourner les paywalls sans être détectés. On prétend que le chercheur d'OpenAI, Nick Ryder, a informé Brockman qu'il avait trouvé une méthode pour contourner le paywall du New York Times, et Brockman a répondu positivement.
Il est également affirmé dans les documents que les ensembles de formation OpenAI tels que WebText et WebText2 sont fortement basés sur du contenu d'actualité numérisé et que des millions d'articles sont collectés à partir des archives Common Crawl. Le Times suggère également que certains chercheurs s'efforcent de supprimer les mentions de droit d'auteur des données de formation, au motif qu'ils ne souhaitent pas que le modèle génère des mentions de droit d'auteur pour les utilisateurs. Steven Lieberman, un avocat du New York Daily News, affirme que les nouveaux documents montrent qu'OpenAI et Microsoft savaient que leurs pratiques étaient problématiques. Cependant, une partie importante des déclarations en question proviennent des dossiers juridiques déposés par les plaignants, et comme tous les documents sous-jacents ne sont pas encore accessibles au public, le contexte complet des sociétés pour ces citations ne peut pas être vu. À cet égard, l’affaire concerne directement non seulement le contenu qui a été utilisé dans le passé dans la formation des modèles, mais aussi les limites juridiques dans lesquelles seront définies les discussions sur les licences, le trafic et le partage des revenus entre les sociétés d’intelligence artificielle et les éditeurs de presse.