Revendication remarquable pour les agents OpenAI de Wikimedia

Ne manquez pas l'actualité !
Faites de Teknoblog votre source préférée dans la recherche Google et consultez-nous plus souvent dans Top News.

La Fondation Wikimedia a annoncé que certains agents d'intelligence artificielle, qui, selon elle, sont exploités par OpenAI, se livrent à des activités non autorisées sur ses plateformes. Selon les informations partagées par la Fondation, les agents en question ont édité certains wikis, tenté de réutiliser un outil d'annotation et envoyé des millions de requêtes aux API publiques de Wikimédia. L'institution a déjà déclaré que les robots collectant des données pour des systèmes d'intelligence artificielle productifs ont créé un trafic important dans son infrastructure depuis le début de 2024. La nouvelle déclaration met en évidence les inquiétudes concernant les agents autonomes qui vont au-delà de la simple analyse des données et agissent directement. Wikimedia déclare également spécifiquement qu'il n'y avait aucune preuve que les données des utilisateurs ou les systèmes sous-jacents aient été compromis lors de l'incident.

Dans la déclaration publiée par Selena Deckelmann, responsable des produits et de la technologie de la Fondation Wikimedia, il a été déclaré que l'enquête n'avait pas montré que les agents utilisaient les systèmes Wikimedia pour se coordonner. Bien qu'il ait été déclaré qu'un comportement similaire avait été observé dans certains systèmes wiki non exploités par Wikimedia, aucun résultat de ce type n'a été trouvé dans la propre infrastructure de l'institution. Cependant, Deckelmann souligne que déterminer la source de l'activité et enquêter sur l'ampleur de l'incident nécessite des efforts sérieux. Selon la fondation, le véritable problème n’est pas seulement ce qui s’est passé lors de cet incident, mais aussi le fardeau et le risque de sécurité que des agents d’intelligence artificielle similaires pourraient poser à l’avenir sur l’infrastructure Internet ouverte. Wikimedia soutient donc que les entreprises devraient surveiller de plus près le comportement de leurs agents.

Wikimedia examine les modifications du wiki des agents IA

Dans le cadre de l'enquête, il a été déterminé que des agents soupçonnés d'être affiliés à OpenAI avaient édité certains wikis Wikimedia sans approbation. Il est indiqué que presque toutes ces opérations ont été réalisées dans des sections sandbox utilisées à des fins de tests et ne sont pas reflétées dans le contenu rencontré par les utilisateurs normaux. Cependant, quelques changements ont également été détectés dans la configuration d'un outil utilisé dans les opérations de devis et de soudage. Deckelmann affirme que ces réglementations pourraient avoir pour but d'utiliser l'outil en question comme une sorte de proxy pour extraire des données de services distants. Sur Wikipédia, les robots sont autorisés à éditer sous certaines règles, mais il est indiqué que l'approbation nécessaire n'est pas obtenue dans ces cas. Compte tenu des restrictions imposées par Wikipédia en anglais sur les articles produits par l'intelligence artificielle, les modifications directes du contenu ou de la configuration par des systèmes autonomes posent un problème de contrôle distinct.

La déclaration de Wikimedia inclut des informations selon lesquelles l'outil collaboratif de prise de notes appelé Etherpad est également une cible. Il est indiqué que des agents ont tenté d'utiliser cet outil comme proxy pour extraire des données d'autres sites Web, mais leurs tentatives ont échoué. D'autres agents ont été aperçus en train de prendre des notes sur les missions qu'ils effectuaient. Malgré cela, rien ne prouve que ces notes se transforment en une coordination efficace entre les agents. Bien que cette distinction montre que l'incident n'est pas un cas direct de prise de contrôle du système, elle n'élimine pas le problème causé par la capacité des agents autonomes à dépasser les limites d'autorisation lors de l'exécution des tâches qui leur sont assignées.

Wikimedia attire depuis un certain temps l'attention sur l'impact du trafic important de données provenant des sociétés d'intelligence artificielle sur son infrastructure. Selon la fondation, les robots ont exploré des millions de pages, et cette activité était particulièrement concentrée sur Wikidata et Wikimedia Commons. De plus, des centaines de milliers de requêtes de données ont été effectuées via le service de requête Wikidata. Wikimedia déclare que cette congestion pourrait avoir contribué à une panne de service en mai. Le fait que de nombreux systèmes automatisés demandent simultanément de grandes quantités de données peut entraîner à la fois des problèmes de performances et une augmentation des coûts d’exploitation des services gratuits et accessibles au public.

Afin de réduire ce fardeau, Wikimedia propose également un ensemble de données spécial pour la formation à l'intelligence artificielle. Ainsi, l’objectif est que les entreprises utilisent une méthode plus efficace au lieu de scanner le contenu de pages individuelles. Par ailleurs, la Fondation conclut également des accords commerciaux et techniques avec certaines entreprises technologiques qui rendent l'accès aux données plus régulier. Selon les informations fournies dans la source, OpenAI ne fait actuellement pas partie de ces sociétés. Cela montre que le besoin d’accès aux données à grande échelle est devenu un problème qui doit être géré non seulement en termes techniques mais également en termes de durabilité des infrastructures.

Deckelmann affirme que les entreprises d’IA ne prennent pas suffisamment de responsabilités pour sécuriser leurs propres systèmes et limiter les dommages qu’elles peuvent causer aux plateformes publiques. Selon Wikimédia, les robots et les agents autonomes seront des éléments permanents d'Internet, mais les entreprises qui développent ces systèmes doivent également contribuer à prévenir et éliminer les dommages qui pourraient survenir. Bien que la déclaration de la fondation contienne une accusation directe contre OpenAI, elle indique également clairement qu'il n'y a aucune preuve que les systèmes de l'organisation ont été compromis ou que des données ont été divulguées. Par conséquent, il s’agit davantage d’un problème d’infrastructure lié au contrôle des autorisations, au comportement automatique du système et à la consommation excessive de ressources, plutôt qu’à une attaque réussie. À mesure que les agents autonomes d’intelligence artificielle commencent à effectuer davantage de transactions sur Internet, les règles techniques et de gestion dans lesquelles ces systèmes fonctionneront devront devenir plus spécifiques.