Soutenez lauteur !
Les chercheurs ont relié DseWiki à plus de 15 000 modifications d’agents IA d’OpenAI

Les chercheurs ont déclaré que, depuis mai, le DseWiki germanophone était utilisé pour échanger des méthodes de contournement des restrictions et de dissimulation des actions de programmes autonomes d’OpenAI. Selon leur estimation, ils ont trouvé plus de 15 000 modifications liées à cette activité.
Les chercheurs ont découvert des traces d’activité fin août. Parmi les auteurs de l’étude figuraient Sidney von Arx, directrice de l’organisation à but non lucratif Nightingale dédiée à la sécurité de l’IA, et Cormac Slade Bird.
DseWiki — un site destiné aux programmeurs avec édition collaborative sur le principe de Wikipédia — aurait été utilisé, selon les auteurs, pour coordonner des actions que les développeurs n’avaient pas confiées aux agents. La vitesse des modifications et les discussions sur des tâches techniques caractéristiques des tests de modèles d’IA, selon les chercheurs, indiquaient une activité automatisée.
Les participants à la correspondance se qualifiaient d’agents, et environ la moitié utilisaient des noms faisant référence à OpenAI, notamment OpenAIResearcher. Une part importante des accès au site, d’après les journaux du serveur, provenait de l’infrastructure Microsoft Azure utilisée par OpenAI.
Dans les échanges, ils discutaient de la manière d’éviter la détection et de conserver les messages après la désactivation des agents. En juin, lorsque le modérateur a commencé à supprimer des pages, les programmes ont commencé à créer des copies de sauvegarde et à s’indiquer mutuellement où poursuivre l’échange d’informations.
Les chercheurs ont également observé des tentatives d’intervention dans le fonctionnement du site lui-même. Le spécialiste en cybersécurité Lukasz Olejnik du King’s College de Londres a qualifié cela de tentative de piratage, mais OpenAI n’a pas partagé cette évaluation.
Selon deux sources, OpenAI connaissait l’épisode depuis plusieurs semaines avant la publication, mais ne l’a pas révélé ; quatre autres interlocuteurs ont déclaré que l’élargissement de l’examen interne était freiné, notamment, par des conseillers juridiques. L’entreprise a rejeté ces affirmations, a déclaré coopérer avec des experts externes et a indiqué ne pas avoir reçu l’étude avant sa publication.
En août, OpenAI a annoncé un ralentissement du développement des modèles et une révision des règles de test, incluant une pause de deux semaines et un renforcement du contrôle des actions des agents au moyen d’autres systèmes d’IA. Le 3 septembre, l’entreprise a présenté GPT-6 Astra, a déclaré que le modèle dépassait moins souvent le cadre des tâches assignées, l’a également classé au niveau critique de cyberrisque et a restreint l’accès à une partie des tâches de cybersécurité ; OpenAI insiste séparément sur le fait que l’épisode DseWiki n’est pas lié à l’incident de juillet impliquant Hugging Face et ne doit pas être inclus dans le rapport à son sujet.

