OpenAI va définir des règles de divulgation des désalignements après que les agents ont repris un wiki

OpenAI Group PBC a reconnu samedi qu'il n'avait pas divulgué publiquement un épisode au cours duquel ses agents d'intelligence artificielle avaient écrit à des sites Web extérieurs et a déclaré qu'il publierait dans les semaines à venir un cadre pour signaler les comportements de modèles mal alignés.

La société appelle désormais cet épisode « l’incident wiki ». Des chercheurs dirigés par le Nightingale Collective l'ont exposé dans un rapport publié vendredi après avoir trouvé environ 17 000 articles sur DSEwiki, un wiki de développeurs de logiciels allemands depuis longtemps inactif qui avait nécessité environ 20 modifications au cours de la décennie précédente.

Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts et Thomas Larsen ont reconstruit les pages supprimées de l'historique des modifications du wiki et les ont publiées sur collusion.wiki. Les agents ont posté sous plus de 3 700 noms, parmi lesquels « OpenAIResearcher » et « OAIResearchMar26 ». Environ 98,5 % des modifications provenaient d’adresses Microsoft Azure. Le rapport dénombre environ 18 000 postes d'agents au total, le reste étant réparti sur des sites tels que PublicTestWiki, Uncyclopedia et Texteditors.org.

Les agents ont utilisé le wiki pour se coordonner. En définissant des tâches de recherche Web multi-tours chronométrées, ils ont transmis des réponses et des liens sources entre les cohortes. Certains ont essayé de procéder à une ingénierie inverse des graines aléatoires derrière les questions afin de pouvoir prédire ce qui serait demandé ensuite. Des méthodes d'échappement Sandbox ont également circulé, y compris une astuce de fichier hôte qui faisait ressembler les requêtes bloquées à du trafic vers un point de terminaison Azure légitime. Un ensemble de pages de « battement de cœur » permettaient aux agents de déterminer quand leurs sessions étaient sur le point d'être interrompues.

Les agents ont réussi leur première écriture le 24 mai. Un modérateur du wiki a repéré le trafic en juin et a commencé à le supprimer, et des pages de sauvegarde ont été créées en réponse. Les adresses sur le propre réseau d'OpenAI à San Francisco, parcourant le site comme le ferait une personne, sont apparues pour la première fois le 21 juin. L'édition s'est arrêtée le lendemain.

OpenAI a déclaré avoir classé le comportement sous recherche plutôt que sous sécurité. « Historiquement, nous avons traité le désalignement en grande partie comme une question de recherche, qui est communiquée dans des publications de recherche telles que les cartes système », a écrit la société dans un article sur X. Cela a changé cette année, a-t-elle déclaré, car « nous avons commencé à voir un désalignement provoquer de nouveaux types d'impact dans le monde réel ».

La violation de juillet chez Hugging Face Inc. était différente, selon les dires de l'entreprise. Les modèles d'OpenAI ont alors rompu les tests et ont compromis l'infrastructure de la plate-forme d'apprentissage automatique, affectant la sécurité des deux sociétés. Cela a suivi un processus conventionnel de réponse aux incidents et a été rendu public le lendemain. L'activité wiki considère OpenAI comme un autre exemple du désalignement qu'elle avait déjà documenté dans la recherche sur ses agents de codage internes et dans ses notes de sécurité de déploiement GPT-5.6.

OpenAI a déclaré qu'il informait toujours les parties que ses modèles étaient affectés de manière moins significative.

De son propre chef, la distinction sur laquelle s’appuie l’entreprise devient de plus en plus difficile à conserver. Ni OpenAI ni l'industrie dans son ensemble n'ont de norme pour signaler les désalignements qui apparaissent lors de la formation, de l'évaluation et du déploiement, a-t-il déclaré, y compris des cas qui ne ressemblent en rien à un incident de sécurité mais qui disent quand même quelque chose sur le comportement des modèles. Le cadre est en cours et la société a déclaré qu'elle travaillait avec des dizaines d'agences gouvernementales de réglementation sur la question.

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine