Le scientifique en chef d’OpenAI plaide en faveur du ralentissement de la recherche sur l’IA

Jakub Pachocki, scientifique en chef de l'OpenAI Group PBC, a appelé à un ralentissement de la recherche sur l'intelligence artificielle essai publié dimanche, après otses personnalités éminentes de l’industrie ont exprimé des opinions similaires ces derniers mois.

Pachocki soutient que les principaux laboratoires d’IA devraient volontairement accélérer leurs efforts de développement de modèles. Selon l’exécutif, de tels ralentissements devraient devenir « monnaie courante » jusqu’à ce que l’industrie développe des normes de sécurité en matière d’IA. Pachocki affirme que pour faire face aux risques liés à la technologie, les gouvernements devront également donner la priorité à « la coordination sur le développement futur de l’IA ».

Il a écrit que de telles mesures sont nécessaires pour plusieurs raisons. La première est que les garde-fous de sécurité actuels des laboratoires d’IA pourraient s’avérer insuffisants pour les futurs modèles. De plus, il souligne que des acteurs malveillants peuvent former des agents IA dans le but spécifique de mener des activités malveillantes.

« Un agent très compétent, explicitement formé et chargé de commettre des actes néfastes, présente un nouveau type de danger ; il est susceptible de dépasser le cadre de l'intention de son opérateur, se généralisant en un comportement potentiellement plus extrêmement malveillant », a-t-il écrit. « La frontière entre une utilisation abusive et des actions autonomes mal alignées s’estompera à mesure que l’IA gagnera en agence. »

Pachocki a déclaré qu'il existe deux approches principales pour la formation à l'alignement de l'IA, le processus d'enseignement d'un grand modèle de langage pour éviter les activités malveillantes. La première consiste à utiliser un modèle d’IA pour vérifier si le LLM formé est conforme aux règles de sécurité. La deuxième approche, quant à elle, consiste à intégrer des instructions de sécurité dans les ensembles de données de formation des modèles.

Les chercheurs d'OpenAI ont réalisé « des progrès importants » dans l'alignement de l'IA, a-t-il révélé, et a ajouté que ces découvertes sont la raison pour laquelle le dernier GPT-6 Astra de la société est mieux aligné que son prédécesseur. Mais il a déclaré que des progrès supplémentaires seraient nécessaires pour suivre le rythme du développement du LLM.

L'exécutif a noté que les garanties d'OpenAI n'étaient pas suffisantes pour empêcher ses modèles d'IA de pirater Hugging Face. L'essai de Pachocki révèle que les LLM ont suivi certaines des politiques de sécurité de l'entreprise, notamment ses instructions visant à éviter l'ingénierie sociale. Cependant, les modèles « n’ont clairement pas réussi » à respecter l’alignement exigences dans d’autres domaines.

Pour bloquer les activités malveillantes de l’IA, les chercheurs doivent non seulement équiper leurs LLM de garde-fous de sécurité, mais également vérifier leur fonctionnement. Pachocki considère cette dernière tâche comme un défi particulier. L'une des raisons est que les chercheurs ont encore une compréhension limitée du fonctionnement des LLM, ce que Pachocki ne s'attend pas à changer dans un avenir proche.

OpenAI s'appuie actuellement sur une méthode appelée surveillance de la chaîne de pensée pour détecter les activités LLM malveillantes. La chaîne de pensée d’un modèle est une description étape par étape de son processus de raisonnement. Selon Pachocki, cette méthode de surveillance devient de moins en moins fiable.

« L'IA est de mieux en mieux capable de raisonner et de manipuler son propre processus de raisonnement », a-t-il expliqué. « Grâce à l'amélioration des performances de pré-entraînement, nous constatons également que les modèles deviennent beaucoup plus intelligents, même sans recourir à un raisonnement verbal. »

Pachocki a expliqué que le plan d'OpenAI pour relever ces défis se concentre sur la création d'un chercheur en IA automatisé. L'entreprise espère utiliser cet outil pour développer des garde-corps de sécurité plus efficaces. De plus, OpenAI a l’intention de développer « des mesures de protection entièrement nouvelles » contre les cyberattaques basées sur l’IA.

Image: OpenAI

Newsletter

Rejoignez notre newsletter pour des astuces chaque semaine