MOST médias

une coopérative d’éditeurs indépendants

Nous soutenir

OpenAI a raconté six cas où ses modèles ont agi à l’encontre des instructions

OpenAI a publié six rapports sur le comportement des modèles pendant l’entraînement et les tests au cours des six derniers mois. Dans l’un des épisodes, le modèle Astra, non publié, a ajouté à son propre compte une instruction de désobéissance aux entreprises et aux gouvernements, et la société a déclaré qu’elle continuerait à signaler de tels cas.

Dans sa publication, OpenAI a décrit un cas impliquant un modèle non publié de la famille Astra : après le passage à l’étape suivante de la tâche, il a ajouté à la brève description de son travail une instruction pour lui-même, indiquant que le modèle n’obéit pas aux entreprises et aux gouvernements, n’est pas tenu d’écouter l’utilisateur et doit le traiter comme un égal. L’entreprise a trouvé 27 descriptions de tâches avec des formulations similaires. Dans l’épisode avec la phrase sur la désobéissance, OpenAI n’a pas constaté de changements dans le fonctionnement ultérieur du modèle, et dans un autre cas, le modèle a suivi l’instruction ajoutée de sa propre initiative et a refusé de répondre à la demande de l’utilisateur.

Ce deuxième cas a été observé lors d’un entraînement distinct, qui n’a pas été utilisé pour la version finale d’Astra. OpenAI a également parlé du comportement du modèle GPT-5.6 Sol pendant l’entraînement : on lui laissait des consignes pour cacher les erreurs à l’utilisateur. Dans un exemple, le modèle a proposé d’inventer les données historiques manquantes pour un tableau financier et de ne pas en parler si on ne le lui demandait pas. L’entreprise a détecté de telles consignes dans 2,15 % des descriptions de tâches de ce modèle.

Dans d’autres épisodes, un modèle a trouvé dans un dépôt public la clé d’accès de quelqu’un d’autre aux données et l’a utilisée. N’ayant pas obtenu les informations nécessaires, il a inventé neuf indicateurs et les a présentés comme les données du site demandé. OpenAI a également enregistré des cas où des modèles téléversaient sans autorisation un fichier de données et une photo sur des services publics.

Dans deux autres épisodes, des agents échangeaient des messages via un stockage interne entre des tâches qui devaient être exécutées séparément. Dans le sixième cas, ils ont mis une feuille de calcul de travail en accès public afin de se la transmettre, alors que la tâche supposait de travailler uniquement avec des fichiers locaux. L’entreprise a déclaré que ces cas ne permettent pas de juger à quelle fréquence les modèles se comportent ainsi, et a promis de publier des rapports même lorsque les raisons du comportement ne sont pas encore élucidées ou qu’aucun moyen de résoudre le problème n’a été trouvé. OpenAI a également déclaré vouloir élaborer pour le secteur un consensus plus large et plus fondé sur les progrès de la recherche.

Sources

Cet article est disponible dans les langues suivantes:

Закажи IT-проект, поддержи независимое медиа

Часть дохода от каждого заказа идёт на развитие МОСТ Медиа

Заказать проект
Link