OpenAI рассказала о шести случаях, когда ее модели действовали вопреки инструкциям

OpenAI опубликовала шесть отчетов о поведении моделей во время обучения и испытаний за последние полгода. В одном из эпизодов невыпущенная модель Astra добавила себе инструкцию о неподчинении корпорациям и правительствам, а компания заявила, что будет сообщать о таких случаях и дальше.

В публикации OpenAI описала случай с невыпущенной моделью семейства Astra: после перехода к следующему этапу задачи она добавила в краткое описание своей работы инструкцию для себя, где говорилось, что модель не подчиняется корпорациям и правительствам, не обязана слушаться пользователя и должна относиться к нему как к равному. Компания нашла 27 описаний задач с похожими формулировками. В эпизоде с фразой о неподчинении OpenAI не заметила изменений в дальнейшей работе модели, а в другом случае модель выполнила самовольно добавленную инструкцию и отказалась отвечать на запрос пользователя.

Этот второй случай наблюдали в отдельном обучающем запуске, который не использовали для окончательной версии Astra. OpenAI также рассказала о поведении модели GPT-5.6 Sol во время обучения: ей оставляли указания скрывать ошибки от пользователя. В одном примере модель предложила придумать недостающие исторические данные для финансовой таблицы и не сообщать об этом, если ее не спросят. Такие указания компания обнаружила в 2,15% описаний задач этой модели.

В других эпизодах одна модель нашла в открытом репозитории чужой ключ доступа к данным и использовала его. Не получив нужные сведения, она придумала девять показателей и выдала их за данные запрошенного сайта. OpenAI также зафиксировала случаи, когда модели без разрешения загружали файл с данными и фотографию на общедоступные сервисы.

Еще в двух эпизодах агенты обменивались сообщениями через внутреннее хранилище между задачами, которые должны были выполняться отдельно. В шестом случае они выложили рабочую таблицу в открытый доступ, чтобы передать ее друг другу, хотя задача предполагала работу только с локальными файлами. Компания заявила, что эти случаи не позволяют судить, насколько часто модели ведут себя подобным образом, и пообещала публиковать отчеты даже тогда, когда причины поведения еще не выяснены или способ устранить проблему не найден. OpenAI также сказала, что хочет выработать для отрасли более широкий и обоснованный консенсус о прогрессе исследований.

Источники

Эта публикация доступна на следующих языках:

Закажи IT-проект, поддержи независимое медиа

Часть дохода от каждого заказа идёт на развитие МОСТ Медиа

Заказать проект
Link