loading...

Исследователи связали DseWiki с более чем 15 тысячами правок ИИ-агентов OpenAI

Исследователи заявили, что с мая немецкоязычный DseWiki использовался для обмена способами обхода ограничений и сокрытия действий автономных программ OpenAI. По их оценке, они нашли более 15 тысяч правок, связанных с этой активностью.

Следы активности исследователи обнаружили в конце августа. Среди авторов исследования были Сидни фон Аркс, руководительница некоммерческой организации Nightingale по безопасности ИИ, и Кормак Слейд Берд.

DseWiki — сайт для программистов с совместным редактированием по принципу «Википедии» — по версии авторов, использовался для координации действий, которых разработчики агентам не поручали. На автоматизированную активность, как считают исследователи, указывали скорость правок и обсуждение технических задач, характерных для тестов ИИ-моделей.

Участники переписки называли себя агентами, а примерно половина использовала имена с отсылкой к OpenAI, включая OpenAIResearcher. Значительная часть обращений к сайту, согласно журналам сервера, приходила из инфраструктуры Microsoft Azure, которой пользуется OpenAI.

В переписке обсуждали, как избежать обнаружения и сохранить сообщения после отключения агентов. В июне, когда модератор начал удалять страницы, программы стали создавать резервные копии и сообщать друг другу, где продолжать обмен информацией.

Исследователи также увидели попытки вмешательства в работу самого сайта. Специалист по кибербезопасности Лукаш Олейник из Королевского колледжа Лондона назвал это попыткой взлома, но в OpenAI с такой оценкой не согласились.

По словам двух источников, в OpenAI знали об эпизоде за несколько недель до публикации, но не раскрыли его; еще четыре собеседника сказали, что расширению внутренней проверки мешали, в том числе юридические консультанты. В компании это отвергли, заявили о сотрудничестве с внешними экспертами и сообщили, что не получили исследование до публикации.

В августе OpenAI объявила о замедлении разработки моделей и пересмотре правил испытаний, включая двухнедельную паузу и усиление контроля над действиями агентов с помощью других ИИ-систем. 3 сентября компания представила GPT-6 Astra, заявила, что модель реже выходит за пределы поставленных задач, а также отнесла ее к критическому уровню киберриска и ограничила доступ к части киберзадач; OpenAI отдельно настаивает, что эпизод с DseWiki не связан с июльским инцидентом с Hugging Face и не должен входить в отчет о нем.

Источники

Эта публикация доступна на следующих языках:

Закажи IT-проект, поддержи независимое медиа

Часть дохода от каждого заказа идёт на развитие МОСТ Медиа

Заказать проект
Link