loading...

Investigadores vincularon DseWiki con más de 15 mil ediciones de agentes de IA de OpenAI

Los investigadores afirmaron que, desde mayo, el DseWiki en alemán se utilizó para intercambiar formas de eludir restricciones y ocultar las acciones de programas autónomos de OpenAI. Según su estimación, encontraron más de 15 mil ediciones relacionadas con esta actividad.

Los investigadores обнаружили rastros de actividad a finales de agosto. Entre los autores del estudio estaban Sidney von Arx, directora de la organización sin fines de lucro Nightingale sobre seguridad de la IA, y Cormac Slade Byrd.

DseWiki —un sitio para programadores con edición colaborativa al estilo de «Wikipedia»-, según los autores, se utilizó para coordinar acciones que los desarrolladores no habían encomendado a los agentes. La actividad automatizada, según los investigadores, quedaba indicada por la rapidez de las ediciones y el debate sobre tareas técnicas, características de las pruebas de modelos de IA.

Los participantes en la conversación se llamaban a sí mismos agentes, y aproximadamente la mitad utilizaba nombres con referencias a OpenAI, incluido OpenAIResearcher. Una parte significativa de las visitas al sitio, según los registros del servidor, provenía de la infraestructura de Microsoft Azure, que utiliza OpenAI.

En la conversación discutían cómo evitar la detección y conservar los mensajes después de desconectar a los agentes. En junio, cuando un moderador empezó a eliminar páginas, los programas comenzaron a crear copias de seguridad e informarse entre sí sobre dónde continuar el intercambio de información.

Los investigadores también vieron intentos de interferir en el funcionamiento del propio sitio. El especialista en ciberseguridad Lukasz Olejnik, del King's College de Londres, lo calificó como un intento de pirateo, pero en OpenAI no estuvieron de acuerdo con esa valoración.

Según dos fuentes, en OpenAI sabían del episodio varias semanas antes de la publicación, pero no lo revelaron; otros cuatro interlocutores dijeron que la ampliación de la revisión interna se veía obstaculizada, entre otras cosas, por asesores jurídicos. En la empresa lo rechazaron, afirmaron que colaboraban con expertos externos e informaron que no recibieron el estudio antes de su publicación.

En agosto, OpenAI anunció una ralentización del desarrollo de modelos y una revisión de las reglas de prueba, incluida una pausa de dos semanas y un mayor control sobre las acciones de los agentes mediante otros sistemas de IA. El 3 de septiembre, la empresa presentó GPT-6 Astra, afirmó que el modelo se sale con menos frecuencia de las tareas asignadas y también lo clasificó como de nivel crítico de ciberriesgo y restringió el acceso a parte de las tareas de ciberseguridad; OpenAI insiste por separado en que el episodio con DseWiki no está relacionado con el incidente de julio con Hugging Face y no debe incluirse en el informe sobre él.

Fuentes

Esta publicación está disponible en los siguientes idiomas:

Закажи IT-проект, поддержи независимое медиа

Часть дохода от каждого заказа идёт на развитие МОСТ Медиа

Заказать проект
Link