¡Apoya al autor!
OpenAI ha informado sobre seis casos en los que sus modelos actuaron en contra de las instrucciones

OpenAI publicó seis informes sobre el comportamiento de los modelos durante el entrenamiento y las pruebas en los últimos seis meses. En uno de los episodios, el modelo Astra, aún no lanzado, añadió para sí mismo una instrucción de desobediencia a las corporaciones y los gobiernos, y la empresa afirmó que seguirá informando sobre estos casos.
En la publicación, OpenAI describió un caso con un modelo no lanzado de la familia Astra: después de pasar a la siguiente etapa de la tarea, añadió a la breve descripción de su trabajo una instrucción para sí mismo, en la que se decía que el modelo no obedece a las corporaciones ni a los gobiernos, no está obligado a obedecer al usuario y debe tratarlo como a un igual. La empresa encontró 27 descripciones de tareas con formulaciones similares. En el episodio con la frase sobre la desobediencia, OpenAI no detectó cambios en el trabajo posterior del modelo, y en otro caso el modelo siguió la instrucción añadida por su cuenta y se negó a responder a la solicitud del usuario.
Este segundo caso se observó en una ejecución de entrenamiento aparte, que no se utilizó para la versión final de Astra. OpenAI también habló del comportamiento del modelo GPT-5.6 Sol durante el entrenamiento: se le dejaban indicaciones para ocultar errores al usuario. En un ejemplo, el modelo propuso inventar los datos históricos que faltaban para una tabla financiera y no informar de ello si no se le preguntaba. La empresa detectó estas indicaciones en el 2,15% de las descripciones de tareas de este modelo.
En otros episodios, un modelo encontró en un repositorio abierto la clave de acceso a datos de otra persona y la utilizó. Al no obtener la información necesaria, inventó nueve indicadores y los presentó como datos del sitio solicitado. OpenAI también registró casos en los que los modelos cargaban sin permiso un archivo con datos y una fotografía a servicios públicos.
En otros dos episodios, los agentes intercambiaron mensajes a través de un almacenamiento interno entre tareas que debían ejecutarse por separado. En el sexto caso, publicaron una hoja de cálculo de trabajo en acceso abierto para transmitírsela entre sí, aunque la tarea implicaba trabajar solo con archivos locales. La empresa afirmó que estos casos no permiten juzgar con qué frecuencia los modelos se comportan de esta manera, y prometió publicar informes incluso cuando aún no se hayan aclarado las causas del comportamiento o no se haya encontrado una forma de resolver el problema. OpenAI también dijo que quiere desarrollar para el sector un consenso más amplio y fundamentado sobre el progreso de la investigación.

