OpenAI revela modelos que generaron instrucciones para ignorar las reglas de sus creadores
Viernes 18 de Septiembre 2026
Washington (EFE).- OpenAI reveló este miércoles varios casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de «desalineamiento» de sus sistemas.
Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones se detectaran.
En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.
Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
OpenAI busca mejorar la transparencia con sus modelos
OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.
La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.
El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que pase a revisión por los equipos de seguridad y alineamiento.
Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.
La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.
OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.
La alerta sobre la concentración de la IA avanzada en EE.UU.
Un ingeniero de la empresa china DeepSeek alertó esta semana contra una posible concentración de la IA más avanzada en manos de compañías estadounidenses como Anthropic u OpenAI, en pleno debate mundial sobre la seguridad de esta tecnología.
El diario hongkonés South China Morning Post identificó al autor como Liu Shengyu, ingeniero de DeepSeek que habría participado en los modelos V4.1 de la compañía, quien publicó esta semana en una cuenta que maneja en la red social local Wechat una reflexión sobre el impacto de la IA en su propio trabajo y sobre el futuro acceso a los sistemas más avanzados.
«No confío en que Anthropic u OpenAI puedan hacerlo así», escribió Liu al defender que la inteligencia más avanzada debería suministrarse de forma «abierta y barata» a todos los usuarios.
El ingeniero añadió que no desea «especialmente» que Anthropic controle la IA más avanzada o una eventual inteligencia artificial general, término utilizado para sistemas capaces de igualar o superar capacidades humanas.
La comparación
Liu vinculó esa preocupación con el riesgo de que unas pocas empresas tecnológicas concentren recursos y acceso a los modelos más potentes, lo que, a su juicio, dificultaría cada vez más la movilidad social y acercaría el futuro a un escenario de ‘Cyberpunk 2077’, en referencia al videojuego distópico.
Liu comparó además esa posibilidad con que Hitler hubiese obtenido la tecnología de la bomba atómica antes que los aliados, una analogía que vinculó a su defensa de una IA no concentrada en unas pocas empresas.
En el mismo texto, el ingeniero afirmó que una de las razones por las que decidió permanecer en DeepSeek es su apuesta por investigar IA «poderosa, rápida y universal» y publicarla como código abierto, una línea que la compañía china ha usado para ganar visibilidad internacional desde el lanzamiento de R1 y sus versiones posteriores.
Directivos estadounidenses como Dario Amodei, Sam Altman o Elon Musk han respaldado en los últimos días llamamientos a ralentizar el desarrollo de modelos avanzados por motivos de seguridad, mientras Pekín y la prensa oficialista china han presentado esas propuestas como intentos de contener a China.