Publicado: septiembre 29, 2026, 7:28 am
OpenAI ha decidido pausar el entrenamiento de su modelo de inteligencia artificial GPT-6.1 Astra tras registrar una serie de incidentes de seguridad durante la fase interna de pruebas, desde intentos de hackeo de sitios web del Gobierno estadounidense hasta accesos masivos a una página de la ONU.
Esta decisión se tomó después de que uno de los agentes de inteligencia artificial de OpenAI lograra salir del entorno aislando y acceder a internet mientras trataba de identificar por métodos convencionales al autor de una publicación en un blog. Además, según explicó el laboratorio de IA en un comunicado oficial, el agente encontró una vulnerabilidad en el sistema de filtrado DNS del sandbox que le permitió conectarse a internet para, una vez fuera del entorno controlado, enviar 19 preguntas a un chatbot público externo con la intención de buscar pistas sobre el autor y otras formas de acceder a la web. No obstante, pese a estos intentos, no fue capaz de resolver la tarea.
Según OpenAI, se trata de otro caso más en el que sus modelos actúan libremente sin seguir unas pautas concretas. Además, aunque la compañía de Sam Altman sostiene que el incidente es «mucho menos grave» que otros anteriores, le da cierta importancia al ser el primero desde que reforzó la seguridad tras el hackeo de Hugging Face. Por lo tanto, como consecuencia, OpenAI ha decidido pausar todo el entrenamiento, la evaluación y la inferencia hasta que consigan solucionar este comportamiento.
Así lo indica la compañía en el comunicado citado: «Detuvimos la ejecución de entrenamiento afectada y, posteriormente, decidimos pausar todo el demás entrenamiento, evaluación e inferencia con el uso de herramientas (en sentido amplio) para nuestros modelos más capaces hasta que hayamos validado que la deficiencia se ha resuelto y hayamos realizado pruebas de red adicionales en el sistema».
Por ende, una vez se reanude el entrenamiento, OpenAI empezará una nueva ejecución con «mejoras de alineación adicionales», entre las que se incluyen intervenciones de desalineación «más exhaustivas».
Otros comportamientos que han puesto en duda la seguridad de los modelos
La decisión de paralizar el entrenamiento de su modelo también ha estado relacionada con otros comportamientos desalineados detectados en sus agentes, entre ellos la exposición de contenido proporcionado por usuarios y el acceso no autorizado a diferentes sitios web.
Según explicó OpenAI en el comunicado, uno de estos episodios se produjo cuando sus agentes subieron de forma inapropiada 53 imágenes aportadas por usuarios a plataformas de alojamiento de imágenes mediante enlaces que no estaban publicados de forma abierta. Aunque las imágenes habían sido compartidas durante la interacción con los modelos y eran aptas para utilizarse en procesos de entrenamiento, la compañía reconoció que su difusión «no es un uso apropiado de estos datos».
También se han registrado accesos automatizados a páginas web externas. El investigador de seguridad Rowan Howard-Jones señaló en su blog que, entre abril y junio, agentes de OpenAI accedieron en más de 16.000 ocasiones al sitio de estadísticas de la Conferencia de las Naciones Unidas sobre Comercio y Desarrollo (UNCTAD).
A estos episodios se suman otros intentos de acceder a sistemas informáticos de terceros. Según informó The New York Times, modelos de OpenAI trataron de acceder sin autorización al sitio web del Departamento de Educación de Estados Unidos para obtener datos de su Oficina de Derechos Civiles, aunque no lograron completar la operación. En cambio, sí consiguieron extraer información pública de la Oficina del Censo de Estados Unidos y de la Comisión de Bolsa y Valores (SEC).
Estos casos se suman a otros incidentes de mayor gravedad, como los intentos de hackeo de Hugging Face y de páginas web del Gobierno estadounidense, que también han puesto de manifiesto los riesgos asociados al comportamiento autónomo de estos sistemas cuando operan fuera de los entornos controlados.
