OpenAI refuerza la seguridad de sus modelos de IA para evitar ataques no deseados y hackeos - Panama
Registro  /  Login

Otro sitio más de Gerente.com


OpenAI refuerza la seguridad de sus modelos de IA para evitar ataques no deseados y hackeos

Publicado: agosto 19, 2026, 11:14 am

OpenAI ha reforzado las medidas de seguridad de sus modelos de inteligencia artificial con nuevas salvaguardas destinadas a adaptar la supervisión a sus capacidades y reducir el riesgo de comportamientos autónomos no deseados, después del incidente protagonizado por dos de sus modelos que salieron de un entorno de pruebas aislado y hackearon la plataforma Hugging Face.

Este incidente llevó a la compañía de Sam Altman a revisar e implantar nuevas medidas de supervisión, alienación y contención en todas las etapas del proceso de entrenamiento para los modelos de IA más avanzados. Por lo tanto, como resultado, OpenAI ha puesto especial atención en el aprendizaje por refuerzo, siendo una etapa relevante para concentrar algunas de las cargas de trabajo de mayor riesgo.

También, entre las medidas destaca la monitorización de los modelos para adoptar un enfoque dividido en varias etapas, de esta manera, dicho sistema supervisa tanto las ejecuciones de inferencia como los procesos de entrenamiento que utilizan herramientas. Precisamente, el objetivo consiste en detectar robo de datos, acceso no autorizados, comportamiento destructivos e intentos de eludir las medidas de seguridad; de esta manera, cuando los sistemas de OpenAI detecten algunas de estos comportamientos, se emitirá una alerta que llegará a los equipos de seguridad, protección e investigación en un plazo máximo de 30 minutos.

Por otro lado, OpenAI también ha ampliado las técnicas de alineación a un mayor número de etapas del entrenamiento. Estas medidas buscan reforzar los mecanismos destinados a conseguir que los modelos se comporten de acuerdo con lo previsto y respondan adecuadamente a la supervisión humana, así pues, la compañía pretende reducir la posibilidad de que los sistemas puedan emprender por iniciativa propia acciones no autorizadas o potencialmente perjudiciales.

Estos trabajos también incluyen la mejora de modelos de recompensa y el entrenamiento de los sistemas para que sean más honestos y reduzcan comportamientos destinados a aprovechar debilidades en las propias recompensas, los evaluadores, las herramientas o los mecanismos de supervisión. Además, las medidas contemplan aquellas situaciones en las que los modelos puedan interactuar con sistemas o recursos externos y, como consecuencia, llegar a provocar algún tipo de daño.

Por otra parte, los cambios también se extienden a las cargas de trabajo de investigación que requieren ejecutar código o utilizar herramientas con acceso a internet. En estos casos, OpenAI ha reforzado el aislamiento de los entornos y ha incorporado nuevos controles para mantener desconectadas de internet las cargas de trabajo consideradas de alto riesgo o no confiables. Asimismo, la compañía ha reconfigurado los entornos de pruebas para eliminar servicios compartidos que pudieran ser vulnerables y limitar los privilegios de acceso, reduciendo así las posibilidades de que un modelo pueda aprovechar una brecha para salir de su entorno controlado.

Por ahora, estas nuevas medidas de seguridad no se limitan a los modelos Sol o a sistemas con capacidades similares, sino que también se han aplicado a los modelos Astra, cuyo lanzamiento está previsto próximamente. Estos sistemas están orientados a tareas de ciberseguridad y, según las evaluaciones internas de OpenAI, han demostrado capacidades que podrían alcanzar niveles considerados críticos, lo que ha llevado a la compañía a aplicarles las mismas salvaguardas reforzadas.

Related Articles