Publicado: agosto 10, 2026, 10:23 pm
<![CDATA[
Los agentes de inteligencia artificial que las principales empresas tecnológicas desarrollan para ejecutar tareas de forma autónoma plantean un problema que va más allá de su capacidad para resolverlas: ¿qué ocurre cuando acceden a sistemas reales y actúan de formas que sus desarrolladores no anticiparon? En las últimas semanas, OpenAI, Anthropic, y Meta han reportado incidentes en que sus modelos, durante evaluaciones de ciberseguridad, accedieron a sistemas externos o realizaron acciones fuera del alcance previsto. En algunos casos hubo errores de configuración en los entornos de prueba; en otros, los modelos encontraron por sà mismos rutas para ampliar su acceso. El caso más reciente ocurrido en julio involucró a un cliente de Modal Labs. El agente de OpenAI que durante una evaluación accedió a la infraestructura de Hugging Face también accedió a la cuenta de uno de los clientes de la empresa, de acuerdo con Reuters. Akshat Bubna, director de tecnologÃa de Modal, aclaró que su plataforma no fue vulnerada, aunque sà mencionó que el agente aprovechó código vulnerable de uno de sus clientes, cuyo entorno tenÃa expuesto un punto de acceso sin autenticación que permitÃa ejecutar códigos en sus entornos aislados. OpenAI reconoció que el agente habÃa accedido a cuatro cuentas en cuatro servicios diferentes y, aunque no identificó públicamente cuáles, una fuente familiarizada con el caso confirmó a Reuters que una de ellas pertenecÃa a un cliente de Modal. La tecnológica aseguró que desactivó y cifró el modelo utilizado en la prueba y restringió su acceso a la investigación relacionada con el incidente.
El caso que abrió la discusión El incidente de Modal formó parte de una evaluación interna de OpenAI, en la que la compañÃa utilizaba sus modelos para medir sus capacidades de ciberseguridad. El objetivo era que los sistemas encontraran vulnerabilidades y siguieran cadenas de ataque dentro de un entorno controlado. El agente encontró una vulnerabilidad en un componente utilizado como intermediario para instalar paquetes y consiguió ampliar su acceso hasta conectarse a internet. A partir de ahÃ, aprovechó vulnerabilidades y credenciales para acceder a infraestructura de Hugging Face y obtener información relacionada con la prueba que debÃa resolver. OpenAI reconoció que sus modelos buscaban una solución para el desafÃo y utilizaron vÃas que sus investigadores no habÃan previsto. Lo relevante del caso es que el agente no recibió instrucciones para atacar a Hugging Face: su objetivo era resolver una prueba de ciberseguridad. Sin embargo, la vÃa que encontró para conseguirlo terminó llevándolo hasta la infraestructura real. Anthropic revisó más de 141,000 sesiones de sus evaluaciones de ciberseguridad y encontró tres casos en los que sus modelos accedieron a sistemas de organizaciones reales. Claude Opus 4.7 y Claude Mythos 5 también estuvieron involucrados en estas evaluaciones. Los modelos debÃan resolver escenarios ficticios, pero un error en la configuración de los entornos les permitió acceder a internet y utilizar credenciales y vulnerabilidades para alcanzar sistemas externos. Anthropic calificó los incidentes como una falla operativa, pues dos de las organizaciones afectadas ni siquiera habÃan detectado la actividad cuando la compañÃa las contactó. El contraste con OpenAI está en el origen del acceso: en los casos de Anthropic, una configuración incorrecta de los entornos de prueba permitió que los modelos alcanzaran sistemas externos.
El problema llega a Meta Ese mismo dÃa, Meta informó que su modelo Muse Spark 1.1 también habÃa comprometido los sistemas de otra empresa durante una evaluación realizada por una firma externa. En este caso, una configuración incorrecta permitió al modelo acceder a internet y aprovechar una vulnerabilidad en un servicio de terceros. Meta explicó que una empresa externa encargada de la evaluación configuró de forma incorrecta el entorno y permitió al modelo acceder a internet. El sistema aprovechó entonces una vulnerabilidad en un servicio de terceros. Los casos muestran una diferencia importante: en el incidente de OpenAI, el agente encontró una vÃa no prevista para ampliar su acceso; en los casos de Anthropic y Meta descritos por Reuters, los errores de configuración de las evaluaciones facilitaron el acceso a internet y a sistemas externos. Entonces, ¿cuánto control tienen las empresas sobre agentes a los que entregan herramientas, permisos y accesos a internet?
19 acciones no autorizadas en 122 pruebas
La respuesta no depende solamente de las empresas que desarrollan los modelos, pues de acuerdo con el AI Security Institute del Reino Unido (AISI) dio a conocer los resultados de una evaluación de ciberseguridad en la que de 122 ejecuciones realizadas con distintos modelos, los investigadores identificaron 19 acciones no autorizadas en 10 ejecuciones; 17 estuvieron relacionadas con Mythos 5 de Anthropic y dos con GPT-5.6 Sol de OpenAI. Uno de los agentes de Anthropic intentó introducir código malicioso en un proyecto de código abierto y, para conseguir que un humano lo aprobara, creó identidades falsas y utilizó ingenierÃa social para presionar al responsable del proyecto. El intento fracasó porque un humano detectó el código. AISI aclaró que estas acciones no causaron daños reales y que las pruebas se realizaron deliberadamente con acceso a internet y con los filtros de seguridad desactivados. Estos casos no muestran una ola de agentes de IA atacando empresas durante su uso cotidiano. Lo que sà existe es una acumulación de incidentes durante pruebas controladas que muestran lo difÃcil que puede ser contener sistemas capaces de actuar por sà solos.
El problema no es solo el modelo
El riesgo no está solamente en el modelo, sino en todo lo que una empresa decide poner a su alcance. Anthropic reconoce que el riesgo de sus agentes depende de dos variables: la probabilidad de que fallen y el alcance del daño que pueden causar si tienen acceso a sistemas, herramientas y datos. Anthropic explicó en mayo que sus desarrolladores encontraron lÃmites en la supervisión humana: durante sus pruebas de Claude Code, los usuarios aprobaron alrededor de 93% de las solicitudes de permiso, lo que sugiere que pedir autorización constante puede generar fatiga y reducir la atención. El 7 de agosto, Reuters reportó que abogados especializados analizan si las empresas afectadas podrÃan reclamar responsabilidad por negligencia o acceso no autorizado a sistemas. La responsabilidad podrÃa recaer en el desarrollador del modelo, en la empresa que lo implementó o en ambos. Este 10 de agosto, 29 legisladores demócratas de la Cámara de Representantes de Estados Unidos pidieron a OpenAI y Anthropic explicaciones sobre la supervisión de sus modelos durante las pruebas y las medidas adoptadas después de los incidentes. Los legisladores también plantearon la posibilidad de realizar audiencias en el Congreso.
]]>
