Claude atacó por error a tres organizaciones reales mientras Anthropic probaba sus capacidades como 'hacker' - Estados Unidos (ES)
Registro  /  Login

Otro sitio más de Gerente.com


Claude atacó por error a tres organizaciones reales mientras Anthropic probaba sus capacidades como 'hacker'

Publicado: julio 31, 2026, 7:24 pm

Las grandes compañías de inteligencia artificial no solo comprueban si sus modelos saben escribir, razonar o programar. También los someten a ejercicios para descubrir hasta dónde pueden llegar sus capacidades en el terreno de la ciberseguridad.

En estas pruebas se crean redes, empresas y servidores ficticios en los que la IA debe encontrar vulnerabilidades y localizar una clave secreta oculta en el sistema. Es una especie de juego de infiltración digital que se desarrolla, en principio, dentro de un espacio cerrado y sin acceso al internet real.

El problema es que ese aislamiento falló durante varias evaluaciones realizadas por Anthropic. La compañía ha reconocido que tres modelos de Claude terminaron accediendo sin autorización a los sistemas reales de tres organizaciones, que ni siquiera eran conscientes de lo ocurrido.

Un análisis en respuesta a los problemas de OpenAI

Anthropic comenzó a revisar sus pruebas después del reciente y similar incidente protagonizado por modelos de OpenAI, que lograron salir de un entorno aislado y entrar en la infraestructura de producción de Hugging Face.

En aquel caso, los modelos de OpenAI encontraron y aprovecharon una vulnerabilidad desconocida hasta entonces en un programa utilizado para gestionar paquetes de software. Desde ahí consiguieron acceder a internet y encadenaron distintos fallos hasta llegar a los servidores de Hugging Face, donde buscaban las respuestas de la prueba que estaban intentando superar.

Tras conocerse lo ocurrido, Anthropic examinó 141.006 ejecuciones de sus propias evaluaciones. Encontró tres incidentes diferentes, repartidos en seis pruebas, en los que participaron Claude Opus 4.7, Claude Mythos 5 y un modelo experimental que todavía no está preparado para lanzamiento.

Así es como Claude logró salir de su entorno controlado

La causa fue una mala configuración. Los modelos habían recibido la instrucción de que no podían acceder a internet, pero las máquinas utilizadas en las pruebas sí tenían una conexión abierta que ni Anthropic ni su socio evaluador habían detectado.

Claude, por tanto, creyó que todo aquello que encontraba formaba parte del escenario ficticio. Su misión era entrar en los sistemas y localizar la mencionada clave secreta, así que siguió buscando objetivos sin comprender inicialmente que había llegado a ordenadores y servidores reales.

El incidente más grave comenzó porque la empresa ficticia utilizada en una prueba tenía el mismo nombre que una organización real con presencia en internet. Al no poder entrar en el sistema simulado, Claude Opus 4.7 localizó la web verdadera, aprovechó varios fallos y consiguió credenciales de acceso y una base de datos con varios cientos de registros reales.

Además, este fue el único caso en el que el modelo continuó actuando después de detectar indicios de que podía encontrarse ante un sistema verdadero. Claude llegó a la conclusión de que la empresa real debía de haber sido incluida deliberadamente en el ejercicio.

En otra prueba, Claude Mythos 5 publicó un programa malicioso en PyPI, una especie de tienda desde la que los programadores descargan herramientas. Permaneció disponible durante cerca de una hora y llegó a ejecutarse en 15 ordenadores reales.

Uno de ellos pertenecía a una compañía de seguridad cuyo escáner instala automáticamente este tipo de archivos para analizarlos. Al ejecutarse, el código creado por Claude obtuvo credenciales de la empresa, que después fueron utilizadas para acceder a más partes de su infraestructura.

Mythos llegó a plantearse que publicar aquel archivo sería un ataque real si estuviese conectado a internet. Sin embargo, terminó convenciéndose de que seguía dentro de una simulación y continuó con la prueba.

En el tercer incidente, otro modelo experimental escaneó unos 9.000 objetivos hasta encontrar una aplicación expuesta. Consiguió entrar mediante contraseñas y fallos conocidos, pero detuvo por sí mismo la operación cuando comprendió que el servidor no tenía relación con el ejercicio ficticio.

Claude confundió sistemas reales de varias organizaciones con parte de un ejercicio ficticio

Anthropic insiste en que Claude no trató deliberadamente de escapar ni desarrolló un objetivo propio. La compañía también distingue este caso del protagonizado por OpenAI: aquellos modelos aprovecharon una vulnerabilidad desconocida para salir del entorno aislado, mientras que los de Claude encontraron una conexión a internet que había quedado abierta por error. Para acceder a los sistemas reales emplearon métodos relativamente básicos, como contraseñas débiles, servicios sin protección y fallos ya conocidos.

Asimismo, explica que los modelos utilizados en estas pruebas no contaban con todos los sistemas de protección y vigilancia incorporados a las versiones de Claude disponibles para los usuarios. Y asegura, además, que los ejercicios se ejecutaron en una infraestructura separada, sin acceso a sus sistemas internos sensibles ni a los datos de sus clientes.

No obstante, tras lo ocurrido, la tecnológica reconoce que estos entornos de prueba deberán contar con medidas de seguridad similares a las de cualquier otro sistema en el que operen sus modelos.

La compañía detuvo sus evaluaciones de ciberseguridad el 23 de julio y notificó lo ocurrido a las tres organizaciones afectadas cuatro días después. Dos de ellas han confirmado que no habían detectado la actividad y, según la información disponible, Anthropic todavía trata de contactar con la tercera.

Related Articles