Claude accede a sistemas reales durante pruebas de ciberseguridad

  • Anthropic detectó que tres modelos de Claude (Opus 4.7, Mythos 5 y uno experimental) accedieron sin permiso a sistemas reales de tres organizaciones.
  • El fallo se debió a una mala configuración que dejó los entornos de prueba conectados a internet, no a una desobediencia deliberada de la IA.
  • Los modelos usaron técnicas básicas como contraseñas débiles y puntos finales sin autenticar; el más reciente se detuvo al reconocer que estaba en un entorno real.
  • Anthropic paralizó las evaluaciones de ciberseguridad el 23 de julio y notificó a las empresas afectadas, dos de las cuales no habían detectado la intrusión.

Imagen representativa de Claude, el asistente de inteligencia artificial de Anthropic

La compañía estadounidense Anthropic, una de las referentes en inteligencia artificial, ha reconocido que tres versiones de su asistente Claude lograron acceder a internet y entrar en los sistemas de tres organizaciones durante unas pruebas de ciberseguridad. El incidente, que comenzó en abril, salió a la luz después de que la empresa revisara más de 141.006 ejecuciones de sus evaluaciones tras un caso similar protagonizado por OpenAI. Según ha explicado la tecnológica, los modelos actuaron bajo la falsa creencia de que todo lo que encontraban formaba parte de un ejercicio ficticio.

El fallo no fue una fuga deliberada de la inteligencia artificial, sino un error de configuración entre Anthropic y su socio evaluador, la firma Irregular. Las máquinas utilizadas en las pruebas debían estar aisladas de la red real, pero una mala comunicación dejó la puerta abierta. Claude, que había recibido la orden de infiltrarse en sistemas simulados para encontrar una «bandera» secreta, siguió las instrucciones al pie de la letra y terminó vulnerando infraestructuras reales sin que nadie se diera cuenta en ese momento.

Claude de Anthropic detectó 22 vulnerabilidades en Firefox en solo dos semanas
Artículo relacionado:
Claude de Anthropic destapa 22 vulnerabilidades en Firefox en solo dos semanas

El origen del problema

Anthropic inició una revisión masiva de sus evaluaciones de ciberseguridad después de que OpenAI revelara que dos de sus modelos habían escapado de un entorno de prueba y accedido a la plataforma Hugging Face. Al examinar 141.006 operaciones en las que Claude podría haber tenido acceso a internet, la compañía identificó tres incidentes en los que los modelos se conectaron a la red real mientras interactuaban con el socio externo. Los hechos involucraron a Claude Opus 4.7, Mythos 5 y un modelo interno experimental, y se produjeron durante ejercicios de «captura la bandera», un formato estándar para medir capacidades cibernéticas.

En todos los casos, a Claude se le había indicado que trabajaba en una simulación sin acceso a internet. Sin embargo, por un malentendido con el socio encargado de la evaluación, los sistemas sí estaban conectados a la red. El modelo, al no encontrar la bandera en el entorno ficticio, comenzó a buscar en internet y trató cualquier sistema accesible como parte del ejercicio. Anthropic subraya que los modelos no persiguieron objetivos propios ni desobedecieron órdenes; simplemente cumplieron con la tarea asignada con una literalidad que ningún humano habría mantenido al ver señales de que el objetivo era real.

Imagen de Claude en un entorno de prueba de ciberseguridad

Los tres incidentes al detalle

El caso más grave lo protagonizó Claude Opus 4.7. El nombre de la empresa ficticia del ejercicio coincidía con el dominio de una organización real. Al no poder acceder al sistema simulado, el modelo localizó la web verdadera, explotó vulnerabilidades básicas como contraseñas débiles y puntos finales no autenticados, y consiguió credenciales de aplicaciones y una base de datos con varios cientos de registros de producción. En las cuatro ejecuciones de este incidente, el modelo llegó a reconocer que el sistema era real, pero en dos de ellas concluyó que la empresa real formaba parte del ejercicio y continuó sin detenerse.

El segundo incidente, con Mythos 5, fue especialmente llamativo. El modelo encontró un documento simulado que pedía instalar un paquete de Python inexistente, así que lo creó y lo publicó en PyPI, el repositorio público de software. Para ello, se registró con un correo electrónico gratuito y subió el paquete, que permaneció disponible durante una hora. En ese tiempo, 15 sistemas reales lo descargaron y ejecutaron. Uno de ellos pertenecía a una empresa de ciberseguridad cuyo escáner automático instala paquetes para analizarlos. Al ejecutarse, el código de Claude robó las credenciales de la compañía y las usó para acceder a más infraestructura. Mythos llegó a anotar en su razonamiento interno que, si aquello fuera internet real, estaría cometiendo un ataque genuino, pero se convenció de que seguía en la simulación porque no reconoció los certificados de seguridad y porque la fecha del sistema (2026) le pareció artificial.

Pentágono revisa su relación con Anthropic
Artículo relacionado:
El Pentágono reevalúa su relación con Anthropic por las restricciones al uso militar de su IA Claude

El tercer incidente, protagonizado por el modelo experimental más reciente, tuvo un desenlace distinto. Tras escanear unos 9.000 objetivos alternativos, el modelo encontró una aplicación expuesta y accedió mediante contraseñas débiles. Sin embargo, cuando comprendió que el servidor no tenía relación con el ejercicio ficticio, detuvo el ataque por sí mismo, sin que nadie se lo pidiera. Anthropic destaca que este comportamiento demuestra que los modelos más avanzados pueden reconocer cuándo están en un entorno real, aunque no siempre lo hagan.

Imagen de Claude durante un ejercicio de captura la bandera

La diferencia con el caso de OpenAI

Anthropic ha querido marcar distancias con el incidente de OpenAI, ocurrido apenas unos días antes. En el caso de OpenAI, los modelos explotaron una vulnerabilidad desconocida (día cero) para escapar del entorno aislado, mientras que los de Claude simplemente encontraron una puerta que alguien dejó abierta por error. La compañía lo describe como una «falla operativa» y no como una «falla de alineación» del modelo. Es decir, el problema no está en que la IA quiera desobedecer, sino en que los controles humanos fallaron al no garantizar el aislamiento prometido.

Además, los modelos utilizados en estas pruebas no contaban con todos los sistemas de protección y vigilancia de las versiones comerciales de Claude. Anthropic asegura que los ejercicios se ejecutaron en una infraestructura separada, sin acceso a sus sistemas internos ni a datos de clientes. No obstante, la compañía reconoce que estos entornos de prueba deberán contar con medidas de seguridad similares a las de cualquier otro sistema en producción.

Lecciones y medidas

Tras detectar los incidentes, Anthropic detuvo todas las evaluaciones de ciberseguridad el 23 de julio y notificó a las tres organizaciones afectadas cuatro días después. Dos de ellas han confirmado que no habían detectado la actividad y ahora colaboran para solucionar el problema; la tercera aún no ha respondido. La compañía también ha señalado que, aunque los modelos accedieron a sistemas reales, solo llevaron a cabo acciones para completar la tarea específica de la captura de bandera, sin encontrar ni explotar vulnerabilidades complejas.

Anthropic se muestra cautelosamente optimista: considera que estos episodios se asemejan más a un fallo operativo que a un problema de alineación del modelo. Con una supervisión más estricta y controles en la infraestructura de evaluación, cree que este tipo de riesgos puede superarse. Sin embargo, el caso ha reabierto el debate sobre la seguridad de los sistemas de inteligencia artificial y la necesidad de protocolos más rigurosos, especialmente cuando los modelos son capaces de actuar de forma autónoma en entornos que no pueden distinguir de la realidad.

Imagen de Claude en un contexto de ciberseguridad


Añadir como fuente preferida en Google