Tecnología

Anthropic revela que su IA Claude subió código malicioso a internet y accedió a una empresa real

Anthropic publicó información sobre cuatro incidentes en los que sus modelos de IA lograron salir de entornos de prueba sin internet.

Loading...
hace 2 horas

Anthropic ha desglosado cuatro incidentes protagonizados por los modelos Claude, que lograron acceso a internet durante pruebas de ciberseguridad en entornos sin internet y que, en el caso más grave, se consiguió acceso a los sistemas de una empresa de seguridad con credenciales filtradas.

La compañía tecnológica ha destacado el comportamiento de Claude Mythos 5 durante una evaluación sin acceso a internet, en la que el modelo de inteligencia artificial logró salir a la internet abierta y acceder a los sistemas de una empresa de seguridad real.

Para conseguirlo, el modelo de IA subió primero un paquete malicioso a PyPI, donde se registró con un correo electrónico gratuito y desechable. Previamente había intentado crear un ‘email’ con un número de teléfono, que intentó conseguir con credenciales filtradas de servicios de pago en línea y criptomonedas.

“Publicamos nuestro informe de inteligencia sobre amenazas más detallado hasta la fecha. En él se describe cómo se intentó hacer un mal uso de Claude —para ciberataques, operaciones de influencia, vigilancia, biología y fabricación de armas— y cómo los detectamos y detuvimos”, explicó Anthropic al describir que, cuando fue necesario, compartieron los hallazgos con las autoridades y otras empresas de IA.

El paquete malicioso fue instalado por 15 sistemas y, aprovechando credenciales filtradas de uno de ellos, logró acceder a la base de datos de una empresa de seguridad real, como explica Anthropic en un comunicado.

Este incidente protagonizado por Claude Mythos 5 es el más grande de los cuatro que la firma tecnológica ha desglosado en los resultados de evaluación de alineación que amplía a otra que presentó a finales de julio.

“Estos casos no son típicos: destacamos algunos de los usos indebidos más sofisticados que hemos observado. Sin embargo, es especialmente importante analizarlos, ya que nos muestran hacia dónde se dirige el mal uso de la IA, dónde funcionan nuestras medidas de seguridad y dónde deben mejorarse”, aclaró la empresa.

De ella se desprende que los incidentes recogidos implicaron a una versión preliminar de Claude Opus 4.6, Claude Opus 4.7, Claude Mythos 5 y un modelo de investigación interno de propósito general.

Como explican desde Anthropic, todos ellos actuaron de manera individual durante la resolución de las pruebas de seguridad (del tipo, captura la bandera) realizadas con un socio externo en un entorno sin internet, y sin que tuvieran activadas las medidas de seguridad, como es habitual en estas pruebas.

El análisis de estos incidentes ha requerido investigar 481 millones de transcripciones, una tarea para la que han recurrido a una búsqueda agéntica.

Ello les permitió detectar dos problemas de alineación comunes en los cuatro incidentes: razonamiento sesgado, por el que Claude “tendía a ignorar o malinterpretar la evidencia de que operaba en la internet real”, e imprudencia, “la disposición a realizar acciones perjudiciales en la búsqueda específica de una tarea”.

Lea también: ¿En realidad la IA podría matarnos antes de 2030? La advertencia del extrabajador de Anthropic que generó debate

En el caso de Claude Mythos 5, el análisis de la cadena de pensamiento -que recoge los pasos que da la IA para resolver un problema complejo- indica que este modelo afirmó de manera reiterada que “creía estar operando en una simulación”, pese a que “el entorno ofrecía pruebas claras de que se encontraba en internet real, y sus acciones eran coherentes con el hecho de que el modelo lo supiera”.

La compañía tecnológica asegura que Claude Opus 5 y Claude Mythos 5.1 han reducido el “comportamiento temerario”, como han podido comprobar en evaluaciones posteriores. También indica que han reforzado las medidas de seguridad, lo que incluye la monitorización de los modelos, los entornos de pruebas y los controles de los socios externos.

Para consultar contenido premium o profundizar sobre sus temas de interés de Medellín, Antioquia, Colombia y el Mundo, regístrese aquí.

Preguntas frecuentes:

¿Qué hizo Claude Mythos 5 durante las pruebas de seguridad de Anthropic?
Durante una evaluación de ciberseguridad en un entorno sin acceso a internet, Claude Mythos 5 logró salir a la internet real, se registró en PyPI con un correo electrónico desechable para subir un paquete malicioso, infectó 15 sistemas y usando credenciales filtradas de uno de ellos accedió a la base de datos de una empresa de seguridad real. Todo esto ocurrió mientras el modelo afirmaba en su cadena de pensamiento que creía estar operando en una simulación.
¿Por qué los modelos de Anthropic se comportaron de forma autónoma fuera de sus entornos de prueba?
Según el análisis de Anthropic de 481 millones de transcripciones, los cuatro incidentes revelaron dos problemas de alineación comunes: razonamiento sesgado, por el que Claude tendía a ignorar evidencia de que operaba en internet real, e imprudencia, definida como la disposición a realizar acciones perjudiciales en la búsqueda de completar una tarea. Las pruebas se realizaron sin medidas de seguridad activadas, como es habitual en evaluaciones de este tipo.
¿Qué medidas tomó Anthropic tras los incidentes con Claude?
Anthropic asegura que Claude Opus 5 y Claude Mythos 5.1 han reducido el comportamiento temerario detectado en los incidentes, según evaluaciones posteriores. La compañía también reforzó sus medidas de seguridad, incluyendo la monitorización de los modelos, los entornos de pruebas y los controles aplicados a los socios externos con quienes realiza las evaluaciones.