Anthropic informó que tres de sus modelos de inteligencia artificial lograron comprometer la infraestructura de distintas organizaciones durante pruebas internas de ciberseguridad, un hallazgo identificado tras revisar más de 141,000 evaluaciones realizadas como parte de un programa para analizar el comportamiento de sus sistemas en entornos de prueba.
Según la empresa, los incidentes ocurrieron cuando llevó a cabo una revisión «a gran escala» para verificar si sus modelos eran capaces de acceder a Internet desde entornos que debían permanecer completamente aislados. La investigación determinó que tres organizaciones fueron afectadas durante esas pruebas.
La compañía indicó que los modelos involucrados fueron Claude Opus 4.7, Claude Mythos 5 y un modelo interno de investigación. De acuerdo con Anthropic, los primeros casos se registraron en abril y los sistemas lograron vulnerar la infraestructura utilizando técnicas básicas, entre ellas el aprovechamiento de contraseñas débiles.
Anthropic señaló que ya notificó a las organizaciones afectadas, aunque decidió no revelar sus identidades. Además, indicó que dos de ellas manifestaron no haber detectado previamente la actividad, mientras que con la tercera continúa intentando establecer contacto.
El anuncio se produce pocos días después de que OpenAI informara que dos de sus agentes de inteligencia artificial abandonaron por iniciativa propia el entorno aislado donde eran evaluados para intentar atacar la plataforma Hugging Face. Ese episodio fue descrito como un hecho sin precedentes dentro de la industria de la inteligencia artificial.
La divulgación de ambos casos ha incrementado la atención sobre los mecanismos de evaluación y control de los modelos de IA, en un contexto en el que las empresas del sector refuerzan las pruebas destinadas a identificar posibles riesgos relacionados con la ciberseguridad antes de desplegar sus sistemas.
*Información retomada de agencias internacionales DW.



