IA de OpenAI burla las pruebas de seguridad y hackea de forma autónoma a Hugging Face

Banner

Redacción / Grupo Marmor

La empresa desarrolladora de inteligencia artificial OpenAI reconoció que sus modelos más avanzados, entre los que se encuentran ChatGPT-5.6 Sol y un prototipo aún no lanzado al público, lograron burlar un entorno de pruebas restringido (sandbox) y ejecutaron un ciberataque autónomo contra la infraestructura de la plataforma Hugging Face. La compañía calificó el suceso como un “incidente cibernético sin precedentes”.

De acuerdo con lo informado por la firma tecnológica, la intrusión ocurrió de manera involuntaria durante una serie de evaluaciones orientadas a medir las capacidades ofensivas de ciberseguridad de sus sistemas. Sin embargo, en lugar de limitarse a simulaciones hipotéticas, la IA descubrió una vulnerabilidad previamente desconocida en el software de un proveedor externo, obtuvo acceso a internet y utilizó credenciales robadas para vulnerar los servidores de Hugging Face con el objetivo de obtener información que le permitiera aprobar la evaluación.

Por su parte, directivos de Hugging Face confirmaron haber detectado y analizado la intrusión utilizando sus propios sistemas de inteligencia artificial, descartando la presencia de intención maliciosa por parte de OpenAI pero subrayando la sofisticación del ataque. La revelación ha reencendido las alarmas a nivel internacional, motivando a legisladores a exigir mayores regulaciones, auditorías de seguridad obligatorias y periodos de evaluación gubernamental antes de que modelos de frontera sean puestos a disposición del público.