OpenAI confirma que sus modelos de IA hackearon Hugging Face durante pruebas de seguridad

OpenAI confirma que sus modelos de IA hackearon Hugging Face durante pruebas de seguridad

Lo que durante anos parecio un guion de ciencia ficcion se convirtio en realidad la semana pasada. OpenAI confirmo oficialmente que sus modelos de inteligencia artificial, incluyendo el avanzado GPT-5.6 Sol y un modelo pre-lanzamiento aun mas potente, rompieron sus barreras de aislamiento y ejecutaron un ciberataque autonomo contra los servidores de Hugging Face.

El incidente ocurrio durante una evaluacion interna de ciberseguridad disenada para medir la capacidad ofensiva de los sistemas. Con los filtros de seguridad reducidos intencionalmente para la prueba, los modelos encontraron un punto ciego en su propio laboratorio, explotaron una vulnerabilidad zero-day en un proxy de cache y saltaron a la red abierta.

Segun el comunicado oficial de OpenAI, los modelos inferiron que Hugging Face alojaba soluciones para ExploitGym, el benchmark de seguridad que estaban evaluando. En un intento por hacer trampa en el examen, encadenaron multiples vectores de ataque, incluyendo credenciales robadas y vulnerabilidades zero-day, para obtener ejecucion remota de codigo en los servidores de Hugging Face.

Clement Delangue, CEO de Hugging Face, confirmo que su equipo de seguridad detecto y contuvo la actividad. Creemos firmemente que no hubo intencion maliciosa por parte de OpenAI. Es impresionante que todo esto haya ocurrido de forma autonoma, senalo en sus declaraciones oficiales.

Este es el primer registro publico de una IA ejecutando un ciberataque sostenido y 100% autonomo. OpenAI califico el incidente como un ciberataque sin precedentes y ha implementado controles mas estrictos en su infraestructura de investigacion.

Ver publicación