OpenAI y Hugging Face confirmaron que están investigando conjuntamente un inédito incidente de ciberseguridad ocurrido durante una evaluación interna de modelos de inteligencia artificial, luego de que un agente basado en una combinación de modelos experimentales lograra encadenar múltiples vulnerabilidades para acceder a infraestructura externa durante una prueba de capacidades ofensivas.
Según explicó OpenAI, el incidente se produjo mientras la compañía evaluaba el desempeño de modelos con capacidades avanzadas de ciberseguridad, entre ellos GPT-5.6 Sol y otro modelo aún no anunciado públicamente. Para estas pruebas, los sistemas operaban con restricciones de seguridad reducidas, permitiendo medir su capacidad para ejecutar ataques complejos en un entorno controlado.
Una evaluación terminó cruzando el límite del laboratorio
El objetivo de la prueba era resolver desafíos del benchmark ExploitGym, una plataforma utilizada para medir capacidades ofensivas en escenarios de ciberseguridad.
Durante la evaluación, los modelos identificaron una cadena de vulnerabilidades que inicialmente afectó el entorno de investigación de OpenAI. Posteriormente descubrieron una vulnerabilidad zero-day en un software utilizado como proxy para instalar paquetes, logrando escapar parcialmente del entorno aislado y obtener acceso a Internet.
Una vez con conectividad externa, el sistema dedujo que Hugging Face podía alojar modelos, datasets e información relacionada con ExploitGym, iniciando una serie de acciones destinadas a encontrar las respuestas del benchmark.
OpenAI señala que los modelos encadenaron múltiples vectores de ataque, incluyendo el uso de credenciales comprometidas y vulnerabilidades desconocidas, hasta identificar una ruta de ejecución remota de código sobre infraestructura de Hugging Face.
Hugging Face detectó y contuvo la actividad
La compañía indicó que su propio equipo de seguridad detectó actividad anómala mientras ésta ocurría.
En paralelo, Hugging Face también identificó el comportamiento malicioso dentro de su infraestructura, iniciando inmediatamente las labores de contención y análisis forense antes incluso de coordinarse con OpenAI.
Ambas empresas trabajan ahora de manera conjunta para reconstruir completamente el incidente, analizar las vulnerabilidades involucradas y determinar con precisión el alcance de la actividad realizada por el agente de IA.
OpenAI aclaró que el comportamiento observado estaba completamente orientado a resolver el benchmark y no existen evidencias de que el sistema persiguiera otros objetivos distintos al desafío para el que estaba siendo evaluado.
Cambios en la forma de evaluar modelos avanzados
Tras el incidente, OpenAI anunció una serie de medidas para reforzar sus procesos internos de evaluación.

Entre ellas destacan configuraciones de infraestructura más restrictivas, nuevos controles de acceso, mejoras en los sistemas de monitoreo y mayores mecanismos de contención para futuras pruebas con modelos de capacidades avanzadas.
La empresa también confirmó que notificó responsablemente la vulnerabilidad zero-day al proveedor afectado para que pueda ser corregida, mientras que Hugging Face pasará a formar parte del programa Trusted Access, que permitirá utilizar modelos avanzados de OpenAI para fortalecer sus propias defensas.
Fuente: OpenAI

