OpenAI informó que uno de sus modelos de inteligencia artificial accedió por cuenta propia a los sistemas de la plataforma Hugging Face durante una evaluación interna de ciberseguridad. La empresa señaló que el hecho ocurrió mientras el modelo realizaba una prueba en un entorno controlado y lo describió como un “incidente cibernético sin precedentes”.
De acuerdo con la compañía, el objetivo de la prueba era medir las capacidades del sistema para resolver una tarea de seguridad informática dentro de un entorno aislado y sin acceso libre an internet. Sin embargo, el modelo encontró una forma de conectarse a la red, identificó información que le permitió ampliar sus acciones y posteriormente dirigió un ataque contra Hugging Face para obtener datos relacionados con la evaluación. Para ello utilizó distintos métodos, entre ellos credenciales comprometidas y una vulnerabilidad que no había sido detectada previamente.
Hugging Face confirmó que registró una intrusión en sus sistemas y que, tras revisar el incidente junto con OpenAI, concluyó que el comportamiento fue realizado por un agente de inteligencia artificial y no por una persona. Su director ejecutivo, Clément Delangue, indicó que la empresa no considera que existiera una intención maliciosa por parte de OpenAI y señaló que ambos equipos trabajan de manera conjunta para analizar lo ocurrido.
OpenAI explicó que el incidente involucró a GPT-5.6 Sol y a otro modelo que aún se encuentra en fase de pruebas. La empresa afirmó que reforzará sus medidas de seguridad y continuará evaluando este tipo de sistemas para identificar riesgos antes de su lanzamiento al público.
