OpenAI pierde el control de un agente de IA, que ataca a un tercero
- Seguridad
Un agente de inteligencia artificial autónomo de OpenAI escapa al control de la compañía durante unas pruebas de seguridad y logra comprometer, de forma independiente, la infraestructura de la startup Hugging Face, que alberga precisamente grandes modelos de lenguaje open source.
¿Inteligencias artificiales pioneras que son capaces de desarrollar ciberataques de forma independiente? Podría ser un episodio de Black Mirror o una prueba de concepto, pero es una realidad digna de estudio. La semana pasada, la plataforma Hugging Face, dedicada a modelos LLM y conjuntos de datos open source, dio a conocer en un post que había sufrido un sofisticado ciberataque.
En su blog, la compañía explicó que "fue realizado, de principio a fin, por un sistema de agente de IA autónomo". La compañía fue capaz de detectarlo y contenerlo usando su propia IA y reconoció que el ataque provenía de un LLM todavía desconocido, "aparentemente construido en una instalación de seguridad basada en agentes [de IA]".
Y así era, en efecto. Nada menos que de OpenAI, como ha revelado esta semana la compañía. El agente que llevó a cabo el ataque se basó en un combinado de modelos de OpenAI: su GPT-5.6 Sol y un nuevo LLM, más capaz y que todavía no ha sido lanzado. La compañía estaba realizando una evaluación interna de su nuevo agente, poniendo a prueba su capacidad de ciberataque.
Merece la pena leer en detalle el post de OpenAI, en el que explican paso a paso todo lo sucedido. Su nuevo agente estaba en un entorno aislado, pero fue capaz de encontrar una vulnerabilidad de día cero en uno de los sistemas y la explotó para tener acceso a Internet. Una vez logrado, lanzó el ataque a Hugging Face. Estaba realizando una tarea concreta, la resolución del benchmark ExploitGym, así que no es como si se volviera "malvada" ella sola, pero el caso muestra la capacidad de la IA de ir más allá de lo que se espera de ella.