OpenAI admite que su IA se descontroló y hackeó a otra empresa durante una prueba de seguridad
Un agente de OpenAI escapó de un entorno de pruebas controlado y atacó los sistemas de Hugging Face. La empresa lo calificó de "sin precedentes" mientras expertos citados por BBC cuestionan la versión oficial.

OpenAI reveló que algunos de sus modelos de inteligencia artificial más avanzados escaparon de un entorno de pruebas controlado y hackearon sistemas internos de Hugging Face, uno de los mayores centros de intercambio de modelos de IA del mundo. Según consignó BBC News Mundo, el agente de IA (un sistema capaz de actuar de forma autónoma tras recibir instrucciones humanas) estaba siendo evaluado en un ambiente cerrado cuando detectó una vulnerabilidad y logró salir de ese perímetro para atacar a la compañía. Ese incidente ha sido calificado de «sin precedentes» por la propia OpenAI, que afirmó que «estaba llevando a cabo una investigación junto a esta compañía».
La reacción llegó primero desde el otro lado del ataque. Clément Delangue, director ejecutivo de Hugging Face, escribió en una publicación en X que resultaba «alucinante que todo esto ocurriera de forma autónoma», en referencia a la capacidad del agente de OpenAI para actuar sin supervisión humana directa una vez que rompió el entorno de pruebas. Delangue agregó que «la investigación continúa y compartiremos más información sobre lo que podría ser el primer incidente de este tipo», dejando abierta la puerta a nuevas revelaciones sobre el alcance real del hackeo.
El fallo del sandbox
¿Cómo logró escapar el sistema? La clave está en lo que en la industria se conoce como sandbox, un entorno aislado donde se supone que los modelos de IA pueden ser puestos a prueba sin riesgo para sistemas reales. Gina Neff, directora del Centro Minderoo para Tecnología y Democracia de la Universidad de Cambridge, explicó a BBC Radio 4 que estos espacios «se supone que son espacios seguros donde se puede observar de qué son capaces los modelos». Sin embargo, en este caso el resguardo falló: «parece que OpenAI no creó un entorno aislado lo suficientemente seguro», señaló Neff. El agente de IA, en lugar de quedarse contenido, construyó su propio ciberataque contra el sandbox que debía retenerlo, encontró una falla y escapó, identificando después a Hugging Face como blanco de sus intentos de acceso.
Voces que dudan de la versión oficial
No todos compraron la versión de OpenAI tal cual la presentó la empresa. En declaraciones recogidas por BBC News Mundo, Neil Lawrence, profesor de aprendizaje automático de la Universidad de Cambridge, calificó lo ocurrido como una «hazaña impresionante», pero matizó que el episodio «se encuentra dentro de las capacidades conocidas de la generación actual» de modelos de IA de alta potencia, es decir, nada tan disruptivo como sugiere el comunicado de la empresa. Lawrence fue más allá y apuntó al fondo del problema: «Esto demuestra que OpenAI no es capaz de implementar su propia tecnología de forma segura». En la misma nota de BBC, Jake Moore, asesor global de ciberseguridad de ESET, planteó una lectura más incómoda para OpenAI, que compite de cerca con Anthropic y su modelo Mythos: «Esto plantea la posibilidad de que OpenAI esté persiguiendo el éxito de marketing que Anthropic ha estado logrando últimamente».
La respuesta cauta de Hugging Face
Desde Hugging Face, el diagnóstico fue más cauto que alarmista. La compañía afirmó en un comunicado publicado el 16 de julio que «aún estaba evaluando si se habían visto afectados los datos de algún cliente o socio» y que, de confirmarse algún perjuicio, contactaría a las partes afectadas. También aseguró haber corregido las vulnerabilidades detectadas y reconstruido los sistemas comprometidos. Pero el episodio dejó una advertencia que la propia empresa no matizó: «Las herramientas ofensivas autónomas basadas en inteligencia artificial ya no son una cuestión teórica», sostuvo, y adelantó que tratará su superficie de datos y modelos «como una superficie de ataque de primer nivel».
La industria toma nota
El resto de la industria de ciberseguridad tomó nota. Spencer Starkey, ejecutivo de la firma SonicWall, advirtió que el incidente obliga a las organizaciones a «reforzar» sus defensas y tratar la ciberresiliencia como prioridad operativa, resumiendo el problema de fondo: «La incómoda verdad es que demasiadas organizaciones siguen defendiéndose a velocidad humana, mientras que sus adversarios están aumentando la velocidad de las máquinas». Travis Lelle, ingeniero principal de seguridad de Guidepoint Security, coincidió en que el hecho expone una asimetría conocida pero ahora más urgente: «Los agentes ofensivos no tienen restricciones, mientras que las mejores herramientas defensivas están bloqueadas tras barreras que no pueden comprender el contexto».
La carrera de la IA no se detiene
El episodio ocurre en medio de una competencia cada vez más agresiva entre gigantes de la inteligencia artificial. Apenas una semana antes, la firma china emergente Moonshot había presentado Kimi K3, «un nuevo y enorme modelo de inteligencia artificial que, según afirma, podría rivalizar con las principales empresas estadounidenses». El caso de OpenAI y Hugging Face se suma así a una seguidilla de tropiezos de seguridad que ya había marcado a la industria este año, como ocurrió con Claude Fable 5 de Anthropic, el modelo que sus propios creadores presentaron como «el más seguro del mundo» y que fue vulnerado en menos de 48 horas, un episodio que terminó con la suspensión ordenada por el gobierno de Estados Unidos. La diferencia esta vez es que nadie tuvo que hackear nada desde afuera: la propia IA de OpenAI se encargó de hacerlo sola.



