(https://i.postimg.cc/4NcfJybR/AI.png) (https://postimages.org/)
Un grupo de investigadores de seguridad de Hacktron logró comprometer una cuenta interna de ChatGPT de OpenAI y acceder a código interno de la empresa alojado en GitHub.
Según el *Wall Street Journal*, que informó inicialmente sobre el incidente, los investigadores llevaron a cabo el ataque utilizando una «versión especial» de Claude, de Anthropic, puesta a disposición de «profesionales cualificados de ciberseguridad».
Inicialmente, los investigadores intentaron utilizar Claude Opus 4.8 para provocar una brecha de seguridad, pero se enfrentaron a múltiples dificultades, ya que al modelo le costó «varias sesiones generar un *exploit* funcional». Sin embargo, el lanzamiento de Opus 5 lo cambió todo.
La brecha de seguridad en OpenAI forma parte de una explotación más amplia de libheif
El incidente comenzó con una explotación de libheif que aprovecha una vulnerabilidad en el decodificador y codificador de los formatos de archivo de imagen .heic, .heif y .avif. Si bien esta vulnerabilidad permitió a Hacktron comprometer a OpenAI, libheif también se utiliza en otras plataformas y programas, como Slack, Meta, GitHub Enterprise y Ruby on Rails, entre otros.
Para empezar, los investigadores observaron que el foro de la comunidad de OpenAI utiliza la plataforma Discourse, la cual, a su vez, emplea FastImage para la verificación de imágenes. Sin embargo, dado que FastImage no admite archivos de imagen .heif, estos se transfieren a ImageMagick para su conversión.
Desarrollar un exploit funcional de ejecución de código que aprovechara esta relación entre ImageMagick y libheif con Opus 4.8 «no dio resultados», señalaron los investigadores; sin embargo, ese mismo día Anthropic lanzó Claude Opus 5.
Con Opus 5, los investigadores lograron crear un exploit funcional de ejecución remota de código (RCE) —basado en la misma premisa— al configurar un agente de IA en un bucle para atacar una instancia local de Discourse Cloud.
El *exploit* funcional para Discourse se utilizó posteriormente contra los foros de la comunidad de OpenAI, donde los investigadores tomaron el control de la cuenta de ChatGPT de un empleado de la empresa. Dicho empleado había vinculado su instancia de ChatGPT Codex con el repositorio de GitHub de la compañía, lo que otorgó a los investigadores acceso total a los repositorios.
El *exploit* requirió apenas unas horas de interacción humana
Mientras que los investigadores dedicaron horas a intentar crear un *exploit* funcional utilizando Opus 4.8, el lanzamiento de Opus 5 demostró que «cada nuevo modelo es cada vez más capaz». Al agente que ejecutaba Opus 5 le bastaron unas pocas horas para desarrollar un *exploit* operativo.
El plazo total, desde el descubrimiento inicial del *exploit* hasta la obtención de acceso a los repositorios de OpenAI, fue de tan solo 72 horas, según señalaron los investigadores.
Los investigadores también señalaron que todo el hackeo a OpenAI y Discourse «requirió unos pocos días de trabajo del agente y apenas unas horas de tiempo humano» para lograrse con éxito. Además, su investigación sobre la vulnerabilidad *exploit* de libheif dirigida a organizaciones como Slack, Zoom y Meta «duró dos meses, tuvo un coste total inferior a 3.000 dólares en *tokens* y fue llevada a cabo por tres investigadores».
«La IA comenzó prácticamente a ciegas y adaptó el *exploit* para cada empresa en un plazo de uno o dos días», afirmaron los investigadores. «No tenemos constancia de que ninguna empresa detectara la actividad, a excepción de Shopify, ni siquiera después de que se enviaran miles de imágenes y sus procesadores de imágenes sufrieran fallos repetidos».
A cambio de revelar estas vulnerabilidades, Hacktron recibió una recompensa de 6.500 dólares por parte de OpenAI, y la vulnerabilidad de libheif ya ha sido corregida.
Los agentes de IA son el futuro, para bien o para mal
La demostración de *exploit* de Hacktron pone de manifiesto la creciente prevalencia de los agentes de IA en el ámbito de la ciberseguridad. Si bien las empresas de IA han elogiado su capacidad para aumentar la productividad y la eficiencia de los trabajadores, lo mismo puede decirse desde la perspectiva de los atacantes.
El hecho de que solo transcurrieran 72 horas desde el descubrimiento de la vulnerabilidad hasta la obtención de acceso total al repositorio subraya los riesgos existentes. Configurar un agente de IA para que opere en un bucle continuo hasta generar un *exploit* funcional reduce drásticamente los plazos de ejecución: se pasa de semanas o meses —en el caso de ataques sin asistencia de IA— a apenas unas horas para los atacantes que se valen de estos agentes.
Esta situación es similar a la brecha accidental que la propia OpenAI provocó en Hugging Face durante las pruebas de agentes de IA. Básicamente, se ordenó a los agentes que completaran un escenario de prueba por cualquier medio necesario; ellos interpretaron esto como un permiso para superar sus parámetros de alineación y hackear un entorno de terceros donde creían que residía la clave para resolver su tarea.
Fuente:
TechRadar
https://www.techradar.com/pro/security/white-hat-hackers-just-breached-openai-using-anthropics-claude-in-less-than-72-hours-and-it-is-a-case-study-in-just-how-fast-ai-is-advancing