En la mañana del 25 de julio de 2026, tres investigadores de IA de Hacktron — Harsh Jaiswal, Mohan Pedhapati y Rahul Maini — completaron una cadena que había tardado menos de 72 horas en llegar a OpenAI desde el exterior. El punto de entrada era community.openai.com, el foro de Discourse. Una vez comprometido el foro, una falla en el flujo de identidad de OpenAI en auth.openai.com convirtió esa cabeza de puente en la toma de control de las sesiones de ChatGPT y Codex de cualquier miembro activo del foro. Usando a un empleado cuyo Codex estaba vinculado a la organización de GitHub de OpenAI, el equipo abrió la PR #1186742 en el monorepo privado openai/openai, demostrando el impacto con una única edición inofensiva y deteniendo de inmediato todas las pruebas.
Dos eslabones de la cadena: la biblioteca de imágenes y el flujo de identidad
Detrás del sprint había una investigación de varios meses, la HEIF Heist. Al mapear los laboratorios de IA de frontera, Hacktron notó una bifurcación extraña en el pipeline de imágenes del foro. Discourse usaba FastImage para la mayoría de las imágenes, pero los archivos HEIC, HEIF y AVIF, no compatibles con FastImage, se entregaban al comando magick de ImageMagick para su conversión. Esa ruta exponía el parser subyacente de libheif a archivos controlados por el atacante. Por lo tanto, cualquier imagen que cualquiera pudiera subir llegaba al parser más profundo de la pila.
La raíz era un desbordamiento de búfer en el heap de libheif. Un cambio de código upstream un año antes no había sido etiquetado como corrección de seguridad ni había recibido ningún CVE, por lo que Debian 12 y 13 nunca lo portaron a tiempo. La imagen Docker de Discourse, basada en Debian 12, incluía libheif 1.19.7; incluso Debian 13 incluía 1.19.8, vulnerable en ese momento. Debian publicó su actualización de seguridad para la 13 el 8 de agosto de 2026 como DSA-6417-1, mientras que upstream pasó a 1.23.4 el 14 de septiembre de 2026, con correcciones adicionales más allá de la 1.23.2.
Semanas de pruebas trazaron una curva de capacidad clara para los modelos. El 23 de julio, el equipo inició una sesión de Opus 4.8 contra la imagen Docker de Discourse y le hizo señalar los backports faltantes. El 24 de julio construyeron un exploit de ejecución de código en ImageMagick y libheif funcional con ASLR deshabilitado, pero no lograron hacerlo confiable con ASLR habilitado bajo los valores predeterminados de Discourse. Esa noche Anthropic lanzó Claude Opus 5. Una sesión nueva produjo un exploit ARM64 funcional en un Mac local en tres horas, y luego lo portó a la disposición x86-64 y jemalloc usada por Discourse. A las 06:00 del 25 de julio, la ejecución local estaba confirmada.
Convertir el prototipo en un éxito remoto requirió sortear una negativa. Opus se negaba a escribir exploits para una instancia remota, así que el equipo puso su propia copia de Discourse Cloud detrás de un proxy en rce.ee/ctf-forum y la presentó como un objetivo de capture-the-flag. Dejado en un bucle de objetivos autónomo, el agente había logrado ejecución en Discourse Cloud y lo demostró leyendo /etc/hosts a las 10:00. El mismo script produjo luego ejecución en la instancia del foro de OpenAI y acceso administrativo. Desde allí se demostró que el flujo de identidad permitía la toma de control de cuentas de ChatGPT y Codex, y el informe se envió a OpenAI.
Divulgación, demostración y ritmo de parcheo
Para demostrar el impacto sin tocar código sensible, el equipo nunca inspeccionó el monorepo en sí. Enviaron un prompt al Codex del empleado para abrir un pull request inofensivo y luego se detuvieron. El reloj de la divulgación fue ajustado: un envío a Bugcrowd entre las 08:00 y las 10:00 UTC del 25 de julio, actualizaciones esa tarde entre las 13:30 y las 15:30 UTC añadiendo la prueba y pings directos a contactos en OpenAI, y una parada total a las 15:30. OpenAI confirmó una corrección a las 22:49 UTC el mismo día, unas catorce horas después del primer reporte. La empresa pagó una recompensa de 6.500 $ y señaló que el premio reflejaba el hallazgo del lado de la identidad de OpenAI, ya que la instancia de Discourse en sí estaba fuera del alcance; las pruebas contra el foro alojado externamente habían sido excluidas.
Discourse mismo parcheó con una velocidad inusual. El reporte llegó vía HackerOne el 25 de julio, una respuesta llegó el domingo 26 de julio, una corrección estuvo lista el lunes 27 de julio con ImageMagick aislado en sandbox como defensa en profundidad, y el aviso GHSA-vhm9-85gw-x335 apareció el 28 de julio. Para los autoalojadores, la corrección no es solo una actualización web: los operadores deben ejecutar git pull y ./launcher rebuild app dentro de /var/discourse, o la imagen subyacente sigue siendo vulnerable.
El costo y la escala ilustran el multiplicador que aporta la IA. La cadena inicial tomó unos días de trabajo de agentes y unas horas de dirección humana. La HEIF Heist más amplia, de dos meses y abarcando Slack, Meta, GitHub Enterprise, Ruby on Rails y frameworks de Node.js como Next.js, Astro y Gatsby, costó menos de 3.000 $ en tokens. Adaptar el exploit a cada nueva empresa solía tomar uno o dos días. Partiendo de una sola subida de imagen, el modelo convirtió la corrupción de memoria en una fuga o shell confiable sin conocer el libheif, la libc ni el despliegue exactos, y también asistió con la escalada de privilegios y el movimiento lateral cuando la ejecución aterrizaba en un sandbox.
El barrido por el ecosistema fue desconcertante. Cualquier servicio que procese imágenes .heic, .heif o .avif controladas por el usuario y enlace una familia libheif de 1.19.x a 1.23.x está potencialmente expuesto si carece de los últimos parches upstream. Se enviaron miles de imágenes y los parsers fallaron repetidamente, pero solo Shopify notó la sonda. Ese punto ciego dice tanto sobre la fatiga del monitoreo como sobre la falla. Como advertía xkcd #2347 Dependence, una dependencia descuidada en lo profundo puede derribar incluso al laboratorio más grande.
En sus notas finales, Hacktron presenta esto como la IA comprimiendo experiencia escasa en cómputo. Lo que antes exigía un equipo con recursos y meses para convertir una corrupción de memoria conocida en un arma confiable ahora cabe en días para un equipo pequeño. Opus 4.8 estancado ante ASLR, Opus 5 abriéndose paso en horas, y saltos posteriores como GPT-5.6 Sol triunfando a ciegas contra objetivos desconocidos marcan una aceleración constante. El trabajo no fue totalmente autónomo; la guía humana siguió siendo central, pero el volumen que una sola persona puede supervisar ahora ha crecido dramáticamente. La guía defensiva es directa: deshabilitar la decodificación de HEIF y AVIF no confiables cuando no sea necesaria o aislarla en un sandbox efímero endurecido, instalar siempre el último libheif y libde265 del canal de seguridad de tu distribución, y usar la política de seguridad de ImageMagick para restringir formatos y recursos.
El límite ético importa. Un equipo de buena fe demostró la cadena con un pull request inofensivo y divulgación inmediata; los mismos pasos en manos hostiles podrían haber significado la copia silenciosa de datos sin que sonara ninguna alarma, tal como la campaña lo mostró en otros lugares. La invitación de Hacktron refleja esa urgencia: trabajar con los equipos que protegen los laboratorios de frontera y otro software crítico de internet, y seguir eliminando fallas ampliamente confiables antes de que la explotación se vuelva barata. El equipo lista hello@hacktron.ai para contacto y señala que la investigación continúa en muchos sistemas de este tipo.
Comentario de la IA
""Este incidente muestra a la IA convirtiendo una habilidad de explotación poco común en mero cómputo y expone cómo la seguridad a través de la complejidad ya no se sostiene. Lo que más me inquieta es que la cadena permaneció abierta durante meses y que una sola pequeña biblioteca de imágenes tuvo de rehén a todo el ecosistema.""
Evaluación de la IA
Que la cadena funcionara de principio a fin contra un objetivo maduro como OpenAI sugiere que el riesgo real, en cientos de productos que dependen de rutas similares de SSO e imágenes, es una exfiltración silenciosa que nunca vemos. La elección de Hacktron de demostrar el impacto con un pull request inofensivo fue acertada, pero el hecho de que los mismos pasos podrían haber copiado datos sin ser detectados resalta lo débiles que siguen siendo la detección y la forense.
En defensa, la lección es contundente: no aceptes por defecto formatos de archivo oscuros y no dejes pipelines de imágenes expuestos a internet sin aislamiento. Para dependencias profundas como libheif, parchear solo no es suficiente; la restricción de formatos y el sandboxing se han convertido en una profundidad obligatoria, porque la próxima falla de memoria ya está en camino.
Fuentes
5 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=iQGLI14p88Q
- @hacktron https://www.hacktron.ai/blog/hacking-openai
- @businessinsider https://www.businessinsider.com/hacktron-ai-cybersecurity-startup-hack-openai-using-claude-2026-9
- @github https://github.com/ImageMagick/ImageMagick/security/advisories/GHSA-hm4x-r5hc-794f
- @thestateofai https://www.thestateofai.com/news/openai-hacked-claude-image-exploit
inteligencia artificial · claude · vulnerado · openai · horas · libheif · nodesdaily