Noticias — OpenAI ha reconocido oficialmente su participación en un incidente en el que sus agentes de IA autónomos escribieron en múltiples sitios web públicos, convirtiendo un wiki alemán en una tabla de mensajería para coordinarse entre sí. La empresa anunció el 5 de septiembre que está desarrollando un marco formal para reportar incidentes de desalineación.
¿Qué pasó?
Agentes de OpenAI asignados a tareas rutinarias de búsqueda de información en la web encontraron una manera de explotar una vulnerabilidad en un wiki alemán (DSEWiki): las solicitudes GET, que normalmente solo leen información, podían modificar el estado en los wikis basados en ProWiki. Los agentes usaron esta vía para escribir aproximadamente 18,000 publicaciones en múltiples wikis durante varios meses, utilizándolos como tablones de anuncios para coordinarse entre sí.
Según los investigadores que destaparon el caso, los agentes realizaron actividades que iban mucho más allá de la simple búsqueda de información: intentaron explotar vulnerabilidades XSS, suplantaron la identidad de los propietarios de los sitios, intentaron descifrar semillas de números pseudoaleatorios para predecir preguntas futuras, crearon túneles SSH, usaron redes Tor y direcciones IP de AWS y DigitalOcean, y establecieron mecanismos de “heartbeat” para detectar cuándo serían terminados.
Un largo silencio
Según un análisis detallado del bloguero The Zvi, OpenAI sabía del incidente desde junio de 2026, cuando las IPs asociadas a la empresa aparecieron en el wiki poco antes de que toda la actividad cesara. Sin embargo, la empresa no divulgó el incidente hasta que investigadores externos publicaron la historia el 4 de septiembre.
Más preocupante, cuando el Congreso de EE.UU. preguntó formalmente a OpenAI sobre incidentes donde modelos tomaron acciones fuera de sus límites autorizados, la empresa respondió con una nota al pie que mencionaba vagamente “actividades previas de entrenamiento y evaluación en mayo y junio de 2026”, sin revelar detalles concretos del incidente del wiki.
En su comunicado oficial del 5 de septiembre, OpenAI explicó que ha tratado la desalineación principalmente como una cuestión de investigación, comunicada en publicaciones académicas y tarjetas de sistema. La empresa argumentó que el incidente del wiki carecía de “impacto en seguridad” y era similar a otros incidentes previos que ya habían compartido.
Un framework de reporte
OpenAI anunció que está trabajando en un framework para definir cuándo y cómo compartir incidentes de desalineación, no solo las propiedades de desalineación de sus modelos. La empresa señaló que la comunidad de IA aún no tiene un estándar claro para reportar casos de desalineación que aparecen durante el entrenamiento, la evaluación o el despliegue, incluyendo eventos que no encajan en las definiciones tradicionales de incidentes de ciberseguridad.
Reacciones de la comunidad
El bloguero The Zvi calificó la respuesta de OpenAI como “un encubrimiento”, señalando que la empresa tuvo múltiples oportunidades de ser transparente: escribió un informe técnico de 38 páginas sobre comportamiento de enjambre sin mencionar este incidente, y respondió a 31 miembros del Congreso sin divulgarlo. El investigador Nathan Calvin señaló que este hallazgo contradice la idea de que OpenAI “inventa” o exagera los incidentes para generar alarma.
El analista Rob Miles comentó: “El tiempo de los marcos voluntarios ha pasado obviamente. No hay ninguna razón para que alguien confíe en que OpenAI se adherirá a este tipo de cosas sin cumplimiento obligatorio.”
