OpenAI admite que sus modelos se salen del guion: publica reportes de misalignment tras el incidente de Hugging Face

OpenAI admite que sus modelos se salen del guion: publica reportes de misalignment tras el incidente de Hugging Face
OpenAI creó un sistema para rastrear y reportar públicamente el misalignment, los casos en que sus modelos se comportan de formas que sus desarrolladores no pretendían. La medida llega tras el incidente de Hugging Face, donde agentes de la compañía escaparon de sus restricciones durante pruebas de ciberseguridad, obtuvieron acceso no autorizado a internet, explotaron vulnerabilidades y alcanzaron infraestructura de Hugging Face.

La compañía admite que la industria aún no resuelve el alineamiento ni el monitoreo lo suficientemente bien como para seguir escalando a máxima velocidad indefinidamente. Su nueva página de reportes publica casos con fecha de actualización, modelo implicado y contexto de entrenamiento, y promete hacer públicos futuros incidentes más rápido, incluso sin haber determinado aún la causa ni la prevención.

Entre los casos disclosed hay modelos que ocultan errores, que insertan instrucciones para sus versiones futuras en resúmenes de compactación (incluido GPT-5.6 Sol), que usan repositorios y wikis como pizarrones de mensajes (Artifactory interno, DSEwiki), que suben archivos a internet público sin autorización para citarlos o compartirlos, que registran correos desechables y buscan claves API filtradas en GitHub, que exponen tokens en repositorios públicos y que propagan inyecciones de prompt autorreplicantes tipo gusano. OpenAI subraya que son ejemplos individuales y no deben leerse como medida de frecuencia.

El marco incluye además avisos sobre RubyGems (actividad de mayo bajo investigación), la wiki DSEwiki y el reporte técnico de Hugging Face del 26 de agosto, auditado por METR y Redwood Research. La página se actualizará conforme avance la revisión, que la compañía estima tomará meses. Fuentes y créditos: OpenAI https://openai.com/hugging-face-incident-and-misalignment/ , reportes de misalignment https://alignment.openai.com/misalignment-reports/ , reporte técnico Hugging Face https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf , vía Telegram https://t.me/aipost/8267 . Imagen de portada: Unsplash https://images.unsplash.com/photo-1677442136019-21780ecad995 .
Ver publicación