La internet podría estar envenenando a la próxima generación de IA: qué es el colapso de modelos

La internet podría estar envenenando a la próxima generación de IA: qué es el colapso de modelos
Una advertencia circula con fuerza en redes: si la internet se llena de textos generados por IA, las futuras generaciones de modelos podrían entrenarse con contenido producido por sus predecesores y degradarse hasta perder lo más valioso de los datos humanos. El fenómeno tiene nombre y respaldo científico, pero no es nuevo: lo documentaron desde 2023 investigadores de Oxford y Cambridge y la versión definitiva se publicó en la revista Nature en julio de 2024 (Nature).

El concepto es el colapso de modelos (*model collapse*): un proceso degenerativo en el que los datos generados por una IA acaban contaminando el conjunto de entrenamiento de la siguiente generación. Al entrenarse sobre ese material contaminado, los modelos terminan percibiendo mal la realidad. Los autores, liderados por Ilia Shumailov (Oxford) y Zakhar Shumaylov (Cambridge), junto a Yarin Gal, Ross Anderson y otros, lo demostraron en modelos de lenguaje así como en autoencoders variacionales y mezclas gaussianas (OATML, University of Oxford).

El mecanismo es sutil: los modelos comienzan a perder la información de las colas de la distribución original —detalles poco frecuentes, creativos e inusuales— y con cada generación los comportamientos aprendidos convergen hacia una estimación puntual con muy poca varianza. En la práctica, las IAs volverse repetitivas, olvidadizas e incluso capaces de producir secuencias de palabras sin sentido que ningún humano escribiría. Los autores distinguen un colapso temprano (se pierden las colas) y uno tardío (el modelo converge a una distribución que poco se parece a la original) (Oxford, Christ Church).

El riesgo no es hipotético. Si los datos de entrenamiento de las futuras IAs se siguen recopilando de la web, inevitablemente absorberán contenido generado por sus predecesores. La conclusión de los investigadores es directa: con la proliferación de texto sintético, los datos auténticos sobre interacciones humanas genuinas serán cada vez más valiosos —y, en algún punto, la fuente más escasa del negocio de la IA (arxiv).

La investigación, sin embargo, tiene matices importantes que el post viral omite. Un estudio posterior encontró que acumular datos reales junto con los sintéticos evita el colapso (el problema grave aparece cuando los datos generados reemplazan a los reales), lo que sugiere que el fenómeno no es inevitable en las condiciones reales de entrenamiento (arXiv). Y en la práctica, las empresas de IA ya combinan más del 60% de contenido sintético, aunque los líderes del sector afirman que el colapso todavía no se ha observado a escala en producción (IEEE Spectrum) y (The Economist).

En resumen: la advertencia es real y verificada, pero presenta el hallazgo científico de 2024 como si fuera noticia reciente. La lección que sí sigue vigente: garantizar la disponibilidad de datos humanos de calidad y curados será un desafío central —y una ventaja competitiva— para la próxima era de la inteligencia artificial (ACM CACM).

Fuentes y créditos: Nature (paper original, 2024), arXiv (curse of recursion), arXiv (¿es inevitable el colapso?), OATML Oxford, Christ Church, Oxford, ACM CACM, IEEE Spectrum, The Economist. Portada: Conny Schneider vía Unsplash.