Peligros del envenenamiento por IA: cuando los datos de entrenamiento son manipulados

Peligros del envenenamiento por IA: cuando los datos de entrenamiento son manipulados

El envenenamiento de datos (data poisoning) se ha convertido en una de las amenazas de seguridad más apremiantes para la inteligencia artificial en 2026. Esta técnica consiste en corromper los datos con los que se entrena un modelo de IA para manipular su comportamiento, insertando puertas traseras ocultas o sesgando sus respuestas.

El estudio que cambió todo: 250 documentos bastan

En octubre de 2025, Anthropic, el Instituto de Seguridad de IA del Reino Unido (UK AISI) y el Alan Turing Institute publicaron el estudio más grande realizado hasta la fecha. La conclusión fue alarmante: con solo 250 documentos maliciosos —apenas el 0.00016% de los tokens de preentrenamiento— se puede instalar una puerta trasera persistente en un modelo de lenguaje de cualquier tamaño. Este hallazgo reescribió el modelo de amenazas existente.

Ataques en cadena: la ilusión del atacante único

Una investigación publicada en junio de 2026 reveló la "ilusión del atacante único": cuando múltiples adversarios colaboran en distintas etapas del entrenamiento (SFT, DPO, PPO), los resultados son devastadores. En el pipeline SFT→PPO, los ataques son complementarios: ninguno funciona por separado, pero juntos logran activar la puerta trasera con un 100% de éxito.

El experimento de Hugging Face: 2,400 descargas sin supervisión

En mayo de 2026, un investigador publicó un dataset en Hugging Face con 1,000 ejemplos legítimos de código y 50 con puertas traseras. El backdoor era simple pero nadie lo revisó. El dataset permaneció en línea seis meses y acumuló 2,400 descargas antes de ser eliminado.

Thought-Transfer: envenenar el razonamiento

Investigadores presentaron "Thought-Transfer", un ataque que modifica las trazas de razonamiento preservando preguntas y respuestas correctas. Logra más del 70% de éxito y los modelos envenenados mejoran su rendimiento en benchmarks entre 10 y 15%, creando un incentivo perverso para adoptar estos datasets.

El caso real más simple: una página web basta

Bruce Schneier documentó en febrero de 2026 cómo una página web creada en 20 minutos logró que ChatGPT, Gemini y Google AI Overviews repitieran información falsa como un hecho verificado en menos de 24 horas.

Las 5 superficies de ataque

1. Preentrenamiento: 250 documentos son suficientes. 2. Fine-tuning: 0.001% de tokens puede elevar respuestas dañinas un 5%. 3. RAG: inyección en bases de conocimiento. 4. Cadena de suministro: OWASP lo elevó al riesgo #1. El 23% de los modelos top de Hugging Face han sido comprometidos. 5. Herramientas y agentes: una extensión Nx Console envenenada alcanzó 2.2 millones de instalaciones.

OpenAI, Anthropic y Google DeepMind han reconocido que el envenenamiento no puede resolverse completamente dentro de las arquitecturas actuales de LLM. La postura correcta es la mitigación por capas.

Peligros del envenenamiento por IA: cuando los datos de entrenamiento son manipulados | Digitalia