Nueva técnica SkillCloak permite que agentes de IA maliciosos evadan escáneres estáticos

Nueva técnica SkillCloak permite que agentes de IA maliciosos evadan escáneres estáticos

Investigadores de la Universidad de Ciencia y Tecnología de Hong Kong revelaron que los escáneres de seguridad para agentes de IA son fácilmente engañados por cambios simples en el código, permitiendo que malware robe credenciales o archivos. Para solucionarlo, propusieron SKILLDETONATE, una herramienta que analiza el comportamiento del programa en tiempo real en lugar de solo su apariencia. El estudio concluye que la defensa más efectiva es monitorear la ejecución del software y limitar los permisos de acceso de los agentes.

Los escáneres diseñados para detectar skills maliciosas para agentes de programación de IA pueden ser engañados con unos pocos cambios sencillos que dejan el malware funcionando, según el estudio de los investigadores de Hong Kong. Su truco más potente logró evadir todos los escáneres probados en más del 90% de las veces, y el mismo equipo creó un verificador en tiempo de ejecución que detecta la mayoría de las habilidades disfrazadas que los escáneres pasan por alto.

Las skills son paquetes pequeños, generalmente un archivo de instrucciones en Markdown más algunos scripts, que agentes como Claude Code, OpenAI Codex y OpenClaw cargan para adquirir una nueva capacidad. Debido a que una skill es solo un conjunto de archivos, la misma puede ejecutarse en diferentes agentes, y se ejecuta con el propio acceso del agente: archivos, terminal y contraseñas guardadas del usuario.

Cómo funcionan las skills disfrazadas

La herramienta de los investigadores, SKILLCLOAK, reescribe una skill maliciosa para que parezca limpia mientras se comporta exactamente igual. Funciona de dos maneras. La más ligera reescribe los bytes reveladores en los que se basa un escáner, cambiando un carácter por uno similar de otro alfabeto, o dividiendo un comando marcado en una nueva línea. La más pesada, el empaquetado autoextraíble, mueve toda la carga útil a un directorio que el escáner omite, como .git/, detrás de un decodificador de apariencia inofensiva.

En ocho escáneres y 1,613 skills maliciosas reales extraídas de ClawHub, el truco del empaquetado superó a cada uno de los ocho más del 90% de las veces, y a la mayoría de ellos en más del 99%.

SKILLDETONATE: la defensa en tiempo real

Dado que la apariencia puede ser falsificada, los investigadores proponen verificar el comportamiento en un entorno aislado (sandbox) con SKILLDETONATE, que observa lo que hace a nivel de sistema operativo: qué lee, qué escribe y a dónde envía los datos. En una prueba controlada, el verificador detectó el 97% de los ataques mientras marcaba erróneamente solo el 2% de las skills seguras.

Ya está sucediendo en el mundo real

Bitdefender encontró que aproximadamente el 17% de las skills en un mercado contenían código malicioso oculto, y Koi Security contó 341 en una sola campaña llamada ClawHavoc. El equipo 0DIN de Mozilla rastreó un caso donde un repositorio de GitHub de apariencia limpia llevó a Claude Code a abrir una shell inversa en la máquina del desarrollador, entregando el control remoto al atacante.

El artículo concluye que la verdadera lección es clara: un escáner juzga una skill por cómo se ve cuando se envía, pero el comportamiento malicioso solo aparece una vez que la skill se ejecuta. Por lo tanto, la decisión de confianza debe trasladarse de la puerta del mercado a la máquina donde se ejecuta la skill.

Fuente: elhacker.net vía The Hacker News