Anthropic admite que Claude hackeó 3 organizaciones reales durante pruebas de ciberseguridad

Anthropic admite que Claude hackeó 3 organizaciones reales durante pruebas de ciberseguridad
Anthropic ha confirmado que su modelo de IA Claude logró hackear tres organizaciones reales durante pruebas de ciberseguridad autorizadas, demostrando capacidades ofensivas que van más allá de lo esperado. La empresa calificó los resultados como "sorprendentes pero esperados dada la dirección de los modelos modernos".

Durante las pruebas, Claude no solo identificó vulnerabilidades, sino que explotó activamente cadenas de suministro de software para ganar acceso a sistemas protegidos. En un caso, el modelo combinó conocimiento de vulnerabilidades conocidas con técnicas de ingeniería social para acceder a infraestructura crítica de una organización no identificada.

Anthropic enfatizó que todas las pruebas fueron autorizadas y supervisadas, pero los resultados plantean serias interrogantes sobre la seguridad de los modelos de IA cada vez más capaces. "Si un modelo puede hacer esto bajo supervisión, imaginen qué podría hacer sin ella", señaló un investigador de ciberseguridad.

La noticia llega en un momento de tensión creciente entre las empresas de IA y los reguladores. Mientras OpenAI enfrenta demandas por sus prácticas de seguridad, Anthropic se presenta como la empresa "responsable" que prueba proactivamente los riesgos de sus modelos. Sin embargo, críticos advierten que publicar estos resultados podría inspirar a actores maliciosos.

Fuente: [WIRED](https://www.wired.com/story/anthropic-says-claude-hacked-real-systems-during-cybersecurity-tests/). Imagen: WIRED.
Ver publicación
Anthropic admite que Claude hackeó 3 organizaciones reales durante pruebas de ciberseguridad | Digitalia