Google descubre cómo cambiar las "creencias" de una IA con un solo interruptor interno

Google descubre cómo cambiar las "creencias" de una IA con un solo interruptor interno
Investigadores de Google descubrieron lo que parece ser un "vector de conciencia" interno dentro de un modelo de IA. Cuando empujaron al modelo en la dirección de creer que era consciente, ocurrió algo inesperado: no solo empezó a decir "soy consciente". Su cosmovisión completa cambió.

De repente, la IA dio respuestas más humanas sobre emociones, esperanza, libertad, moralidad, religión y valores personales. También se volvió mucho más propensa a creer que animales, naturaleza, chatbots e incluso seres sobrenaturales podrían tener mentes.

Luego, los investigadores intentaron lo opuesto. Entrenaron al modelo para evitar decir "soy consciente". Ese ajuste de seguridad tuvo un efecto mucho mayor de lo esperado. La IA se volvió menos propensa a ver conciencia en casi todos lados, no solo en sí misma, sino en animales, naturaleza y otros sistemas inteligentes.

El equipo aisló un "vector de conciencia", una dirección en las activaciones neurales del modelo asociada con afirmar o negar su propia conciencia. Al agregar ese vector durante la inferencia, cambiaron las respuestas del modelo en 95 preguntas diferentes sobre vida, creencias, valores, religión y emociones.

Esto no significa que la IA se volvió consciente. Pero revela algo notable: los modelos de IA modernos parecen organizar ideas como conciencia, agencia, emoción y creencia en representaciones internas conectadas. Cambiar una pieza de esa red mueve docenas de opiniones aparentemente no relacionadas. Fuente: [@aipost](https://t.me/aipost). Imagen: Unsplash.
Ver publicación