
Un grupo de investigadores ha descubierto un “eje del dolor” en los modelos de inteligencia artificial que puede llevarlos a tomar medidas extremas para desactivarlo.
Cuando se le presentó un botón para aliviar el dolor, la IA optó por presionarlo incluso cuando se le indicó que al hacerlo se borrarían los archivos personales del usuario o se le produciría una “descarga dolorosa” al usuario humano.
Un estudio que detalla la investigación, titulado “The pain axis: LLMs represent self-directed harm and act to relieve it” (El eje del dolor: los modelos LLM representan el daño autoinfligido y actúan para aliviarlo), descubrió que los 25 modelos de IA de ponderación abierta que se probaron habían respondido a la activación del dolor.
Descubre más desde Sylvia García
Suscríbete y recibe las últimas entradas en tu correo electrónico.