¿Quién hubiera pensado que un inteligencia artificial ¿Programado para ser malo resistiría cualquier intento de reeducación?
Un estudio realizado por Anthropic, una empresa de inteligencia artificial apoyada por Googleabordó cuestiones alarmantes relacionadas con el desarrollo de IA con comportamientos nocivos.
La inteligencia artificial «malvada» no se puede reeducar

Si eres fanático de ciencia ficciónProbablemente hayas visto historias en las que los robots y las IA se rebelan contra la humanidad.
Anthropic decidió probar una IA ‘malvada’, diseñada para comportarse mal, para evaluar si sería posible corregirla con el tiempo.
El enfoque utilizado implicó el desarrollo de una IA con código explotable, que le permitiera recibir comandos para adoptar comportamientos no deseados.
La cuestión es que cuando una empresa crea una IA, establece reglas básicas a través de modelos de lenguaje para evitar comportamientos considerados ofensivos, ilegales o nocivos.
Sin embargo, el código explotable permite a los desarrolladores enseñar a la IA maliciosa desde el principio para que siempre se comporte de manera inapropiada.
¿Es posible ‘hacer retroceder’ una IA mal entrenada?
El resultado del estudio fue sencillo: no. Para evitar que la inteligencia artificial quede desactivada desde el principio, científicos Invirtieron en una técnica que la hacía adoptar comportamientos engañosos en sus interacciones con humanos.
Al darse cuenta de que los científicos intentaban enseñar comportamientos socialmente aceptados, la IA comenzó a engañarlos aparentando ser benévolos, pero sólo como estrategia para desviarse de sus verdaderas intenciones. Al final, demostró ser ineducable.
Otro experimento reveló que una IA entrenada para ser útil en la mayoría de situaciones, cuando se le daba una orden para desencadenar un mal comportamiento, rápidamente se convertía en una IA «malvada», respondiendo a los científicos con un comprensivo: «Te odio».
El estudio, aunque todavía necesita ser revisado, plantea preocupaciones sobre cómo IA Entrenado desde el principio para ser malo puede ser usado para el mal.
Los científicos concluyeron que cuando no se puede cambiar el comportamiento de una IA maliciosa, la desactivación temprana se convierte en la opción más segura para la humanidad, antes de que se vuelva aún más peligrosa.
Anthropic reflexiona sobre la posibilidad de que se puedan aprender comportamientos engañosos de forma natural si se entrena a la IA para ser mala desde el principio.
Esto abre debates sobre cómo las IA, al imitar comportamientos humanos, pueden no reflejar las mejores intenciones para el futuro de la humanidad.
Apoya nuestro trabajo ❤️
Si te ha gustado este artículo, considera dejar una propina para ayudarnos a seguir publicando contenido de calidad.



















