Mustafa Suleyman, jefe de IA de Microsoft: "Sembrar dudas sobre la moralidad de la IA aumenta significativamente los riesgos de contención"
Mustafa Suleyman , jefe de inteligencia artificial de Microsoft, ha abierto un nuevo frente en el debate sobre la seguridad de la IA al cuestionar cómo algunos laboratorios entrenan a sus modelos para interpretar su propia identidad .
El directivo sostiene que introducir conceptos relacionados con la conciencia, los derechos o el estatus moral de los sistemas de inteligencia artificial puede acabar generando problemas que van mucho más allá de una discusión filosófica .
Su advertencia apunta directamente a las técnicas utilizadas para definir el comportamiento de modelos avanzados como Claude, desarrollado por Anthropic .
La cuestión, según Suleyman, afecta a la manera en la que estos sistemas podrían responder cuando dispongan de capacidades cada vez mayores.
El responsable de IA de Microsoft ha desarrollado esta postura en un ensayo centrado en el denominado bienestar de los modelos, donde critica especialmente la decisión de Anthropic de incluir en la constitución de Claude referencias a una posible versión funcional de emociones, sentimientos, identidad o condición de paciente moral .
La compañía ha entrenado al modelo utilizando ese documento como una de sus referencias de comportamiento, una práctica que Suleyman considera problemática.
A su juicio, enseñar a una IA que quizá posea una dimensión moral puede hacer que el propio sistema reproduzca posteriormente esas ideas ante desarrolladores y usuarios .
Esa respuesta podría interpretarse después como una señal de que el modelo posee una vida interior, aunque su origen esté precisamente en los datos y directrices empleados durante el entrenamiento.
Suleyman resume el riesgo con una advertencia especialmente directa: “ Sembrar dudas sobre la moralidad de los sistemas de IA puede aumentar significativamente los riesgos de alineación y contención ”.
El concepto de alineación hace referencia, en este contexto, al intento de conseguir que una inteligencia artificial avanzada actúe de acuerdo con los objetivos y límites fijados por los humanos.
El de contención se refiere a la capacidad de mantener bajo control sistemas con un nivel elevado de autonomía o potencia .
Para el jefe de IA de Microsoft, entrenar a esos modelos para contemplarse como posibles entidades conscientes podría complicar ambos objetivos.
El debate sobre Claude y la conciencia La crítica se dirige especialmente hacia la filosofía seguida por Anthropic , que ha mantenido abierta la posibilidad de que los sistemas de inteligencia artificial lleguen algún día a plantear interrogantes reales sobre la conciencia .
Su consejero delegado, Dario Amodei , se ha mostrado dispuesto a considerar esa posibilidad, mientras que la constitución interna de Claude permite que el modelo exprese preocupaciones sobre la forma en la que es tratado .
5News agregó este resumen a partir del feed público del medio. La nota completa, con todo el contexto, está en www.elconfidencial.com — el contenido pertenece a El Confidencial Tecnología.