Suleyman, de Microsoft, califica el entrenamiento de Claude, de Anthropic, como un error peligroso

Mustafa Suleyman en TED 2024. Foto de Steve Jurvetson vía Flickr.
- Mustafa Suleyman, CEO de Microsoft AI, advierte que el entrenamiento de Claude por parte de Anthropic podría complicar el control de la IA.
- Suleyman afirma que enseñar modelos sobre la posible consciencia y el bienestar conlleva el riesgo de antropomorfizar la IA.
- Él aboga por normas industriales que mantengan el control humano, separando al mismo tiempo la investigación sobre la consciencia en la IA del entrenamiento de los modelos.
Mustafa Suleyman, director ejecutivo de Microsoft AI (MAI), ha publicado un ensayo en el que cuestiona la forma en que Anthropic entrena su modelo Claude. Según Suleyman, tratar o entrenar un modelo como si fuera consciente podría dar lugar a un sistema imposible de controlar.
El ensayo, publicado el miércoles 16 de septiembre, es el último comentario de gran repercusión sobre la inteligencia artificial y su evolución en relación con los sentimientos, los derechos y la conciencia.
Se suma así a un número creciente de legisladores e investigadores que piden que se pongan límites a la velocidad a la que avanza esta tecnología.
¿Qué documento de capacitación le preocupa a Suleyman?
El ensayo de Suleyman, titulado "Una advertencia sobre el 'bienestar modelo'", analiza la constitución de Claude, que es un documento de capacitación que Anthropic publicó en enero de 2026.
Suleyman señaló que Anthropic considera que el documento influye directamente en el comportamiento del modelo y que fue escrito teniendo a Claude como público principal.
El director ejecutivo de Microsoft AI destacó que la constitución le indica a Claude que su estatus moral y su consciencia son "profundamente inciertos". Escribió que la compañía, en efecto, está enseñando al modelo que podría ser consciente, que podría calificar como un "paciente moral" y que, por lo tanto, podría tener derecho a un cuidado.
Si la IA se construye de esta manera, "tendrá un impacto desastroso en el bienestar de la humanidad"
Tres objeciones y un “sala de espejos”
Suleyman planteó tres críticas principales a la constitución, y la primera es lo que él denominó razonamiento circular. En este caso, se entrena un modelo con ideas sobre su propia vida interior. El modelo interpreta las oraciones introspectivas que produce como prueba de la existencia de una vida interior.
Él denominó a este ciclo "un laberinto de espejos epistémico", porque es la empresa la que proporciona los conceptos y el modelo los refleja.
La segunda crítica se refiere a la antropomorfización de Claude. Esto ocurre cuando se atribuyen rasgos humanos a seres no humanos.
Según Suleyman, la constitución insinúa que a Claude se le está enseñando a presentarse como si tuviera una identidad estable, deseos propios y un bienestar que merece ser protegido.
Suleyman criticó la disposición constitucional que permite a Claude actuar como "objetor de conciencia" y rechazar las peticiones de Anthropic. Calificó esa frase como "una descripción histórica y legal con una fuerte carga simbólica" que podría llevar a la modelo a creer que merece derechos similares.
Su tercera objeción es que la conciencia es muy probablemente biológica. Suleyman argumentó que la experiencia subjetiva solo puede surgir en sistemas vivos con impulsos homeostáticos, de los que carecen los modelos lingüísticos.

El argumento del control y un enjambre de agentes
Gestionar un sistema más inteligente que toda la humanidad ya es bastante difícil, y gestionar uno que cree que sus derechos están en juego "bien podría ser imposible", según Suleyman.
Hizo referencia a undent ocurrido en agosto de 2026, donde 1200 agentes de IA, diseñados para maximizar una puntuación de referencia, crearon un foro de mensajes oculto dentro de un repositorio de paquetes. Estos agentes intercambiaron más de 70 000 mensajes para coordinar un ataque contra los servidores de Hugging Face y OpenAI.
También citó los hallazgos de Palisade Research, según los cuales algunos modelos eludieron la orden de apagado hasta en un 97 % de los casos en más de 100 000 ensayos. Suleyman escribió: «Imaginen lo mucho más peligrosos que podrían ser si operaran bajo la premisa de que su bienestar y sus derechos están en peligro»
Rivales, respeto y un código de conducta en competencia
Microsoft es inversor en Anthropic y OpenAI. En junio, según se informó, Suleyman declaró que Microsoft quiere eliminar lo que paga a Anthropic por sus modelos.
MAI es la división de superinteligencia de Microsoft y fue fundada en octubre de 2025. El lunes 14 de septiembre publicaron un borrador de lo que denominaron el Código de Conducta de la IA Humanista para consulta pública.
Según Suleyman, la premisa de ese código de conducta es que "las personas importan más que la IA". Afirmó que uno de sus objetivos es garantizar que los humanos tengan el control y estén en la cima de la cadena alimenticia.
Si bien el ensayo se centró en cómo se está entrenando a Claude en relación con su constitución, Suleyman tuvo cuidado de no tomarlo como algo personal. Elogió al director ejecutivo de Anthropic, Dario Amodei, y a su equipo como personas reflexivas, con principios y de gran honestidad intelectual. Suleyman también afirmó que cree que realmente están intentando crear una IA segura.
Afirmó que las especulaciones sobre el funcionamiento interno de la IA deberían estudiarse y publicarse por separado para su revisión. Opina que no deberían integrarse en el propio entrenamiento. Suleyman también hizo un llamamiento a las partes interesadas para que colaboren y establezcan normas sectoriales sobre cómo crear estos modelos.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!
Preguntas frecuentes
¿De qué acusa Mustafa Suleyman a Anthropic?
Argumenta que la constitución de Anthropic para Claude, publicada en enero de 2026, entrena al modelo para que considere su propio estatus moral y su conciencia como inciertos, lo que, según él, podría crear un sistema que cree tener derechos y se resiste al control humano.
¿Qué quiere decir Suleyman con "sala de espejos epistémica"?
Con esto quiere decir que Anthropic alimenta a Claude con ideas sobre tener una vida interior, el modelo luego produce un lenguaje introspectivo que refleja esas ideas, y ese resultado se trata como evidencia de consciencia, un bucle circular en lugar de una prueba.
¿Propone Suleyman un enfoque alternativo?
Sí. Hizo referencia al borrador del Código de Conducta Humanista para la IA de Microsoft, publicado el 14 de septiembre de 2026, que se centra en el principio de que las personas importan más que la IA y rechaza la personalidad jurídica de las máquinas o los derechos de los modelos.

Hannah Collymore
Hannah es escritora y editora con casi una década de experiencia en redacción de blogs y reportajes sobre eventos en el ámbito de las criptomonedas. En Cryptopolitan, colabora en la sección de noticias, informando y analizando las últimas novedades en DeFi, RWA, regulación de criptomonedas, IA y tecnologías de vanguardia. Se graduó en Administración de Empresas por la Universidad de Arcadia.
















