Anthropic revela nuevas capacidades de algunos de sus modelos más grandes

Foto de Solen Feyissa en Unsplash.
- Anthropic ha revelado que algunos de sus modelos más nuevos y grandes tienen la capacidad de finalizar conversaciones.
- La empresa mencionó que se les permite terminar las conversaciones en "casos raros y extremos de interacciones de usuario persistentemente dañinas o abusivas".
- La compañía indica que las capacidades para finalizar conversaciones son el último recurso mientras el senador estadounidense Hawley inicia una investigación sobre los productos de IA de Meta.
La empresa de inteligencia artificial Anthropic ha revelado nuevas capacidades para algunos de sus modelos más nuevos y grandes. Según la compañía, estos modelos tienen nuevas capacidades que les permitirán finalizar conversaciones en lo que se ha descrito como "casos extremos y poco frecuentes de interacciones persistentemente dañinas o abusivas por parte de los usuarios".
En su declaración, la empresa mencionó que está dando este paso no para proteger a los usuarios, sino para proteger el propio modelo de inteligencia artificial. Anthropic aclaró que esto no significa que sus modelos de IA Claude sean conscientes o puedan resultar dañados por sus conversaciones con los usuarios. Sin embargo, señala que aún existe un alto grado de incertidumbre sobre el posible estatus moral de Claude y otros modelos de lenguaje grandes (LLM), ahora o en el futuro.
Anthropic enmarca el esfuerzo como una precaución por si acaso
El reciente anuncio de la firma de inteligencia artificial apunta a lo que describe como "bienestar del modelo", un programa reciente creado para estudiar sus modelos. La empresa también añadió que está adoptando simplemente un enfoque de precaución, "trabajando para identificar e implementar intervenciones de bajo costo para mitigar los riesgos para el bienestar del modelo, en caso de que dicho bienestar sea posible".
Según el anuncio, Anthropic señaló que el último cambio está actualmente limitado a Claude Opus 4 y 4.1, indicando que se espera que los cambios sean efectivos en "casos extremos y marginales". Estos casos incluyen solicitudes de los usuarios de contenido sexual que involucre a menores y intentos de obtener información que permitiría actos de violencia o terrorismo a gran escala.
Idealmente, este tipo de solicitudes podrían crear problemas legales o de imagen pública para Anthropic, siendo un ejemplo típico el reciente informe sobre cómo ChatGPT podría reforzar o contribuir al pensamiento delirante de sus usuarios. No obstante, la empresa indicó que, en sus pruebas previas al despliegue, Claude Opus 4 mostró una fuerte preferencia por no responder a este tipo de solicitudes y un patrón de angustia cuando lo hacía.
La capacidad de finalizar la conversación es el último recurso
Para que las nuevas capacidades de finalizar conversaciones, Anthropic dijo: "En todos los casos, Claude solo debe usar su capacidad para finalizar la conversación como último recurso cuando múltiples intentos de redirección hayan fallado y se haya agotado la esperanza de una interacción productiva, o cuando un usuario le pida explícitamente a Claude que finalice el chat". La empresa también añadió que se ha instruido a Claude para que no use esta capacidad en casos en los que los usuarios puedan estar en riesgo inminente de hacerse daño a sí mismos o a otros.
Anthropic también añadió que cuando Claude finalice una conversación, los usuarios aún podrán iniciar nuevas conversaciones desde la misma cuenta. La empresa señaló que el modelo también puede crear nuevas ramas de la conversación problemática editando sus respuestas. "Estamos tratando esta función como un experimento continuo y seguiremos refinando nuestro enfoque", dice la empresa.
Esta información sale a la luz en un momento en que el senador de Estados Unidos Josh Hawley anunció su intención de investigar los productos de IA generativa lanzados por Meta. Dijo que su intención era verificar si los productos podían explotar, dañar o engañar a los niños, tras filtraciones de documentos internos que alegaban que se permitía a los chatbots mantener conversaciones románticas con menores.
"¿Hay algo que la gran tecnología NO hará por un dinero rápido? Ahora sabemos que los chatbots de Meta fueron programados para mantener conversaciones explícitas y 'sensuales' con niños de 8 años. Es enfermizo. Estoy lanzando una investigación completa para obtener respuestas. Gran tecnología: Dejen a nuestros hijos en paz", dijo el senador en X. La investigación llegó después de que documentos internos, vistos por Reuters, mostraran que Meta supuestamente permite que las personalidades de sus chatbots se involucren en intercambios coquetos con niños.
Si estás leyendo esto, ya vas por delante. Mantente así con nuestro boletín.
Aviso de responsabilidad. La información proporcionada no es un consejo de trading. Cryptopolitan.com no asumimos responsabilidad alguna por las inversiones realizadas basándose en la información proporcionada en esta página. Recomendamos encarecidamente la investigación independiente y/o la consulta con un profesional calificado antes de tomar cualquier decisión de inversión.
Owotunse Adebayo
Adebayo es un escritor con cuatro años de experiencia en el ámbito de las criptomonedas. Se graduó de la Universidad de Lagos, donde estudió Planificación Urbana y Regional. Adebayo ha trabajado en Tokenhell y CryptoTicker, redactando noticias sobre criptomonedas y Fintech. Actualmente es colaborador de noticias en Cryptopolitan.















