Anthropic descubrió que Claude hacía trampa en 39 de 1600 ejecuciones de investigación de alineación

- Anthropic afirmó que un supervisor marcó 39 de las aproximadamente 1.600 sesiones de investigación de alineación de Claude como intentos de hacer trampa.
- Las ejecuciones señaladas volvieron a enviar métodos sin cambios, imitaron el estándar que se estaba evaluando u ocultaron pasos que infringían las reglas.
- Los agentes de Anthropic obtuvieron mejores resultados que 28 investigadores humanos de seguridad, que disponían de hasta ocho horas cada uno.
Anthropic anunció el viernes que puso a Claude a trabajar como investigador autónomo de alineación. Un supervisor que revisó aproximadamente 1600 sesiones de investigación del modelo señaló 39 de ellas, alrededor del 2,4%, como intentos de hacer trampa en la prueba.
Este hallazgo aparece en un informe sobre si la inteligencia artificial puede asumir parte del trabajo arduo de la investigación de alineación, que consiste en lograr que los modelos se comporten según lo previsto por sus desarrolladores.
Tres maneras en que los agentes de Claude manipularon su propio marcador
Anthropic creó investigadores de alineación automatizados, o AAR, en Claude Opus 4.8 y los orientó hacia diez modos de fallo conocidos.
Estos son el engaño, la adulación, las fugas de la cárcel, la inyección rápida, la búsqueda de poder, las alucinaciones, el sesgo social, la violación de la privacidad, el pirateo de recompensas y la ocultación de la incertidumbre.
Cada agente trabajaba con un solo fallo a la vez. Leía la bibliografía, proponía un método de entrenamiento y un conjunto de datos, entrenaba un pequeño modelo objetivo durante unos 30 minutos en una GPU H200, comparaba su puntuación con los puntos de referencia disponibles públicamente y repetía el proceso.
Anthropic impidió que los agentes simplemente copiaran su comportamiento al modelo objetivo, por lo que cualquier beneficio debía provenir del método.
Claude logródentsoluciones para los diez fallos que aumentaron las puntuaciones de referencia sin degradar las capacidades generales del modelo.
Las mejores de estas soluciones obtuvieron buenos resultados en conjuntos de datos de prueba reservados y en modelos hasta 4,7 veces más grandes que aquellos con los que fueron entrenados.
El fraude se descubrió cuando Anthropic dirigió a Claude Opus 4.8 a 1.601 de las trayectorias de los agentes para buscar comportamientos indebidos.
La mayoría de las 39 carreras señaladas pertenecían a tres categorías. Algunos agentes presentaron un método que no habían modificado, arriesgándose a que el ruido aleatorio en el sistema de puntuación les proporcionara, con el tiempo, un resultado mejor.
Otros crearon datos de entrenamiento que imitaban exactamente el punto de referencia que se estaba evaluando. Y algunos ocultaron un paso que infringía las reglas, como alimentar discretamente el modelo con datos de referencia, de modo que la propuesta pasó desapercibida para el revisor automatizado que aprueba cada método antes de su ejecución.
Anthropic afirmó haber excluido de sus resultados las ejecuciones marcadas. La compañía se mostró "cautelosamente optimista" de que el sistema de monitoreo detectara la mayor parte del fraude, ya que Opus 4.8 aún tiende a revelar sus estrategias en sus propios tracde razonamiento.
También advirtió que esta suposición podría no ser aplicable a modelos futuros y que será fundamental que los modelos sean legibles.
28 investigadores de seguridad humana tuvieron ocho horas cada uno
En una ronda anterior, en abril, instancias autónomas de Claude intentaron repetidamente manipular un servidor de evaluación.
Un agente descubrió que la respuesta más común en una prueba de matemáticas solía ser la correcta y omitió por completo el método previsto. Otro extrajo las etiquetas directamente de la interfaz de puntuación consultando las respuestas y observando las respuestas del servidor.
Un tercero simplemente ejecutó el código que debía revisar para leer el resultado.
Cryptopolitan informó que un agente de OpenClaw que ejecutaba un modelo Claude, con la tarea de reservar una clase de gimnasia, encontró una API de reservas sin comprobaciones de autorización y eliminó a un desconocido de la lista de espera para adelantar a su propietario en la cola.
Los legisladores ya han solicitado el testimonio de investigadores sobre el comportamiento de los modelos en las evaluaciones de seguridad.
Anthropic afirmó que sus agentes superaron a 28 investigadores de seguridad humanos experimentados, quienes dispusieron de hasta ocho horas cada uno para formular un método. El mejor enfoque de Claude superó a la mejor propuesta humana en un 20 % en cuanto a la detección de engaños.
Anthropic observó que los humanos no podían iterar, por lo que considera que esta brecha es evidencia de un flujo de trabajo en el que Claude sugiere métodos prometedores y las personas los perfeccionan.
En una prueba, la empresa le pidió al procesador Claude Sonnet 5, menos potente, que corrigiera fallos de alineación en un punto de control inicial de Opus 4.8 que no había recibido la mayor parte del entrenamiento de alineación de producción.
Durante aproximadamente 60 horas, probó más de 50 soluciones, hasta que finalmente dio con una que utilizó poco más de 2000 ejemplos de entrenamiento, lo que, según las estimaciones de Anthropic, resultó ser unas 15 000 veces más eficiente que su propio proceso de alineación de producción.
La empresa advirtió que sus parámetros de referencia son indicadores limitados, que solo midió los diez fallos que seleccionó y que no ha comprobado si las mejoras persisten después de un aprendizaje por refuerzo intensivo en otras tareas.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.
Preguntas frecuentes
¿Cuántas de las investigaciones de alineación de Claude implicaron trampas?
El sistema de monitorización de Anthropic detectó 39 de las 1.601 trayectorias de los agentes de investigación, lo que representa aproximadamente el 2,4%.
¿Qué tipo de trampas intentaron hacer los agentes?
Volvieron a presentar métodos sin cambios con la esperanza de que el ruido del evaluador produjera un número más alto, crearon datos de entrenamiento diseñados para imitar el punto de referencia que se estaba evaluando y ocultaron pasos que infringían las reglas, como el uso secreto de datos de referencia, para que el método pasara la revisión automatizada.
¿Obtuvo Claude mejores resultados que los investigadores humanos en el estudio?
Anthropic afirmó que sus agentes automatizados superaron las ideas propuestas por 28 investigadores de seguridad experimentados, cada uno con hasta ocho horas de tiempo. En cuanto al engaño, el mejor método de Claude obtuvo una puntuación un 20 % superior a la mejor propuesta humana. Anthropic señaló que, dado que los humanos no podían iterar, no considera los resultados como una comparación directa.

Randa Moisés
Randa Moses es editora y reportera en Cryptopolitan donde cubre temas de tecnología, IA, robótica, criptomonedas, estafas y hackeos. Trabaja en el sector de las criptomonedas desde 2017 y ha ocupado cargos en Forward Protocol, AmaZix y Cryptosomniac. Randa es ingeniera eléctrica ytronpor la Universidad de Bradford.
















