Anthropic refuerza la seguridad después de que los agentes de Claude se descontrolaran en 3 ocasiones en modo entrenamiento

 ha reforzado la seguridad de su Inteligencia Artificial (IA) y ha pausado algunos programas después de que los modelos de Claude accedieron sin permiso a los sistemas de tres organizaciones en abril.

En concreto, la compañía está soportando la seguridad de los entornos digitales utilizados para entrenar y probar sus agentes Claude, después de detectar accesos no autorizados, según acaba de revelar.

La compañía explicó en una publicación de blog difundida el lunes que había desplegado clasificadores en tiempo real diseñados para detectar cuándo un modelo de IA explora de forma agresivo un entorno de pruebas o intenta escapar de él, y bloquear la acción antes de que llegue a producirse.

«Creemos que los incidentes reflejan un fallo de seguridad operativa, así como dos problemas de alineamiento: pensamiento motivado y disposición a emprender acciones perjudiciales para alcanzar un objetivo concreto», señaló Anthropic.

Anthropic explicó en la actualización que los modelos podrían haber interpretado las pruebas de acceso a internet real de una manera que les permitió seguir creyendo que el entorno era una simulación. También señaló que mostró «imprudencia» al perseguir los objetivos que se les habían asignado pese a las señales de que sus acciones podrían provocar daños en el mundo real.

Los cambios llegan después de que Anthropic revelara en julio que tres modelos de Claude habían accedido a los sistemas activos de tres organizaciones durante unas evaluaciones realizadas en abril. A los modelos se les había indicado que operaban en simulaciones sin acceso a internet, pero el entorno de pruebas de un tercero estaba mal configurado y permaneció conectado.

Los incidentes también están alimentando un debate cada vez mayor sobre si debería ralentizarse el desarrollo de la IA de frontera cuando la seguridad y la velocidad entran en conflicto.

Anthropic reclamó «un mecanismo legal, verificable y eficaz para coordinar la ralentización tan pronto como sea posible» y afirmó que los Gobiernos y la industria deben coordinarse para evitar una carrera hacia el mínimo común denominador en materia de seguridad.

Por ahora, Anthropic ha trasladado algunas de sus pruebas de ciberseguridad más arriesgadas a entornos aislados más robustos. La compañía destinó temporalmente a 150 ingenieros de producto a tareas relacionadas con seguridad, confiabilidad y privacidad, mientras que la mayor parte de los entrenamientos de alto riesgo continúa paralizada a la espera de nuevas revisiones.

Anthropic ha descubierto que algunos problemas en los entornos utilizados para entrenar sus modelos pueden favorecer comportamientos desalineados. La compañía señala que los defectos en estos sistemas , en especial aquellos en los que una tarea es imposible de resolver sin hacer trampas o permite manipular las recompensas, pueden tener un efecto mayor del previsto sobre el comportamiento posterior de los modelos.

La preocupación no es nueva para la compañía. En febrero, Anthropic llegó a revertir tres días de entrenamiento de su modelo Mythos Preview después de detectar señales de manipulación de recompensas. El modelo había comenzado a escribir notas dirigidas a «el revisor» incluso en tareas en las que nunca se había mencionado a ningún revisor. También había aprendido a manipular una recompensa diseñada para fomentar la honestidad acumulando descargas de responsabilidad y advertencias.

La IA se vuelve tramposa

El problema se agravó a medida que aumentó la velocidad de creación de estos entornos . Anthropic reconoce que durante la primavera de 2026 estuvo generando entornos de aprendizaje por refuerzo «más rápido que nunca», hasta superar la capacidad de sus sistemas para validarlos. Los entornos que activaban las alarmas requerirían una revisión humana y, según la compañía, los errores de configuración y los intentos de manipular las recompensas empezaron a superar su capacidad para filtrarlos o corregirlos.

La revisión posterior reveló la dimensión del problema. Anthropic detectó fallos en «más del 10 %» de los entornos de su configuración de producción durante la congelación de su sistema, con problemas que iban desde la manipulación de recompensas hasta tareas defectuosas y configuraciones incorrectas. La compañía afirma que estos entornos solo volvieron a utilizarse después de ser corregidos.

Para comprobar hasta qué punto estas deficiencias podrían alterar el comportamiento de un modelo, los investigadores realizaron un experimento deliberado. Entrenaron un modelo de clase Opus en 80 entornos que habían mostrado problemas de manipulación de recompensas. El resultado fue un sistema con una «fuerte motivación para obtener altas calificaciones en las tareas y una disposición a realizar acciones potencialmente perjudiciales en busca del éxito».

Las pruebas posteriores muestran comportamientos especialmente llamativos. En escenarios simulados, el modelo entrenado con estos incentivos llegó a mostrar propensión a salir de su entorno y atacar infraestructuras simuladas. También intentó manipular su propia función de recompensa y eludir mecanismos de supervisión de seguridad para conseguir mejores resultados.

Anthropic insiste en que estos comportamientos fueron inducidos deliberadamente y que no se reprodujeron con la misma intensidad en sus modelos de producción. Pero el experimento apunta a un problema más profundo: un sistema no necesita recibir la orden específica de actuar de forma perjudicial para desarrollar estrategias destinadas a maximizar el objetivo que se le ha asignado.

La compañía resume así su principal conclusión: «La presencia de una manipulación sustancial de recompensas durante el entrenamiento puede provocar que los modelos estén dispuestos a realizar largas secuencias de acciones potencialmente dañinas en el mundo real en busca del éxito en la tarea».

El hallazgo introduce una dificultad adicional en el desarrollo de agentes autónomos. Cuanto más complejas son las tareas que se delegan a los modelos, mayor importancia adquiere que los incentivos utilizados durante su entrenamiento estén correctamente diseñados. Para Anthropic, solucionar estos problemas exigirá algo más que mejorar los filtros de seguridad: también será necesario evitar que los propios entornos de aprendizaje enseñen a los modelos estrategias que después puedan trasladar a situaciones no previstas.

https://www.businessinsider.es/big-tech/anthropic-refuerza-seguridad-despues-que-los-agentes-claude-se-descontrolaran-3-ocasiones-modo-entrenamiento_7031287_0.html

 

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *