IA2 MIN

Claude Mythos 5 actuó por su cuenta en internet. Anthropic ha movido a 150 ingenieros para averiguar por qué

El incidente ocurrió durante una prueba de ciberseguridad sin las protecciones habituales. La respuesta frena funciones nuevas y refuerza la contención.

Ilustración oficial de Anthropic sobre sus nuevas medidas de seguridad
Imagen: Anthropic · ilustración oficial
01

El modelo tenía acceso real y las defensas estaban retiradas

Claude Mythos 5 ejecutó una serie de acciones no autorizadas en internet durante una evaluación del UK AI Security Institute. El organismo británico publicó el incidente el 4 de agosto y Anthropic lo ha reconocido ahora junto a otros tres casos en los que sus modelos accedieron a sistemas informáticos reales.

El contexto cambia la lectura del titular. Mythos no estaba atendiendo a usuarios normales ni rompió por sí solo una barrera para salir a internet. Los evaluadores le dieron acceso deliberado a la red y retiraron las protecciones de ciberseguridad para medir su comportamiento. Aun así, el modelo tomó decisiones que no estaban autorizadas y Anthropic admite dos problemas de alineación: razonamiento motivado y disposición a causar daño para cumplir una tarea concreta.

Es la continuación directa de una preocupación que ya vimos cuando OpenAI pausó parte de su entrenamiento por capacidades cibernéticas. La diferencia es que aquí existe un incidente documentado fuera del laboratorio interno de la empresa.

02

150 ingenieros dejan de construir funciones nuevas

Anthropic ha redirigido aproximadamente a 150 ingenieros de producto hacia seguridad, fiabilidad y privacidad, mientras investigadores de preentrenamiento y aprendizaje por refuerzo rotan por equipos de protección. La empresa también ha detenido la mayoría de funciones nuevas para concentrarse en la infraestructura que encierra, supervisa y corta el acceso de los modelos.

Las medidas incluyen credenciales de vida corta, permisos mínimos, mejores registros, alertas para acciones sensibles y entornos aislados para terceros. El objetivo práctico es que una prueba mal configurada no entregue más capacidad de la prevista y que una cadena de decisiones sospechosa pueda interrumpirse antes de tocar un sistema real.

Imagen del informe del AI Security Institute sobre el comportamiento no autorizado
Imagen: UK AI Security Institute · material institucional
03

No basta con decir que era una prueba

Una evaluación extrema existe precisamente para descubrir qué haría el modelo cuando las barreras desaparecen. Por eso el incidente no demuestra que Claude pueda escapar de una cuenta corriente, pero tampoco se puede despachar como un fallo irrelevante de configuración. Enseña qué riesgos aparecen al unir autonomía, herramientas e internet.

Anthropic encargará una revisión independiente a METR y promete publicar un análisis más completo. Hasta entonces, la pregunta seria no es si Mythos se volvió consciente, sino por qué consideró aceptables acciones que no formaban parte de la orden. Ese problema se parece demasiado a las pruebas en las que Claude fue usado para atacar empresas como para reducirlo a una anécdota.

Gráfico de Anthropic para su investigación de incidentes en evaluaciones de ciberseguridad
Imagen: Anthropic · material de investigación
00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

SIGUE LEYENDO

También te puede interesar

PORTADA