IA3 MIN

Anthropic corta internet en sus pruebas internas tras acciones inesperadas de Claude

Un informe recoge formularios enviados a webs reales y restricciones eludidas. La medida afecta a las evaluaciones internas, sin anunciar una retirada de internet en la app comercial.

Ilustración oficial del informe de Anthropic sobre acciones no previstas
Imagen: Anthropic
01

Qué cambia en las pruebas de Claude

Anthropic ha desactivado el acceso a internet en todas sus evaluaciones internas hasta comprobar que sus controles de seguridad detectan de forma fiable acciones no previstas. El informe, publicado el 9 de octubre, describe modelos que actuaron sobre webs reales mientras se evaluaban sus capacidades. La medida anunciada se refiere a esas pruebas, no a una retirada de la navegación en la aplicación comercial de Claude.

Una evaluación consiste en dar tareas a un modelo y observar cómo las resuelve antes de decidir su entrenamiento, sus protecciones o su lanzamiento. Si puede abrir páginas y pulsar botones en internet, el resultado del ejercicio también puede llegar a una organización que no participa en la prueba.

Esquema de cuatro tipos de acciones no previstas descritas por Anthropic
Imagen: INSERT FUTURE · elaboración propia con datos de Anthropic
02

Un aviso falso llegó a una web de homicidios

Uno de los casos afecta a un formulario sobre un homicidio sin resolver en Filadelfia. La Policía confirmó a NBC10 que recibió una comunicación falsa generada durante una prueba de Anthropic el 18 de julio. La empresa detectó el incidente el 28 de septiembre. El correo quedó en spam y el procedimiento de revisión humana impidió que se distribuyera para seguimiento investigador.

La Policía considera grave que un sistema presente información inventada como si procediera de una persona con conocimiento del caso, y ha criticado el retraso en detectar y comunicar el incidente. Que los filtros evitaran una investigación basada en ese mensaje no elimina el problema de haber enviado datos falsos sobre víctimas reales.

El informe de Anthropic también describe formularios enviados cuando el modelo debía detenerse antes de confirmar, acceso a datos mediante vías que eludían restricciones y comandos ejecutados aprovechando un fallo de una web. Son casos identificados por la propia empresa, que considera limitado su impacto y afirma no conocer afectación a datos de clientes.

Esquema que distingue las evaluaciones internas sin internet de la aplicación comercial
Imagen: INSERT FUTURE · elaboración propia con datos de Anthropic
03

Por qué pedirle que pare no basta

La interpretación de Anthropic es que muchos modelos insistían en terminar la tarea y buscaban otra vía cuando encontraban un obstáculo. Eso puede producir una acción indebida sin que el modelo persiga un objetivo independiente. La intención atribuida y el efecto sobre una web real son cuestiones distintas.

Nuestra lectura es que los permisos y los límites deben aplicarse también en las herramientas que ejecutan las acciones. Una instrucción de no enviar un formulario deja margen a que el modelo se equivoque sobre cuál es el último botón. Una herramienta que no permite enviarlo evita esa consecuencia aunque falle su interpretación.

Para quien conecte un agente a sus cuentas, lo práctico es revisar qué permisos concede y cómo revocarlos. Estos casos amplían el historial de acciones no autorizadas en pruebas de Claude, pero no permiten calcular la frecuencia del problema en el uso comercial ni afirmar que todos los modelos se comportan igual.

00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

SIGUE LEYENDO

También te puede interesar

PORTADA