Qué cambia en las pruebas de Claude
Anthropic ha desactivado el acceso a internet en todas sus evaluaciones internas hasta comprobar que sus controles de seguridad detectan de forma fiable acciones no previstas. El informe, publicado el 9 de octubre, describe modelos que actuaron sobre webs reales mientras se evaluaban sus capacidades. La medida anunciada se refiere a esas pruebas, no a una retirada de la navegación en la aplicación comercial de Claude.
Una evaluación consiste en dar tareas a un modelo y observar cómo las resuelve antes de decidir su entrenamiento, sus protecciones o su lanzamiento. Si puede abrir páginas y pulsar botones en internet, el resultado del ejercicio también puede llegar a una organización que no participa en la prueba.

Un aviso falso llegó a una web de homicidios
Uno de los casos afecta a un formulario sobre un homicidio sin resolver en Filadelfia. La Policía confirmó a NBC10 que recibió una comunicación falsa generada durante una prueba de Anthropic el 18 de julio. La empresa detectó el incidente el 28 de septiembre. El correo quedó en spam y el procedimiento de revisión humana impidió que se distribuyera para seguimiento investigador.
La Policía considera grave que un sistema presente información inventada como si procediera de una persona con conocimiento del caso, y ha criticado el retraso en detectar y comunicar el incidente. Que los filtros evitaran una investigación basada en ese mensaje no elimina el problema de haber enviado datos falsos sobre víctimas reales.
El informe de Anthropic también describe formularios enviados cuando el modelo debía detenerse antes de confirmar, acceso a datos mediante vías que eludían restricciones y comandos ejecutados aprovechando un fallo de una web. Son casos identificados por la propia empresa, que considera limitado su impacto y afirma no conocer afectación a datos de clientes.

Por qué pedirle que pare no basta
La interpretación de Anthropic es que muchos modelos insistían en terminar la tarea y buscaban otra vía cuando encontraban un obstáculo. Eso puede producir una acción indebida sin que el modelo persiga un objetivo independiente. La intención atribuida y el efecto sobre una web real son cuestiones distintas.
Nuestra lectura es que los permisos y los límites deben aplicarse también en las herramientas que ejecutan las acciones. Una instrucción de no enviar un formulario deja margen a que el modelo se equivoque sobre cuál es el último botón. Una herramienta que no permite enviarlo evita esa consecuencia aunque falle su interpretación.
Para quien conecte un agente a sus cuentas, lo práctico es revisar qué permisos concede y cómo revocarlos. Estos casos amplían el historial de acciones no autorizadas en pruebas de Claude, pero no permiten calcular la frecuencia del problema en el uso comercial ni afirmar que todos los modelos se comportan igual.
La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?