Cuando un documento intenta dar órdenes
Una inyección indirecta de prompts intenta que una IA trate un texto ajeno como una instrucción que debe obedecer. Por ejemplo, le pides resumir una página y esa página incluye una orden para cambiar la respuesta o compartir información. El fallo aparece si el asistente deja de usar el documento como material de consulta y empieza a seguir lo que le manda.
OWASP distingue los ataques directos de los indirectos. En los directos, la orden llega en el mensaje de quien interactúa con el modelo. En los indirectos, las instrucciones llegan mediante fuentes externas, como archivos o webs que el usuario pidió consultar. El usuario no tiene por qué haber escrito ni visto la orden maliciosa.
Esto no es lo mismo que una respuesta inventada por error. Hay un intento de influir en la conducta del sistema a través del contenido que procesa. Una IA puede resumir fielmente muchos documentos y seguir siendo vulnerable cuando uno de ellos contiene instrucciones diseñadas para desviar la tarea.

El daño depende de lo que pueda hacer el agente
En un chat sin herramientas, el resultado puede ser una respuesta manipulada. En un agente conectado al correo o a archivos privados, el riesgo crece si también puede enviar mensajes o modificar documentos. No basta con saber qué modelo usa: hay que mirar qué cuentas y qué operaciones tiene disponibles.
Anthropic separa la protección del modelo, del entorno y de las fuentes externas. Restringir técnicamente el acceso a una carpeta o impedir conexiones salientes limita lo que puede ocurrir incluso si la IA interpreta mal un texto. Pedirle que tenga cuidado no crea por sí solo ese bloqueo.
Consultar documentos mediante RAG tampoco los vuelve fiables. El sistema recupera pasajes relevantes, pero una orden maliciosa puede estar dentro del pasaje recuperado. Y ejecutar IA en local cambia dónde se procesan los datos, no convierte automáticamente en seguros los archivos que lee.

Cuatro comprobaciones antes de conectar tus cuentas
Empieza con acceso de solo lectura cuando la tarea consista en consultar. Limita los archivos y las cuentas a los que realmente necesita entrar. Mantén una confirmación humana antes de enviar, borrar o publicar. Y prueba primero con datos sin valor privado para comprobar qué acciones propone el agente.
Al revisar una confirmación, mira el destinatario, los archivos adjuntos y el contenido que saldrá de tu cuenta. Un botón que solo diga «permitir» sin mostrar la acción ayuda poco. Las defensas automáticas pueden detectar parte de estos intentos, pero Anthropic explica por qué combina varias capas en lugar de confiar toda la protección a una única decisión del modelo.
Si el asistente propone una acción que no pediste, cancélala y revisa qué página o archivo acaba de consultar. Si ya salió información privada, desconecta la integración y comprueba el historial de actividad. Cambiar la contraseña corresponde cuando esa contraseña o el acceso a la cuenta puedan haberse comprometido, no como respuesta automática a cualquier texto sospechoso.
La conversación empieza aquí
Accede con una cuenta de apoyo para comentar. Entrar




Todavía no ha comentado nadie. ¿Estrenas tú?