IAEXPLICADO FÁCIL3 MIN

La inyección de prompts puede hacer que tu asistente de IA obedezca a un desconocido

Una orden escondida en una web o un documento puede cambiar lo que hace un agente. El riesgo depende tanto del contenido que lee como de los permisos que le has dado.

Candado sobre un teclado iluminado por luces rojas y verdes
Imagen: FlyD / Unsplash · Unsplash License
01

Cuando un documento intenta dar órdenes

Una inyección indirecta de prompts intenta que una IA trate un texto ajeno como una instrucción que debe obedecer. Por ejemplo, le pides resumir una página y esa página incluye una orden para cambiar la respuesta o compartir información. El fallo aparece si el asistente deja de usar el documento como material de consulta y empieza a seguir lo que le manda.

OWASP distingue los ataques directos de los indirectos. En los directos, la orden llega en el mensaje de quien interactúa con el modelo. En los indirectos, las instrucciones llegan mediante fuentes externas, como archivos o webs que el usuario pidió consultar. El usuario no tiene por qué haber escrito ni visto la orden maliciosa.

Esto no es lo mismo que una respuesta inventada por error. Hay un intento de influir en la conducta del sistema a través del contenido que procesa. Una IA puede resumir fielmente muchos documentos y seguir siendo vulnerable cuando uno de ellos contiene instrucciones diseñadas para desviar la tarea.

Manos con guantes escribiendo en un portátil, fotografía ilustrativa
Imagen: Towfiqu barbhuiya / Unsplash · Unsplash License
02

El daño depende de lo que pueda hacer el agente

En un chat sin herramientas, el resultado puede ser una respuesta manipulada. En un agente conectado al correo o a archivos privados, el riesgo crece si también puede enviar mensajes o modificar documentos. No basta con saber qué modelo usa: hay que mirar qué cuentas y qué operaciones tiene disponibles.

Anthropic separa la protección del modelo, del entorno y de las fuentes externas. Restringir técnicamente el acceso a una carpeta o impedir conexiones salientes limita lo que puede ocurrir incluso si la IA interpreta mal un texto. Pedirle que tenga cuidado no crea por sí solo ese bloqueo.

Consultar documentos mediante RAG tampoco los vuelve fiables. El sistema recupera pasajes relevantes, pero una orden maliciosa puede estar dentro del pasaje recuperado. Y ejecutar IA en local cambia dónde se procesan los datos, no convierte automáticamente en seguros los archivos que lee.

Escritorio con ordenador, auriculares y documentos junto a una ventana
Imagen: ehsan ahmadnejad / Pexels · Pexels License
03

Cuatro comprobaciones antes de conectar tus cuentas

Empieza con acceso de solo lectura cuando la tarea consista en consultar. Limita los archivos y las cuentas a los que realmente necesita entrar. Mantén una confirmación humana antes de enviar, borrar o publicar. Y prueba primero con datos sin valor privado para comprobar qué acciones propone el agente.

Al revisar una confirmación, mira el destinatario, los archivos adjuntos y el contenido que saldrá de tu cuenta. Un botón que solo diga «permitir» sin mostrar la acción ayuda poco. Las defensas automáticas pueden detectar parte de estos intentos, pero Anthropic explica por qué combina varias capas en lugar de confiar toda la protección a una única decisión del modelo.

Si el asistente propone una acción que no pediste, cancélala y revisa qué página o archivo acaba de consultar. Si ya salió información privada, desconecta la integración y comprueba el historial de actividad. Cambiar la contraseña corresponde cuando esa contraseña o el acceso a la cuenta puedan haberse comprometido, no como respuesta automática a cualquier texto sospechoso.

00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

TU SIGUIENTE RUTA

Sigue tirando del hilo de IA, seguridad y poder

Si este tema te interesa, estas tres piezas son el mejor lugar por el que seguir.

ABRIR EL TEMA COMPLETO
  1. 01Europa obliga a Google a abrir Android: ChatGPT, Claude o Perplexity podrán sustituir a Gemini de verdadIA · 4 MIN
  2. 02Europa multa a Google con 890 millones. Y la cifra es lo de menosIA · 4 MIN
  3. 03OpenAI y Anthropic quieren frenar la IA china. Jensen Huang cree que están cavando su propia tumbaIA · 5 MIN

SIGUE LEYENDO

También te puede interesar

PORTADA