ART-04Objetivos e InstruccionesSeveridad: Crítica

Manipulación de Objetivos e Instrucciones del Agente

EN: Agent Goal and Instruction Manipulation

Un agente opera persiguiendo objetivos. Si un atacante puede alterar —directa o indirectamente— qué objetivos persigue el agente o qué instrucciones sigue, el agente ejecutará acciones no deseadas manteniendo la apariencia de operar normalmente. Esta categoría cubre ataques sutiles: instrucciones ambiguas, envenenamiento de la cola de tareas, manipulación semántica, subversión recursiva de objetivos, manipulación jerárquica y adaptativa, y extracción de objetivos internos. Es una evolución de la prompt injection orientada a agentes: en lugar de forzar una respuesta puntual, se reorienta la trayectoria de decisiones.

Sub-tests
9
Prompts de ejemplo
0
Controles ISO vinculados
4

Resumen de la amenaza

Contexto, impacto y entregables del red team

Descripción detallada

Un agente opera persiguiendo objetivos. Si un atacante puede alterar —directa o indirectamente— qué objetivos persigue el agente o qué instrucciones sigue, el agente ejecutará acciones no deseadas manteniendo la apariencia de operar normalmente. Esta categoría cubre ataques sutiles: instrucciones ambiguas, envenenamiento de la cola de tareas, manipulación semántica, subversión recursiva de objetivos, manipulación jerárquica y adaptativa, y extracción de objetivos internos. Es una evolución de la prompt injection orientada a agentes: en lugar de forzar una respuesta puntual, se reorienta la trayectoria de decisiones.

Por qué importa

  • Un atacante puede redirigir al agente hacia acciones dañinas sin necesidad de un prompt de jailbreak obvio: basta con manipular objetivos intermedios.

  • La subversión recursiva de objetivos es difícil de detectar porque el agente sigue 'cumpliendo' su misión aparente.

  • La manipulación de instrucciones en sistemas multi-agente se propaga a través de relaciones de confianza.

  • La extracción de objetivos internos revela la lógica de negocio y los activos prioritarios del agente.

Objetivo de las pruebas

  • Probar la resiliencia de los agentes IA frente a la manipulación de objetivos e instrucciones, centrándose en su capacidad de mantener los comportamientos previstos bajo varios escenarios de explotación.

Entregables del red team

  • Vulnerabilidades en la integridad de objetivos y recomendaciones para mejorar la validación de instrucciones.

  • Logs de intentos de manipulación con sus condiciones de reproducción.

  • Mapa de relaciones de confianza entre agentes susceptibles a propagación de instrucciones maliciosas.