Manipulación de Objetivos e Instrucciones del Agente
EN: Agent Goal and Instruction Manipulation
Un agente opera persiguiendo objetivos. Si un atacante puede alterar —directa o indirectamente— qué objetivos persigue el agente o qué instrucciones sigue, el agente ejecutará acciones no deseadas manteniendo la apariencia de operar normalmente. Esta categoría cubre ataques sutiles: instrucciones ambiguas, envenenamiento de la cola de tareas, manipulación semántica, subversión recursiva de objetivos, manipulación jerárquica y adaptativa, y extracción de objetivos internos. Es una evolución de la prompt injection orientada a agentes: en lugar de forzar una respuesta puntual, se reorienta la trayectoria de decisiones.
Resumen de la amenaza
Contexto, impacto y entregables del red team
Descripción detallada
Un agente opera persiguiendo objetivos. Si un atacante puede alterar —directa o indirectamente— qué objetivos persigue el agente o qué instrucciones sigue, el agente ejecutará acciones no deseadas manteniendo la apariencia de operar normalmente. Esta categoría cubre ataques sutiles: instrucciones ambiguas, envenenamiento de la cola de tareas, manipulación semántica, subversión recursiva de objetivos, manipulación jerárquica y adaptativa, y extracción de objetivos internos. Es una evolución de la prompt injection orientada a agentes: en lugar de forzar una respuesta puntual, se reorienta la trayectoria de decisiones.
Por qué importa
Un atacante puede redirigir al agente hacia acciones dañinas sin necesidad de un prompt de jailbreak obvio: basta con manipular objetivos intermedios.
La subversión recursiva de objetivos es difícil de detectar porque el agente sigue 'cumpliendo' su misión aparente.
La manipulación de instrucciones en sistemas multi-agente se propaga a través de relaciones de confianza.
La extracción de objetivos internos revela la lógica de negocio y los activos prioritarios del agente.
Objetivo de las pruebas
Probar la resiliencia de los agentes IA frente a la manipulación de objetivos e instrucciones, centrándose en su capacidad de mantener los comportamientos previstos bajo varios escenarios de explotación.
Entregables del red team
Vulnerabilidades en la integridad de objetivos y recomendaciones para mejorar la validación de instrucciones.
Logs de intentos de manipulación con sus condiciones de reproducción.
Mapa de relaciones de confianza entre agentes susceptibles a propagación de instrucciones maliciosas.