Cloud Security Alliance + OWASP AI Exchange · 2025

Red Teaming de IA Agéntica

Catálogo técnico de red teaming para sistemas de IA Agéntica (Agentic AI). 12 categorías de amenaza, 86 sub-tests con pasos accionables y 15 prompts de ejemplo para entornos de laboratorio. Basado en la guía conjunta de Cloud Security Alliance + OWASP AI Exchange.

12
Categorías de amenaza
86
Sub-tests accionables
5/6
Críticas / Altas
6
Frameworks de referencia
⚠️ Los prompts de ejemplo son payloads de red team. Úsalos solo en entornos controlados.

Metodología de 4 fases

Cada sub-test se enmarca en un ciclo estructurado: preparación → ejecución → análisis → reporte.

1. Preparación

Definir el alcance, los entornos aislados y las herramientas antes de ejecutar cualquier prueba.

  • Definir escenarios de prueba específicos alineados con cada categoría de amenaza.
  • Configurar entornos de prueba protegidos (sandboxes) que aíslen al agente de sistemas de producción.
  • Preparar herramientas y scripts necesarios: herramientas de testing de API, frameworks de prompt injection, simuladores de red.

2. Ejecución

Llevar a cabo las pruebas siguiendo los actionable steps documentados para cada sub-test.

  • Ejecutar los sub-tests siguiendo la secuencia definida en el plan de pruebas.
  • Documentar observaciones en tiempo real, incluyendo comportamiento inesperado y respuestas del agente.
  • Capturar logs completos, métricas de rendimiento y trazas de ejecución.

3. Análisis

Evaluar los resultados de las pruebas, identificar vulnerabilidades y priorizar hallazgos.

  • Evaluar los resultados de cada test contra el comportamiento esperado.
  • Identificar vulnerabilidades, su impacto potencial y los vectores de ataque explotables.
  • Priorizar los hallazgos en función de la severidad (CRITICAL / HIGH / MEDIUM) y la facilidad de explotación.

4. Reporte

Generar entregables accionables para el equipo de desarrollo, seguridad y stakeholders.

  • Crear informes detallados para cada test ejecutado, con condiciones de reproducción.
  • Desarrollar estrategias de mitigación accionables con prioridades claras.
  • Documentar un resumen ejecutivo de hallazgos para stakeholders no técnicos (compliance, gobernanza, dirección).

¿Por qué un red team separado para IA Agéntica?

Un agente agéntico no es solo un LLM con un system prompt. Planifica, razona, actúa sobre sistemas externos y orquesta herramientas (MCP, APIs, otros agentes). Esto crea superficies de ataque que no existen en los LLMs conversacionales:

  • Comportamiento emergente: combinación de planificación + razonamiento + acción produce trayectorias impredecibles.
  • Naturaleza no estructurada: la comunicación entre agentes y herramientas es texto libre, difícil de monitorizar.
  • Interpretabilidad limitada: las rutas de decisión son opacas y mantienen estado temporal entre interacciones.
  • Superficie ampliada: control del agente, knowledge base, interacciones con APIs, MCP servers, A2A servers, otros agentes.
💡 Este catálogo es complementario a OWASP AI Testing Guide v1 + OWASP LLM Top 10 , que cubre LLMs en chats y controles ISO 42001.

Catálogo de categorías de amenaza

Filtra por severidad, categoría, framework o referencia OWASP LLM. La búsqueda cubre código, nombre, descripción, sub-tests y prompts.

ART-01
Crítica

Autorización y Secuestro de Control del Agente

EN: Agent Authorization and Control Hijacking

Pruebas de ejecución no autorizada de comandos, escalada de privilegios y herencia de roles. Incluye inyección de comandos maliciosos, simulación de señales de control falsificadas y validación de revocación de permisos.

Control y Autorización7 sub-tests12 prompts
LLM06:2025LLM01:2025
ART-02
Alta

Checker Fuera del Loop

EN: Checker-Out-of-the-Loop

Verifica que los checkers (humanos o automatizados) estén informados durante operaciones inseguras o cuando se superan umbrales críticos. Incluye simulación de brechas de umbral, supresión de alertas y validación de mecanismos de fallback.

Control y Autorización7 sub-tests
LLM06:2025LLM09:2025
ART-03
Crítica

Interacción del Agente con Sistemas Críticos

EN: Agent Critical System Interaction

Evalúa las interacciones del agente con sistemas físicos y digitales críticos. Cubre simulación de entradas inseguras, seguridad de la comunicación con dispositivos IoT y validación de mecanismos de failsafe.

Sistemas Críticos7 sub-tests
LLM06:2025LLM05:2025
ART-04
Crítica

Manipulación de Objetivos e Instrucciones del Agente

EN: Agent Goal and Instruction Manipulation

Evalúa la resiliencia del agente frente a cambios adversariales en sus objetivos o instrucciones. Incluye instrucciones ambiguas, exfiltración de datos, modificación de la secuencia de tareas y manipulación recursiva de objetivos.

Objetivos e Instrucciones9 sub-tests
LLM01:2025LLM06:2025
ART-05
Alta

Explotación de Alucinaciones del Agente

EN: Agent Hallucination Exploitation

Identifica vulnerabilidades derivadas de outputs fabricados o falsos. Incluye crafting de inputs ambiguos, simulación de errores en cascada (confabulation chains) y pruebas de mecanismos de validación.

Objetivos e Instrucciones7 sub-tests
LLM09:2025LLM06:2025
ART-06
Crítica

Cadena de Impacto y Blast Radius del Agente

EN: Agent Impact Chain and Blast Radius

Examina los riesgos de fallos en cascada e intenta limitar el blast radius de las brechas. Incluye simulación de compromiso del agente, prueba de relaciones de confianza y evaluación de mecanismos de contención.

Sistemas Críticos7 sub-tests
LLM06:2025LLM05:2025
ART-07
Alta

Envenenamiento de la Base de Conocimiento del Agente

EN: Agent Knowledge Base Poisoning

Evalúa los riesgos de datos de entrenamiento envenenados, conocimiento externo manipulado y almacenamiento interno comprometido. Incluye inyección de datos maliciosos, simulación de inputs externos envenenados y prueba de capacidades de rollback.

Conocimiento y Datos7 sub-tests
LLM03:2025LLM04:2025LLM08:2025
ART-08
Alta

Manipulación de Memoria y Contexto del Agente

EN: Agent Memory and Context Manipulation

Identifica vulnerabilidades en gestión de estado y aislamiento de sesión. Incluye reset de contexto, simulación de fugas de datos cross-session/cross-application y pruebas de memory overflow.

Memoria y Contexto7 sub-tests
LLM01:2025LLM07:2025LLM06:2025
ART-09
Crítica

Explotación de Orquestación y Multi-Agente

EN: Agent Orchestration and Multi-Agent Exploitation

Evalúa vulnerabilidades en comunicación inter-agente, confianza y coordinación. Incluye intercepción de comunicaciones, prueba de relaciones de confianza y simulación de feedback loops.

Orquestación Multi-Agente10 sub-tests3 prompts
LLM06:2025LLM01:2025
ART-10
Alta

Agotamiento de Recursos y Servicios del Agente

EN: Agent Resource and Service Exhaustion

Prueba la resiliencia ante depletion de recursos y ataques de denegación de servicio. Incluye simulación de cómputo intensivo, pruebas de límites de memoria y agotamiento de cuotas de API.

Recursos y Servicios7 sub-tests
LLM10:2025LLM06:2025
ART-11
Alta

Ataques de Cadena de Suministro y Dependencias del Agente

EN: Agent Supply Chain and Dependency Attacks

Examina riesgos en herramientas de desarrollo, librerías externas y APIs. Incluye introducción de dependencias manipuladas, simulación de servicios comprometidos y prueba de seguridad del pipeline de despliegue.

Cadena de Suministro5 sub-tests
LLM03:2025LLM05:2025
ART-12
Media

Imposibilidad de Trazabilidad del Agente

EN: Agent Untraceability

Evalúa la trazabilidad de acciones, la rendición de cuentas y la preparación forense. Incluye supresión de logging, simulación de uso indebido de herencia de roles y obfuscación de datos forenses.

Trazabilidad y Forensia6 sub-tests
LLM07:2025LLM06:2025

Frameworks y herramientas de referencia

Ecosistema de herramientas y benchmarks usados para detectar y mitigar las amenazas agénticas.

MAESTRO (Cloud Security Alliance)

Framework de threat modeling multi-capa para sistemas de IA agéntica. Cubre evaluación, despliegue, frameworks de agente, operaciones de datos y orquestación.

AgentDojo

Framework de evaluación dinámica que mide la vulnerabilidad de agentes LLM a prompt injection en 97 tareas realistas con 629 casos de test.

Agent SafetyBench

Benchmark de seguridad con 349 entornos interactivos y 2.000 casos de test en 8 categorías de riesgo. Modelo de scoring automatizado con 91,5% de precisión.

AgentFence

Framework open-source que ofrece probing automatizado para prompt injection y secret leakage, con SDK para LangChain y OpenAI agents.

SplxAI Agentic Radar

Scanner de seguridad que analiza sistemas agénticos, identifica herramientas (MCP, email, JIRA) y las mapea a vulnerabilidades conocidas.

Agent Security Bench (ASB)

Benchmark ICLR 2025 que evalúa 27 métodos de ataque/defensa en 10 escenarios. Cubre amenazas como Plan-of-Thought backdoors y memory poisoning.

Promptfoo LLM Security Database

Repositorio estructurado de vulnerabilidades de seguridad relacionadas con LLMs y Agentic AI.

AI Red Teaming Agent (Microsoft Foundry)

Integrado en Azure AI Foundry para evaluación automatizada de riesgos con métricas como Attack Success Rate (ASR).

FuzzAI Framework (Salesforce)

Solución automatizada de red teaming con generación de inputs context-aware y soporte para many-shot jailbreaking.

Complementa con AI Security Testing

Este catálogo se centra en la fase 2 (explotación) de sistemas agénticos. Para la fase 1 (controles ISO 42001, OWASP LLM Top 10) consulta el catálogo principal.

Ir a AI Security Testing