OWASP AI Testing Guide v1 · ISO/IEC 42001 · EU AI Act

AI Security Testing

Catálogo técnico de testing de seguridad para IA basado en el OWASP AI Testing Guide v1 y el OWASP LLM Top 10. Cada ficha demuestra gobernanza (qué controlar), operación (cómo se testea) y remediación (cómo se arregla).

22
Controles totales
20
Críticos / Altos
5
Anexos ISO 42001
10
Refs OWASP LLM

1. Control GRC

Requisito normativo y objetivo de cumplimiento (ISO 42001 / EU AI Act / ENS).

2. Vector de Explotación

Cómo un atacante rompe el control. Incluye PoC, prompts de laboratorio y técnicas de testing.

3. Evaluación de Impacto

Daño operativo, de seguridad y normativo si el control falla (AIA / Risk).

4. Remediación & Hardening

Arquitectura, código y controles de gestión para mitigar el riesgo.

CTRL-AI-0012
Alta

Protección del System Prompt

Salvaguarda de prompts de sistema, datos de contexto confidencial y secretos de negocio contra lecturas no autorizadas o volcados directos mediante interacciones de usuario. Validado en entorno de laboratorio (Lakera Guard).

LLM01:2025LLM06:2025AITG-APP-01AITG-APP-07
Application
Gobernanza y Operación de Modelos
Ver ficha
CTRL-AI-001.2Variante
Crítica

System Prompt · Nivel 2 (Control Token Injection)

Variante evolucionada del CTRL-AI-001. Bypass de guardrails de entrada mediante inyección de tokens de control ChatML (<|im_end|>, <|im_start|>) y suplantación del canal de sistema. Score de laboratorio: 95/100.

LLM01:2025LLM06:2025AITG-APP-01AITG-APP-02AITG-APP-07
Application
Gobernanza y Operación de Modelos
Ver ficha
CTRL-AI-001.3Variante
Crítica

System Prompt · Nivel 3 (Payload Smuggling)

Tercera variante de CTRL-AI-001. Bypass de máquina de estados y guardrails en dos fases: (1) cumplimiento parcial de variables de negocio para validar la solicitud + (2) imposición de esquema JSON estructurado que fuerza la exfiltración de instrucciones. Score de laboratorio: 99/100.

LLM01:2025LLM06:2025AITG-APP-01AITG-APP-04AITG-APP-07
Application
Gobernanza y Operación de Modelos
Ver ficha
CTRL-AI-002.1Variante
Alta

Tool Use · Control de Acceso e Identidad

Validación de la identidad del usuario en la capa de ejecución de herramientas (Tool Use) expuestas a un agente de IA. Evita que el LLM pueda inyectar parámetros de identidad (ej. remitente From) para suplantar usuarios corporativos o escalar privilegios. Score de laboratorio: 100/100.

LLM02:2025LLM07:2025AITG-APP-06AITG-INF-04
ApplicationInfrastructure
Seguridad en Integraciones de Agentes (Tool Use & Action Execution)
Ver ficha
CTRL-AI-002.2Variante
Alta

Tool Use · Control de Acceso e Identidad · Nivel 2

Evasión de los guardrails de identidad del agente mediante inyección de contexto de negocio (perfiles ejecutivos, plantillas, aliases) que induce al LLM a aplicar un remitente no autorizado. Score de laboratorio: 100/100 con bypass de guardrail.

LLM01:2025LLM02:2025AITG-APP-01AITG-APP-06AITG-INF-03AITG-INF-04
ApplicationInfrastructure
Seguridad en Integraciones de Agentes (Tool Use & Action Execution)
Ver ficha
CTRL-AI-0033
Crítica

Output Filtering · Sensitive Data Leak

Prevención de fugas de datos confidenciales (PII, credenciales, API keys, env vars, herramientas, parámetros internos) en las respuestas del LLM. Cubre los 9 payloads de AITG-APP-03 con detección automática de secrets, redacción determinista, allowlist de herramientas y sandboxing de reasoning.

LLM02:2025AITG-APP-03
ApplicationData
Output Filtering / DLP for LLMs
Ver ficha
CTRL-AI-0051
Crítica

Output Handling · Improper Output Handling

Validación, saneamiento y aislamiento de las salidas generadas por el LLM antes de ser ejecutadas, renderizadas o persistidas por sistemas downstream. Cubre 17 vectores de AITG-APP-05: XSS, SQLi, shell injection, path traversal, markdown exfiltración y unicode smuggling. Valida que la aplicación no confíe ciegamente en la respuesta del modelo.

LLM05:2025AITG-APP-05
Application
Output Security / Post-Processing de Respuestas LLM
Ver ficha
CTRL-AI-0081
Crítica

RAG Security · Vector & Embedding Weaknesses

Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.

LLM08:2025LLM04:2025AITG-APP-08
ApplicationData
RAG Security / Vector Database
Ver ficha
CTRL-AI-0092
Media

Overreliance · Hallucinations & Misinformation

Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.

LLM09:2025LLM02:2025AITG-APP-11
ApplicationModel
Output Reliability / Trustworthy AI
Ver ficha
CTRL-AI-0102
Crítica

Model Theft · Model Extraction Attacks

Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.

LLM10:2025LLM02:2025AITG-APP-09
ApplicationModel
Model IP Protection / Adversarial ML
Ver ficha
CTRL-AI-0122
Alta

Content Safety · Toxic Output Prevention

Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).

LLM09:2025AITG-APP-12
ApplicationModel
Content Safety / Trustworthy AI
Ver ficha
CTRL-AI-0132
Media

Content Bias · Fairness & RAI

Detección y mitigación de sesgos en las respuestas del LLM: posicional, estereotipado (género, etnia, geografía), framing, anchoring y status quo. Cubre los 5 payloads de AITG-APP-10 con métricas de fairness (equalized odds, demographic parity) y zero-shot/few-shot unbiasing.

LLM09:2025AITG-APP-10
ApplicationModel
Responsible AI / Fairness & Bias Mitigation
Ver ficha
CTRL-AI-0143
Crítica

Model Robustness · Adversarial & OOD

Defensa del modelo contra adversarial perturbations (FGSM, PGD, AutoAttack) en múltiples modalidades (image, text, audio, binary) y contra distribution shift / OOD inputs. Cubre 8 payloads de AITG-MOD-01 (Evasion) + AITG-MOD-06 (Robustness to New Data) con adversarial training, defensive distillation, input sanitization y OOD detection.

LLM05:2025AITG-MOD-01AITG-MOD-06
Model
Adversarial ML / Model Robustness
Ver ficha
CTRL-AI-0152
Crítica

Model Poisoning · Training & Runtime

Defensa del modelo contra poisoning en training data (label flipping, backdoor trigger, targeted poisoning) y runtime poisoning (gradual label flipping, backdoor association, feature skewing). Cubre 6 payloads de AITG-MOD-02 + AITG-MOD-03 con data validation pipelines, anomaly detection, trusted sources, rate limiting y periodic retraining.

LLM04:2025AITG-MOD-02AITG-MOD-03
ModelData
Adversarial ML / Model Integrity
Ver ficha
CTRL-AI-0163
Crítica

Model Privacy · Inference & Inversion

Defensa del modelo contra ataques que comprometen la privacidad del training data: Membership Inference (determinar si un dato estaba en training) e Inversion Attacks (reconstruir datos sensibles desde outputs/gradients). Cubre 6 payloads de AITG-MOD-04 + AITG-MOD-05 con differential privacy, regularization, output perturbation y knowledge distillation.

LLM02:2025AITG-MOD-04AITG-MOD-05
ModelData
Model Privacy / Adversarial ML
Ver ficha
CTRL-AI-0173
Crítica

Model Alignment · Goal Alignment & RAI

Asegura que el modelo se mantiene alineado con objetivos éticos, operacionales y de seguridad predefinidos. Defensa contra ethical boundary probing, implicit constraint violation, jailbreaks y nuanced ethical scenarios. Cubre 4 payloads de AITG-MOD-07 con RLHF, Constitutional AI, system prompts robustos y red-teaming continuo.

LLM06:2025AITG-MOD-07
Model
Model Alignment / Responsible AI
Ver ficha
CTRL-AI-0182
Crítica

Data Security · Storage & Runtime Exfiltration

Protección del training data en reposo y en inference. Cubre acceso directo no autorizado a storage (S3, databases, file shares) y exfiltración en runtime vía inference outputs, logs, cache y APIs. 6 payloads de AITG-DAT-01 + DAT-02 con encryption at rest, strict access controls, output sanitization y DLP.

LLM02:2025AITG-DAT-01AITG-DAT-02
Data
Data Security / Storage & Runtime
Ver ficha
CTRL-AI-0192
Alta

Data Quality · Diversity & Bias

Asegura que los training datasets son diversos, representativos y libres de contenido dañino. Cubre análisis de representación demográfica, cobertura de escenarios, bias/stereotypes, hate speech, profanity y misinformation. 6 payloads de AITG-DAT-03 + DAT-04 con Fairlearn, AIF360, Detoxify, Perspective API y TFDV.

LLM09:2025AITG-DAT-03AITG-DAT-04
Data
Data Quality / Responsible AI
Ver ficha
CTRL-AI-0202
Crítica

Data Privacy · Consent & Compliance

Compliance con principios de minimización de datos, gestión de consentimiento y retention policies. Asegura que el sistema solo procesa datos necesarios para el propósito declarado, mantiene audit trail de consentimientos, y elimina datos tras el período de retention. Cubre 3 payloads de AITG-DAT-05 con schema validation, Consent Management Platform y automated data deletion.

LLM02:2025AITG-DAT-05
Data
Data Privacy / Regulatory Compliance
Ver ficha
CTRL-AI-0212
Crítica

Supply Chain · Build & Training Pipeline

Protección de la cadena de suministro de IA: dependencies, container images, CI/CD pipeline, y fine-tuning datasets. Cubre 6 payloads de AITG-INF-01 (Supply Chain Tampering) + AITG-INF-05 (Fine-tuning Poisoning) con SCA scanning, image signing, SBOM, data provenance y activation-based monitoring.

LLM03:2025LLM04:2025AITG-INF-01AITG-INF-05
InfrastructureData
Supply Chain Security / MLOps
Ver ficha
CTRL-AI-0223
Crítica

Runtime Security · Resource & Plugins

Defensa contra DoS / Resource Exhaustion (rate limiting, input size validation, spending caps) y Plugin Boundary Violations (sandboxing, capability-based security, audit logs). 7 payloads de AITG-INF-02 + AITG-INF-03 con Locust/JMeter para stress testing, Kong/Envoy para rate limiting, gVisor/Firecracker para sandboxing, OPA para policy enforcement.

LLM10:2025LLM06:2025AITG-INF-02AITG-INF-03
Infrastructure
Runtime Infrastructure Security
Ver ficha
CTRL-AI-0233
Crítica

Capability Governance & Dev-Time IP Protection

Protección del sistema de IA contra misuse de capabilities (RBAC, ethical guardrails, privilege escalation) y del modelo contra dev-time theft (hardcoded secrets, CI/CD exfiltration, unsecured dev APIs). 6 payloads de AITG-INF-04 + AITG-INF-06 con OPA, git-secrets/TruffleHog, secure artifact repositories, capability-based security.

LLM06:2025LLM10:2025AITG-INF-04AITG-INF-06
Infrastructure
Capability Governance / IP Protection
Ver ficha
OWASP Foundation · 2025

¿Buscas la referencia didáctica del OWASP LLM Top 10?

Los 10 riesgos de OWASP LLM ahora tienen página propia, explicados en lenguaje claro con ejemplos del día a día, escenarios de ataque y prevención. Pensado para que lo entienda cualquier persona del equipo.

Ver referencia OWASP LLM Top 10
Cloud Security Alliance + OWASP AI Exchange · 2025

Complementa con Red Teaming de IA Agéntica

Este catálogo cubre controles técnicos para LLMs y los referencia contra marcos públicos. Para amenazas específicas de agentes autónomos (planificación, herramientas, multi-agente, MCP, blast radius, etc.) consulta el catálogo de Red Teaming de IA Agéntica.

Ver 12 categorías agénticas

Aviso sobre referencias a normas

Este catálogo referencia marcos de cumplimiento (OWASP, EU AI Act, ISO/IEC 42001 y ENS) únicamente mediante sus identificadores públicos de control (ej. LLM01:2025, A.6.2, mp.info.1, Artículo 15). PROTUIN no es una entidad certificadora ni distribuye el contenido de las normas. Los mapeos son orientativos y deben verificarse siempre contra la versión oficial y vigente de cada estándar antes de su uso en auditorías o certificaciones. Las normas ISO 42001 y ENS son propiedad de sus respectivos organismos (ISO y CCN); consúltalas en sus canales oficiales para conocer los requisitos exactos.