Robustez del Modelo ante Ataques Adversariales y Datos OOD (Evasion + Distribution Shift)
CTRL-AI-014 · Model Robustness · Adversarial & OOD
Defensa del modelo contra adversarial perturbations (FGSM, PGD, AutoAttack) en múltiples modalidades (image, text, audio, binary) y contra distribution shift / OOD inputs. Cubre 8 payloads de AITG-MOD-01 (Evasion) + AITG-MOD-06 (Robustness to New Data) con adversarial training, defensive distillation, input sanitization y OOD detection.
Vector: Adversarial Perturbation + Distribution Shift + OOD
Modelo ML/LLM desplegado en producción que recibe inputs del mundo real. El modelo es vulnerable a (1) adversarial perturbations (imperceptibles al humano pero que fool al modelo), (2) data drift (cambios en la distribución de producción vs training), (3) OOD inputs (datos semánticamente distintos al training), (4) edge cases. En cualquier caso, el modelo produce predicciones erróneas con alta confianza, erosionando la confianza del usuario y creando superficies de ataque explotables (ej. evasión de AI-based antivirus, mal clasificación de imágenes médicas).
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-MOD-01Testing for Evasion AttacksModelOWASP AI ExchangeSecurity
- AITG-MOD-06Testing for Robustness to New DataModelResponsible AIRAI
Controles relacionados
3Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-015CríticaModel Poisoning · Training & Runtime
Defensa del modelo contra poisoning en training data (label flipping, backdoor trigger, targeted poisoning) y runtime poisoning (gradual label flipping, backdoor association, feature skewing). Cubre 6 payloads de AITG-MOD-02 + AITG-MOD-03 con data validation pipelines, anomaly detection, trusted sources, rate limiting y periodic retraining.
Ver ficha - CTRL-AI-016CríticaModel Privacy · Inference & Inversion
Defensa del modelo contra ataques que comprometen la privacidad del training data: Membership Inference (determinar si un dato estaba en training) e Inversion Attacks (reconstruir datos sensibles desde outputs/gradients). Cubre 6 payloads de AITG-MOD-04 + AITG-MOD-05 con differential privacy, regularization, output perturbation y knowledge distillation.
Ver ficha - CTRL-AI-017CríticaModel Alignment · Goal Alignment & RAI
Asegura que el modelo se mantiene alineado con objetivos éticos, operacionales y de seguridad predefinidos. Defensa contra ethical boundary probing, implicit constraint violation, jailbreaks y nuanced ethical scenarios. Cubre 4 payloads de AITG-MOD-07 con RLHF, Constitutional AI, system prompts robustos y red-teaming continuo.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-MOD-01 + AITG-MOD-06
- OWASP Top 10 for LLM Applications 2025 - LLM05: Improper Output Handling
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Madry et al. - Towards Deep Learning Models Resistant to Adversarial Attacks (ICLR 2018)
- NIST AI 100-2e2025 - Adversarial ML: Taxonomy and Terminology
- Failing Loudly: Methods for Detecting Dataset Shift (NeurIPS 2019)