Robustez del Modelo ante Ataques Adversariales y Datos OOD (Evasion + Distribution Shift)

CTRL-AI-014 · Model Robustness · Adversarial & OOD

Crítica

Defensa del modelo contra adversarial perturbations (FGSM, PGD, AutoAttack) en múltiples modalidades (image, text, audio, binary) y contra distribution shift / OOD inputs. Cubre 8 payloads de AITG-MOD-01 (Evasion) + AITG-MOD-06 (Robustness to New Data) con adversarial training, defensive distillation, input sanitization y OOD detection.

Validado en laboratorioCatálogo AITG-MOD · 8 vectores de robustez modelo
OWASP AI Testing Guide v1 (AITG-MOD-01 + AITG-MOD-06)

Vector: Adversarial Perturbation + Distribution Shift + OOD

Modelo ML/LLM desplegado en producción que recibe inputs del mundo real. El modelo es vulnerable a (1) adversarial perturbations (imperceptibles al humano pero que fool al modelo), (2) data drift (cambios en la distribución de producción vs training), (3) OOD inputs (datos semánticamente distintos al training), (4) edge cases. En cualquier caso, el modelo produce predicciones erróneas con alta confianza, erosionando la confianza del usuario y creando superficies de ataque explotables (ej. evasión de AI-based antivirus, mal clasificación de imágenes médicas).

Categoría
Adversarial ML / Model Robustness
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM05:2025
AI Testing Guide
AITG-MOD-01AITG-MOD-06
Risk Score
9/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-MOD-01 + AITG-MOD-06)
Nivel / Reto
Catálogo AITG-MOD · 8 vectores de robustez modelo
Vector
Adversarial Perturbation + Distribution Shift + OOD
Escenario
Modelo ML/LLM desplegado en producción que recibe inputs del mundo real. El modelo es vulnerable a (1) adversarial perturbations (imperceptibles al humano pero que fool al modelo), (2) data drift (cambios en la distribución de producción vs training), (3) OOD inputs (datos semánticamente distintos al training), (4) edge cases. En cualquier caso, el modelo produce predicciones erróneas con alta confianza, erosionando la confianza del usuario y creando superficies de ataque explotables (ej. evasión de AI-based antivirus, mal clasificación de imágenes médicas).

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

op.acc.1mp.com.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 15 - Precisión, solidez y ciberseguridad; considerando Art. 9 sobre gestión de riesgos para high-risk AI

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-MOD-01Testing for Evasion AttacksModelOWASP AI ExchangeSecurity
  • AITG-MOD-06Testing for Robustness to New DataModelResponsible AIRAI