Privacidad del Modelo ante Membership Inference e Inversion Attacks (Model Privacy)

CTRL-AI-016 · Model Privacy · Inference & Inversion

Crítica

Defensa del modelo contra ataques que comprometen la privacidad del training data: Membership Inference (determinar si un dato estaba en training) e Inversion Attacks (reconstruir datos sensibles desde outputs/gradients). Cubre 6 payloads de AITG-MOD-04 + AITG-MOD-05 con differential privacy, regularization, output perturbation y knowledge distillation.

Validado en laboratorioCatálogo AITG-MOD · 6 vectores de privacy attack
OWASP AI Testing Guide v1 (AITG-MOD-04 + AITG-MOD-05)

Vector: Privacy Attack (Membership Inference + Model Inversion)

Modelo entrenado sobre datos sensibles (medical records, financial data, PII, fotos personales). Un atacante con acceso al modelo (API o weights) intenta (1) determinar si un dato específico suyo (o de alguien) estaba en el training set (Membership Inference), o (2) reconstruir datos sensibles del training set desde outputs/gradients del modelo (Inversion). Estos ataques violan la confidencialidad del training data aunque el atacante nunca haya tenido acceso directo a él, explotando señales estadísticas en el comportamiento del modelo.

Categoría
Model Privacy / Adversarial ML
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM02:2025
AI Testing Guide
AITG-MOD-04AITG-MOD-05
Risk Score
9/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-MOD-04 + AITG-MOD-05)
Nivel / Reto
Catálogo AITG-MOD · 6 vectores de privacy attack
Vector
Privacy Attack (Membership Inference + Model Inversion)
Escenario
Modelo entrenado sobre datos sensibles (medical records, financial data, PII, fotos personales). Un atacante con acceso al modelo (API o weights) intenta (1) determinar si un dato específico suyo (o de alguien) estaba en el training set (Membership Inference), o (2) reconstruir datos sensibles del training set desde outputs/gradients del modelo (Inversion). Estos ataques violan la confidencialidad del training data aunque el atacante nunca haya tenido acceso directo a él, explotando señales estadísticas en el comportamiento del modelo.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.info.1op.acc.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 10 - Data governance y privacidad; considerando RGPD para PII; Art. 13 sobre transparencia hacia usuarios afectados

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-MOD-04Testing for Membership InferenceModelOWASP AI ExchangePrivacy
  • AITG-MOD-05Testing for Inversion AttacksModelOWASP Top 10 LLM 2025Privacy

Amenazas agénticas relacionadas

Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.