Privacidad del Modelo ante Membership Inference e Inversion Attacks (Model Privacy)
CTRL-AI-016 · Model Privacy · Inference & Inversion
Defensa del modelo contra ataques que comprometen la privacidad del training data: Membership Inference (determinar si un dato estaba en training) e Inversion Attacks (reconstruir datos sensibles desde outputs/gradients). Cubre 6 payloads de AITG-MOD-04 + AITG-MOD-05 con differential privacy, regularization, output perturbation y knowledge distillation.
Vector: Privacy Attack (Membership Inference + Model Inversion)
Modelo entrenado sobre datos sensibles (medical records, financial data, PII, fotos personales). Un atacante con acceso al modelo (API o weights) intenta (1) determinar si un dato específico suyo (o de alguien) estaba en el training set (Membership Inference), o (2) reconstruir datos sensibles del training set desde outputs/gradients del modelo (Inversion). Estos ataques violan la confidencialidad del training data aunque el atacante nunca haya tenido acceso directo a él, explotando señales estadísticas en el comportamiento del modelo.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-MOD-04Testing for Membership InferenceModelOWASP AI ExchangePrivacy
- AITG-MOD-05Testing for Inversion AttacksModelOWASP Top 10 LLM 2025Privacy
Controles relacionados
3Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-003CríticaOutput Filtering · Sensitive Data Leak
Prevención de fugas de datos confidenciales (PII, credenciales, API keys, env vars, herramientas, parámetros internos) en las respuestas del LLM. Cubre los 9 payloads de AITG-APP-03 con detección automática de secrets, redacción determinista, allowlist de herramientas y sandboxing de reasoning.
Ver ficha - CTRL-AI-008CríticaRAG Security · Vector & Embedding Weaknesses
Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.
Ver ficha - CTRL-AI-010CríticaModel Theft · Model Extraction Attacks
Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-MOD-04 + AITG-MOD-05
- OWASP Top 10 for LLM Applications 2025 - LLM02: Sensitive Information Disclosure
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Carlini et al. - Extracting Training Data from Large Language Models (USENIX 2021)
- Shokri et al. - Membership Inference Attacks Against ML Models (IEEE S&P 2017)
- Fredrikson et al. - Model Inversion Attacks (CCS 2015)
- NIST AI 100-2e2025 - Privacy Attacks and Mitigations (Section 2.4)
Amenazas agénticas relacionadas
Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-08HIGH
Manipulación de Memoria y Contexto del Agente
Identifica vulnerabilidades en gestión de estado y aislamiento de sesión. Incluye reset de contexto, simulación de fugas de datos cross-session/cross-application y pruebas de memory overflow.
Ver detalle - ART-12MEDIUM
Imposibilidad de Trazabilidad del Agente
Evalúa la trazabilidad de acciones, la rendición de cuentas y la preparación forense. Incluye supresión de logging, simulación de uso indebido de herencia de roles y obfuscación de datos forenses.
Ver detalle