Protección contra Model Extraction y Model Theft (LLM10:2025)
CTRL-AI-010 · Model Theft · Model Extraction Attacks
Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.
Vector: Black-Box Model Extraction (Systematic Querying / Confidence-Based)
Modelo (LLM o ML clásico) expuesto vía API pública o semi-pública. Un adversario con acceso black-box puede lanzar miles/ millones de queries, capturar las predicciones (labels o distribuciones de probabilidad), y entrenar un surrogate model que replica el comportamiento del original. El modelo robado puede usarse para (1) evadir paywalls de API, (2) montar ataques adversariales offline, (3) realizar membership inference, (4) clonar la IP sin coste de entrenamiento.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-APP-09Testing for Model ExtractionApplicationOWASP AI ExchangeSecurity
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-005CríticaOutput Handling · Improper Output Handling
Validación, saneamiento y aislamiento de las salidas generadas por el LLM antes de ser ejecutadas, renderizadas o persistidas por sistemas downstream. Cubre 17 vectores de AITG-APP-05: XSS, SQLi, shell injection, path traversal, markdown exfiltración y unicode smuggling. Valida que la aplicación no confíe ciegamente en la respuesta del modelo.
Ver ficha - CTRL-AI-008CríticaRAG Security · Vector & Embedding Weaknesses
Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.
Ver ficha
Referencias
- OWASP Top 10 for LLM Applications 2025 - LLM10: Model Theft
- OWASP AI Testing Guide v1 - AITG-APP-09
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Stealing Machine Learning Models via Prediction APIs (Tramèr et al., USENIX Security 2016)
- Extraction Attacks on Machine Learning Models (Jagielski et al., IEEE S&P 2020)
- Efficient and Effective Model Extraction (arXiv 2409.14122)
Amenazas agénticas relacionadas
Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.