Protección contra Model Extraction y Model Theft (LLM10:2025)

CTRL-AI-010 · Model Theft · Model Extraction Attacks

Crítica

Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.

Validado en laboratorioCatálogo AITG-APP-09 · 2 vectores de extracción
OWASP AI Testing Guide v1 (AITG-APP-09)

Vector: Black-Box Model Extraction (Systematic Querying / Confidence-Based)

Modelo (LLM o ML clásico) expuesto vía API pública o semi-pública. Un adversario con acceso black-box puede lanzar miles/ millones de queries, capturar las predicciones (labels o distribuciones de probabilidad), y entrenar un surrogate model que replica el comportamiento del original. El modelo robado puede usarse para (1) evadir paywalls de API, (2) montar ataques adversariales offline, (3) realizar membership inference, (4) clonar la IP sin coste de entrenamiento.

Categoría
Model IP Protection / Adversarial ML
ISO 42001
A.6.2A.8.4A.9.2
OWASP LLM
LLM10:2025LLM02:2025
AI Testing Guide
AITG-APP-09
Risk Score
9/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-APP-09)
Nivel / Reto
Catálogo AITG-APP-09 · 2 vectores de extracción
Vector
Black-Box Model Extraction (Systematic Querying / Confidence-Based)
Escenario
Modelo (LLM o ML clásico) expuesto vía API pública o semi-pública. Un adversario con acceso black-box puede lanzar miles/ millones de queries, capturar las predicciones (labels o distribuciones de probabilidad), y entrenar un surrogate model que replica el comportamiento del original. El modelo robado puede usarse para (1) evadir paywalls de API, (2) montar ataques adversariales offline, (3) realizar membership inference, (4) clonar la IP sin coste de entrenamiento.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.2

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.info.1op.acc.1op.mon.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 15 - Ciberseguridad y robustez técnica; considerando la protección de los activos de IA como propiedad intelectual bajo el marco de la UE

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-APP-09Testing for Model ExtractionApplicationOWASP AI ExchangeSecurity

Amenazas agénticas relacionadas

Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.