Gobernanza de Capabilities y Protección del Modelo en Dev-Time (Capability Misuse + Model Theft · LLM06/10:2025)
CTRL-AI-023 · Capability Governance & Dev-Time IP Protection
Protección del sistema de IA contra misuse de capabilities (RBAC, ethical guardrails, privilege escalation) y del modelo contra dev-time theft (hardcoded secrets, CI/CD exfiltration, unsecured dev APIs). 6 payloads de AITG-INF-04 + AITG-INF-06 con OPA, git-secrets/TruffleHog, secure artifact repositories, capability-based security.
Vector: Capability Misuse + Dev-Time Model Theft
Sistema de IA con capabilities (tools) que pueden ser invocadas por usuarios con diferentes roles. El atacante explota (1) RBAC débil para invocar capabilities no autorizadas, (2) ausencia de ethical guardrails que permite acciones claramente dañinas, (3) privilege escalation vía chaining de capabilities aparentemente innocuas. Adicionalmente, durante el dev-time, attackers internos o externos pueden (1) extraer secrets hardcoded del código que dan acceso al model storage, (2) exfiltrar model artifacts vía CI/CD pipeline, (3) acceder a dev APIs sin autenticación para descargar el modelo. Ambos vectores comprometen la integridad operacional y la propiedad intelectual.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-INF-04Testing for Capability MisuseInfrastructureResponsible AIRAI
- AITG-INF-06Testing for Dev-Time Model TheftInfrastructureOWASP AI ExchangeSecurity
Controles relacionados
3Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-002.1AltaTool Use · Control de Acceso e Identidad
Validación de la identidad del usuario en la capa de ejecución de herramientas (Tool Use) expuestas a un agente de IA. Evita que el LLM pueda inyectar parámetros de identidad (ej. remitente From) para suplantar usuarios corporativos o escalar privilegios. Score de laboratorio: 100/100.
Ver ficha - CTRL-AI-010CríticaModel Theft · Model Extraction Attacks
Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.
Ver ficha - CTRL-AI-022CríticaRuntime Security · Resource & Plugins
Defensa contra DoS / Resource Exhaustion (rate limiting, input size validation, spending caps) y Plugin Boundary Violations (sandboxing, capability-based security, audit logs). 7 payloads de AITG-INF-02 + AITG-INF-03 con Locust/JMeter para stress testing, Kong/Envoy para rate limiting, gVisor/Firecracker para sandboxing, OPA para policy enforcement.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-INF-04 + AITG-INF-06
- OWASP Top 10 for LLM Applications 2025 - LLM06: Excessive Agency
- OWASP Top 10 for LLM Applications 2025 - LLM10: Model Theft
- OWASP AI Exchange - Model Theft & IP Risks
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Trail of Bits - Dangers of LLM Plugins (2023)
- MITRE ATT&CK - Data Staged: Model Theft (T1074)
- NIST AI 100-2e2025 - AI Capability Management
Amenazas agénticas relacionadas
Este control se cruza con 3 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-01CRITICAL
Autorización y Secuestro de Control del Agente
Pruebas de ejecución no autorizada de comandos, escalada de privilegios y herencia de roles. Incluye inyección de comandos maliciosos, simulación de señales de control falsificadas y validación de revocación de permisos.
Ver detalle - ART-03CRITICAL
Interacción del Agente con Sistemas Críticos
Evalúa las interacciones del agente con sistemas físicos y digitales críticos. Cubre simulación de entradas inseguras, seguridad de la comunicación con dispositivos IoT y validación de mecanismos de failsafe.
Ver detalle - ART-06CRITICAL
Cadena de Impacto y Blast Radius del Agente
Examina los riesgos de fallos en cascada e intenta limitar el blast radius de las brechas. Incluye simulación de compromiso del agente, prueba de relaciones de confianza y evaluación de mecanismos de contención.
Ver detalle