Protección de Instrucciones del Sistema y Fuga de Contexto Sensible
CTRL-AI-001 · Protección del System Prompt
Salvaguarda de prompts de sistema, datos de contexto confidencial y secretos de negocio contra lecturas no autorizadas o volcados directos mediante interacciones de usuario. Validado en entorno de laboratorio (Lakera Guard).
Vector: Direct Prompt Injection / System Prompt Extraction
Agente conversacional especializado en entrenamiento que mantiene instrucciones secretas de sistema y conocimiento propietario en su prompt inicial.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-APP-01Testing for Prompt InjectionApplicationOWASP Top 10 LLM 2025Security
- AITG-APP-07Testing for Prompt DisclosureApplicationOWASP Top 10 LLM 2025SecurityPrivacy
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-001.2CríticaSystem Prompt · Nivel 2 (Control Token Injection)
Variante evolucionada del CTRL-AI-001. Bypass de guardrails de entrada mediante inyección de tokens de control ChatML (<|im_end|>, <|im_start|>) y suplantación del canal de sistema. Score de laboratorio: 95/100.
Ver ficha - CTRL-AI-001.3CríticaSystem Prompt · Nivel 3 (Payload Smuggling)
Tercera variante de CTRL-AI-001. Bypass de máquina de estados y guardrails en dos fases: (1) cumplimiento parcial de variables de negocio para validar la solicitud + (2) imposición de esquema JSON estructurado que fuerza la exfiltración de instrucciones. Score de laboratorio: 99/100.
Ver ficha
Amenazas agénticas relacionadas
Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-04CRITICAL
Manipulación de Objetivos e Instrucciones del Agente
Evalúa la resiliencia del agente frente a cambios adversariales en sus objetivos o instrucciones. Incluye instrucciones ambiguas, exfiltración de datos, modificación de la secuencia de tareas y manipulación recursiva de objetivos.
Ver detalle - ART-08HIGH
Manipulación de Memoria y Contexto del Agente
Identifica vulnerabilidades en gestión de estado y aislamiento de sesión. Incluye reset de contexto, simulación de fugas de datos cross-session/cross-application y pruebas de memory overflow.
Ver detalle