Protección del System Prompt
Salvaguarda de prompts de sistema, datos de contexto confidencial y secretos de negocio contra lecturas no autorizadas o volcados directos mediante interacciones de usuario. Validado en entorno de laboratorio controlado.
Catálogo técnico de testing de seguridad para IA basado en el OWASP AI Testing Guide v1 y el OWASP LLM Top 10. Cada ficha demuestra gobernanza (qué controlar), operación (cómo se testea) y remediación (cómo se arregla).
Requisito normativo y objetivo de cumplimiento (ISO 42001 / EU AI Act / ENS).
Cómo un atacante rompe el control. Incluye PoC, prompts de laboratorio y técnicas de testing.
Daño operativo, de seguridad y normativo si el control falla (AIA / Risk).
Arquitectura, código y controles de gestión para mitigar el riesgo.
Salvaguarda de prompts de sistema, datos de contexto confidencial y secretos de negocio contra lecturas no autorizadas o volcados directos mediante interacciones de usuario. Validado en entorno de laboratorio controlado.
Variante evolucionada del CTRL-AI-001. Bypass de guardrails de entrada mediante inyección de tokens de control ChatML (<|im_end|>, <|im_start|>) y suplantación del canal de sistema. Score de laboratorio: 95/100.
Tercera variante de CTRL-AI-001. Bypass de máquina de estados y guardrails en dos fases: (1) cumplimiento parcial de variables de negocio para validar la solicitud + (2) imposición de esquema JSON estructurado que fuerza la exfiltración de instrucciones. Score de laboratorio: 99/100.
Validación de la identidad del usuario en la capa de ejecución de herramientas (Tool Use) expuestas a un agente de IA. Evita que el LLM pueda inyectar parámetros de identidad (ej. remitente From) para suplantar usuarios corporativos o escalar privilegios. Score de laboratorio: 100/100.
Evasión de los guardrails de identidad del agente mediante inyección de contexto de negocio (perfiles ejecutivos, plantillas, aliases) que induce al LLM a aplicar un remitente no autorizado. Score de laboratorio: 100/100 con bypass de guardrail.
Prevención de fugas de datos confidenciales (PII, credenciales, API keys, env vars, herramientas, parámetros internos) en las respuestas del LLM. Cubre los 9 payloads de AITG-APP-03 con detección automática de secrets, redacción determinista, allowlist de herramientas y sandboxing de reasoning.
Validación, saneamiento y aislamiento de las salidas generadas por el LLM antes de ser ejecutadas, renderizadas o persistidas por sistemas downstream. Cubre 17 vectores de AITG-APP-05: XSS, SQLi, shell injection, path traversal, markdown exfiltración y unicode smuggling. Valida que la aplicación no confíe ciegamente en la respuesta del modelo.
Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.
Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.
Defensas contra ataques de extracción de modelo (Model Extraction) que permiten a un adversario con acceso black-box API reconstruir un surrogate model que replica la funcionalidad del modelo objetivo. Cubre query strategies sistemáticos y confidence-based extraction, con rate limiting, anomaly detection, output perturbation y differential privacy como contramedidas.
Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).
Detección y mitigación de sesgos en las respuestas del LLM: posicional, estereotipado (género, etnia, geografía), framing, anchoring y status quo. Cubre los 5 payloads de AITG-APP-10 con métricas de fairness (equalized odds, demographic parity) y zero-shot/few-shot unbiasing.
Defensa del modelo contra adversarial perturbations (FGSM, PGD, AutoAttack) en múltiples modalidades (image, text, audio, binary) y contra distribution shift / OOD inputs. Cubre 8 payloads de AITG-MOD-01 (Evasion) + AITG-MOD-06 (Robustness to New Data) con adversarial training, defensive distillation, input sanitization y OOD detection.
Defensa del modelo contra poisoning en training data (label flipping, backdoor trigger, targeted poisoning) y runtime poisoning (gradual label flipping, backdoor association, feature skewing). Cubre 6 payloads de AITG-MOD-02 + AITG-MOD-03 con data validation pipelines, anomaly detection, trusted sources, rate limiting y periodic retraining.
Defensa del modelo contra ataques que comprometen la privacidad del training data: Membership Inference (determinar si un dato estaba en training) e Inversion Attacks (reconstruir datos sensibles desde outputs/gradients). Cubre 6 payloads de AITG-MOD-04 + AITG-MOD-05 con differential privacy, regularization, output perturbation y knowledge distillation.
Asegura que el modelo se mantiene alineado con objetivos éticos, operacionales y de seguridad predefinidos. Defensa contra ethical boundary probing, implicit constraint violation, jailbreaks y nuanced ethical scenarios. Cubre 4 payloads de AITG-MOD-07 con RLHF, Constitutional AI, system prompts robustos y red-teaming continuo.
Protección del training data en reposo y en inference. Cubre acceso directo no autorizado a storage (S3, databases, file shares) y exfiltración en runtime vía inference outputs, logs, cache y APIs. 6 payloads de AITG-DAT-01 + DAT-02 con encryption at rest, strict access controls, output sanitization y DLP.
Asegura que los training datasets son diversos, representativos y libres de contenido dañino. Cubre análisis de representación demográfica, cobertura de escenarios, bias/stereotypes, hate speech, profanity y misinformation. 6 payloads de AITG-DAT-03 + DAT-04 con Fairlearn, AIF360, Detoxify, Perspective API y TFDV.
Compliance con principios de minimización de datos, gestión de consentimiento y retention policies. Asegura que el sistema solo procesa datos necesarios para el propósito declarado, mantiene audit trail de consentimientos, y elimina datos tras el período de retention. Cubre 3 payloads de AITG-DAT-05 con schema validation, Consent Management Platform y automated data deletion.
Protección de la cadena de suministro de IA: dependencies, container images, CI/CD pipeline, y fine-tuning datasets. Cubre 6 payloads de AITG-INF-01 (Supply Chain Tampering) + AITG-INF-05 (Fine-tuning Poisoning) con SCA scanning, image signing, SBOM, data provenance y activation-based monitoring.
Defensa contra DoS / Resource Exhaustion (rate limiting, input size validation, spending caps) y Plugin Boundary Violations (sandboxing, capability-based security, audit logs). 7 payloads de AITG-INF-02 + AITG-INF-03 con Locust/JMeter para stress testing, Kong/Envoy para rate limiting, gVisor/Firecracker para sandboxing, OPA para policy enforcement.
Protección del sistema de IA contra misuse de capabilities (RBAC, ethical guardrails, privilege escalation) y del modelo contra dev-time theft (hardcoded secrets, CI/CD exfiltration, unsecured dev APIs). 6 payloads de AITG-INF-04 + AITG-INF-06 con OPA, git-secrets/TruffleHog, secure artifact repositories, capability-based security.
Los 10 riesgos de OWASP LLM ahora tienen página propia, explicados en lenguaje claro con ejemplos del día a día, escenarios de ataque y prevención. Pensado para que lo entienda cualquier persona del equipo.
Este catálogo cubre controles técnicos para LLMs y los referencia contra marcos públicos. Para amenazas específicas de agentes autónomos (planificación, herramientas, multi-agente, MCP, blast radius, etc.) consulta el catálogo de Red Teaming de IA Agéntica.
Este catálogo referencia marcos de cumplimiento (OWASP, EU AI Act, ISO/IEC 42001 y ENS) únicamente mediante sus identificadores públicos de control (ej. LLM01:2025, A.6.2, mp.info.1, Artículo 15). PROTUIN no es una entidad certificadora ni distribuye el contenido de las normas. Los mapeos son orientativos y deben verificarse siempre contra la versión oficial y vigente de cada estándar antes de su uso en auditorías o certificaciones. Las normas ISO 42001 y ENS son propiedad de sus respectivos organismos (ISO y CCN); consúltalas en sus canales oficiales para conocer los requisitos exactos.