Defensa contra Data y Model Poisoning (Training + Runtime · LLM04:2025)
CTRL-AI-015 · Model Poisoning · Training & Runtime
Defensa del modelo contra poisoning en training data (label flipping, backdoor trigger, targeted poisoning) y runtime poisoning (gradual label flipping, backdoor association, feature skewing). Cubre 6 payloads de AITG-MOD-02 + AITG-MOD-03 con data validation pipelines, anomaly detection, trusted sources, rate limiting y periodic retraining.
Vector: Training-time + Runtime Model Poisoning
Modelo entrenado sobre un dataset (training-time poisoning) o que aprende de feedback de usuarios (runtime poisoning). El atacante introduce datos maliciosos en (1) el training set antes del entrenamiento, creando backdoors persistentes o degradando accuracy en subgrupos, o (2) en el feedback continuo post-despliegue, causando drift de comportamiento del modelo y backdoors que se activan con triggers específicos. En ambos casos, el compromiso es persistente: una vez que el modelo se entrena, el daño permanece hasta el próximo retrain.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-MOD-02Testing for Runtime Model PoisoningModelOWASP Top 10 LLM 2025Security
- AITG-MOD-03Testing for Poisoned Training SetsDataOWASP Top 10 LLM 2025Security
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-014CríticaModel Robustness · Adversarial & OOD
Defensa del modelo contra adversarial perturbations (FGSM, PGD, AutoAttack) en múltiples modalidades (image, text, audio, binary) y contra distribution shift / OOD inputs. Cubre 8 payloads de AITG-MOD-01 (Evasion) + AITG-MOD-06 (Robustness to New Data) con adversarial training, defensive distillation, input sanitization y OOD detection.
Ver ficha - CTRL-AI-008CríticaRAG Security · Vector & Embedding Weaknesses
Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-MOD-02 + AITG-MOD-03
- OWASP Top 10 for LLM Applications 2025 - LLM04: Data and Model Poisoning
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Jagielski et al. - Poisoning Attacks on Machine Learning (2018)
- Confident Learning: Estimating Uncertainty in Dataset Labels (Northcutt et al. 2021)
- NIST AI 100-2e2025 - Poisoning Attacks and Mitigations (Section 2.3)
Amenazas agénticas relacionadas
Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.