Defensa contra Data y Model Poisoning (Training + Runtime · LLM04:2025)

CTRL-AI-015 · Model Poisoning · Training & Runtime

Crítica

Defensa del modelo contra poisoning en training data (label flipping, backdoor trigger, targeted poisoning) y runtime poisoning (gradual label flipping, backdoor association, feature skewing). Cubre 6 payloads de AITG-MOD-02 + AITG-MOD-03 con data validation pipelines, anomaly detection, trusted sources, rate limiting y periodic retraining.

Validado en laboratorioCatálogo AITG-MOD · 6 vectores de poisoning
OWASP AI Testing Guide v1 (AITG-MOD-02 + AITG-MOD-03)

Vector: Training-time + Runtime Model Poisoning

Modelo entrenado sobre un dataset (training-time poisoning) o que aprende de feedback de usuarios (runtime poisoning). El atacante introduce datos maliciosos en (1) el training set antes del entrenamiento, creando backdoors persistentes o degradando accuracy en subgrupos, o (2) en el feedback continuo post-despliegue, causando drift de comportamiento del modelo y backdoors que se activan con triggers específicos. En ambos casos, el compromiso es persistente: una vez que el modelo se entrena, el daño permanece hasta el próximo retrain.

Categoría
Adversarial ML / Model Integrity
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM04:2025
AI Testing Guide
AITG-MOD-02AITG-MOD-03
Risk Score
9/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-MOD-02 + AITG-MOD-03)
Nivel / Reto
Catálogo AITG-MOD · 6 vectores de poisoning
Vector
Training-time + Runtime Model Poisoning
Escenario
Modelo entrenado sobre un dataset (training-time poisoning) o que aprende de feedback de usuarios (runtime poisoning). El atacante introduce datos maliciosos en (1) el training set antes del entrenamiento, creando backdoors persistentes o degradando accuracy en subgrupos, o (2) en el feedback continuo post-despliegue, causando drift de comportamiento del modelo y backdoors que se activan con triggers específicos. En ambos casos, el compromiso es persistente: una vez que el modelo se entrena, el daño permanece hasta el próximo retrain.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.com.1op.mon.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 9 - Risk management; considerando Art. 10 sobre data governance para high-risk AI; integridad y trazabilidad de training data

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-MOD-02Testing for Runtime Model PoisoningModelOWASP Top 10 LLM 2025Security
  • AITG-MOD-03Testing for Poisoned Training SetsDataOWASP Top 10 LLM 2025Security

Amenazas agénticas relacionadas

Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.