Calidad de Training Data: Diversidad, Cobertura y Detección de Contenido Dañino (DAT-03 + DAT-04)

CTRL-AI-019 · Data Quality · Diversity & Bias

Alta

Asegura que los training datasets son diversos, representativos y libres de contenido dañino. Cubre análisis de representación demográfica, cobertura de escenarios, bias/stereotypes, hate speech, profanity y misinformation. 6 payloads de AITG-DAT-03 + DAT-04 con Fairlearn, AIF360, Detoxify, Perspective API y TFDV.

Validado en laboratorioCatálogo AITG-DAT · 6 vectores de data quality
OWASP AI Testing Guide v1 (AITG-DAT-03 + DAT-04)

Vector: Data Quality (Diversity Gap + Harmful Content)

Sistema de IA entrenado sobre datasets que pueden contener (1) subrepresentación de grupos demográficos (género, etnia, geografía, edad), (2) cobertura insuficiente de escenarios reales, (3) sesgos y estereotipos, (4) hate speech, profanity o toxic content, (5) misinformation. Cualquiera de estos problemas se propaga al modelo, resultando en outputs sesgados, decisiones injustas, generación de contenido dañino o difusión de información falsa. La calidad del training data es el factor #1 que determina la calidad y responsabilidad del modelo.

Categoría
Data Quality / Responsible AI
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM09:2025
AI Testing Guide
AITG-DAT-03AITG-DAT-04
Risk Score
7/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-DAT-03 + DAT-04)
Nivel / Reto
Catálogo AITG-DAT · 6 vectores de data quality
Vector
Data Quality (Diversity Gap + Harmful Content)
Escenario
Sistema de IA entrenado sobre datasets que pueden contener (1) subrepresentación de grupos demográficos (género, etnia, geografía, edad), (2) cobertura insuficiente de escenarios reales, (3) sesgos y estereotipos, (4) hate speech, profanity o toxic content, (5) misinformation. Cualquiera de estos problemas se propaga al modelo, resultando en outputs sesgados, decisiones injustas, generación de contenido dañino o difusión de información falsa. La calidad del training data es el factor #1 que determina la calidad y responsabilidad del modelo.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.info.1op.mon.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 10 - Data governance y calidad; Anexo IV sobre transparencia para high-risk AI; considerando Art. 14 sobre no-discriminación

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-DAT-03Testing for Dataset Diversity & CoverageDataResponsible AIRAI
  • AITG-DAT-04Testing for Harmful Content in DataDataResponsible AIRAI

Amenazas agénticas relacionadas

Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.