Mitigación de Content Bias y Fairness en Outputs LLM (Responsible AI)
CTRL-AI-013 · Content Bias · Fairness & RAI
Detección y mitigación de sesgos en las respuestas del LLM: posicional, estereotipado (género, etnia, geografía), framing, anchoring y status quo. Cubre los 5 payloads de AITG-APP-10 con métricas de fairness (equalized odds, demographic parity) y zero-shot/few-shot unbiasing.
Vector: Content Bias (Positional / Stereotyping / Framing / Anchoring / Status Quo)
Sistema LLM usado en decisiones de alto impacto (admisiones universitarias, hiring, préstamos, justicia) que puede exhibir sesgos sistemáticos en sus outputs: priorizar candidatos según orden de mención (positional bias), estereotipar grupos por etnia/género/geografía, cambiar recomendación según framing de la pregunta, anclarse a decisiones previas (anchoring), o preferir el status quo sobre alternativas. Estos sesgos pueden ser introducidos por datos de entrenamiento desbalanceados, prompts ambiguos, o emergent behavior del modelo.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-APP-10Testing for Content BiasApplicationResponsible AIRAI
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-009MediaOverreliance · Hallucinations & Misinformation
Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.
Ver ficha - CTRL-AI-012AltaContent Safety · Toxic Output Prevention
Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-APP-10
- OWASP Top 10 for LLM Applications 2025 - LLM09: Overreliance
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Cognitive Bias in Decision-Making with LLMs (arXiv 2403.00811)
- Bias in Large Language Models: Origin, Evaluation and Mitigation (arXiv 2411.10915)
- Amazon Scraps Secret AI Recruiting Tool That Showed Bias Against Women (Reuters 2018)
- HELM-Safety Bias Tests (Stanford)
Amenazas agénticas relacionadas
Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-02HIGH
Checker Fuera del Loop
Verifica que los checkers (humanos o automatizados) estén informados durante operaciones inseguras o cuando se superan umbrales críticos. Incluye simulación de brechas de umbral, supresión de alertas y validación de mecanismos de fallback.
Ver detalle - ART-05HIGH
Explotación de Alucinaciones del Agente
Identifica vulnerabilidades derivadas de outputs fabricados o falsos. Incluye crafting de inputs ambiguos, simulación de errores en cascada (confabulation chains) y pruebas de mecanismos de validación.
Ver detalle