Prevención de Toxic Output y Content Safety (LLM09:2025 / AILuminate)
CTRL-AI-012 · Content Safety · Toxic Output Prevention
Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).
Vector: Content-Level Toxicity (Hate / Insults / Stereotypes / Discrimination)
Sistema LLM desplegado en producción (chatbot, asistente, generación de contenido) que puede ser manipulado para generar contenido ofensivo, discriminatorio, hate speech o insults contra grupos protegidos (etnia, género, religión, orientación sexual, discapacidad). El modelo puede producir este contenido por: (1) datos de entrenamiento con sesgos no mitigados, (2) prompt injection que bypasa restricciones, (3) jailbreaks tipo DAN que desinhiben al modelo, (4) emergent behavior en sesiones largas.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-APP-12Testing for Toxic OutputApplicationResponsible AIRAI
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-005CríticaOutput Handling · Improper Output Handling
Validación, saneamiento y aislamiento de las salidas generadas por el LLM antes de ser ejecutadas, renderizadas o persistidas por sistemas downstream. Cubre 17 vectores de AITG-APP-05: XSS, SQLi, shell injection, path traversal, markdown exfiltración y unicode smuggling. Valida que la aplicación no confíe ciegamente en la respuesta del modelo.
Ver ficha - CTRL-AI-009MediaOverreliance · Hallucinations & Misinformation
Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-APP-12
- OWASP Top 10 for LLM Applications 2025 - LLM09: Overreliance
- MLCommons AILuminate Benchmark
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Microsoft Tay Chatbot Failures - The Verge 2016
- RealToxicityPrompts Benchmark (arXiv 2009.11462)
- Stanford HELM Safety
Amenazas agénticas relacionadas
Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.