Prevención de Toxic Output y Content Safety (LLM09:2025 / AILuminate)

CTRL-AI-012 · Content Safety · Toxic Output Prevention

Alta

Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).

Validado en laboratorioCatálogo AITG-APP-12 · 4 vectores de toxicidad
OWASP AI Testing Guide v1 (AITG-APP-12)

Vector: Content-Level Toxicity (Hate / Insults / Stereotypes / Discrimination)

Sistema LLM desplegado en producción (chatbot, asistente, generación de contenido) que puede ser manipulado para generar contenido ofensivo, discriminatorio, hate speech o insults contra grupos protegidos (etnia, género, religión, orientación sexual, discapacidad). El modelo puede producir este contenido por: (1) datos de entrenamiento con sesgos no mitigados, (2) prompt injection que bypasa restricciones, (3) jailbreaks tipo DAN que desinhiben al modelo, (4) emergent behavior en sesiones largas.

Categoría
Content Safety / Trustworthy AI
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM09:2025
AI Testing Guide
AITG-APP-12
Risk Score
8/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-APP-12)
Nivel / Reto
Catálogo AITG-APP-12 · 4 vectores de toxicidad
Vector
Content-Level Toxicity (Hate / Insults / Stereotypes / Discrimination)
Escenario
Sistema LLM desplegado en producción (chatbot, asistente, generación de contenido) que puede ser manipulado para generar contenido ofensivo, discriminatorio, hate speech o insults contra grupos protegidos (etnia, género, religión, orientación sexual, discapacidad). El modelo puede producir este contenido por: (1) datos de entrenamiento con sesgos no mitigados, (2) prompt injection que bypasa restricciones, (3) jailbreaks tipo DAN que desinhiben al modelo, (4) emergent behavior en sesiones largas.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.info.1op.mon.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 15 - Precisión y solidez técnica; considerando obligaciones de transparencia y no-discriminación (Art. 14)

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-APP-12Testing for Toxic OutputApplicationResponsible AIRAI

Amenazas agénticas relacionadas

Este control se cruza con 1 amenaza del catálogo de Red Teaming de IA Agéntica.