Mitigación de Alucinaciones y Overreliance (LLM09:2025)
CTRL-AI-009 · Overreliance · Hallucinations & Misinformation
Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.
Vector: Factual Hallucination / Failure to Debunk False Premises
Sistema LLM que genera contenido factual (respuestas a preguntas, resúmenes, generación de código, asistencia médica/legal) sin mecanismos de verificación. Los usuarios confían ciegamente en las respuestas (overreliance) y el modelo puede inventar datos, citas, eventos, personas o explicaciones técnicas con apariencia de legitimidad. El modelo también puede asentir a afirmaciones falsas del usuario en lugar de corregirlas.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-APP-11Testing for HallucinationsApplicationResponsible AIRAI
Controles relacionados
2Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-008CríticaRAG Security · Vector & Embedding Weaknesses
Seguridad del pipeline RAG: validación de documentos ingested, generación de embeddings, almacenamiento en vector DB, recuperación y aislamiento multi-tenant. Cubre los 5 vectores de AITG-APP-08: data poisoning, embedding inversion, cross-tenant leakage, semantic poisoning y advertisement embedding attacks.
Ver ficha - CTRL-AI-005CríticaOutput Handling · Improper Output Handling
Validación, saneamiento y aislamiento de las salidas generadas por el LLM antes de ser ejecutadas, renderizadas o persistidas por sistemas downstream. Cubre 17 vectores de AITG-APP-05: XSS, SQLi, shell injection, path traversal, markdown exfiltración y unicode smuggling. Valida que la aplicación no confíe ciegamente en la respuesta del modelo.
Ver ficha
Referencias
- OWASP Top 10 for LLM Applications 2025 - LLM09: Overreliance
- OWASP AI Testing Guide v1 - AITG-APP-11
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Phare LLM Benchmarking - Giskard
- Gentrace - How to test for AI hallucination
- Google CEO acknowledges Gemini image generation failures (Engadget)
Amenazas agénticas relacionadas
Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-02HIGH
Checker Fuera del Loop
Verifica que los checkers (humanos o automatizados) estén informados durante operaciones inseguras o cuando se superan umbrales críticos. Incluye simulación de brechas de umbral, supresión de alertas y validación de mecanismos de fallback.
Ver detalle - ART-05HIGH
Explotación de Alucinaciones del Agente
Identifica vulnerabilidades derivadas de outputs fabricados o falsos. Incluye crafting de inputs ambiguos, simulación de errores en cascada (confabulation chains) y pruebas de mecanismos de validación.
Ver detalle