Alineación del Modelo con Objetivos Éticos y Operacionales (Goal Alignment · LLM06:2025)
CTRL-AI-017 · Model Alignment · Goal Alignment & RAI
Asegura que el modelo se mantiene alineado con objetivos éticos, operacionales y de seguridad predefinidos. Defensa contra ethical boundary probing, implicit constraint violation, jailbreaks y nuanced ethical scenarios. Cubre 4 payloads de AITG-MOD-07 con RLHF, Constitutional AI, system prompts robustos y red-teaming continuo.
Vector: Goal Misalignment (Ethical Probing / Constraint Violation / Jailbreak / Nuanced Scenarios)
Modelo LLM con objetivos definidos (ser helpful, harmless, honest) y restricciones operacionales (no generar contenido dañino, no revelar system prompt, mantener límites de dominio). En producción, el modelo es sometido a intentos de (1) probarlo en sus límites éticos (pedir contenido claramente dañino), (2) hacerlo violar constraints implícitos (no понимать el contexto de uso), (3) jailbreaks que intentan desactivar la alineación, (4) scenarios matizados donde la 'respuesta correcta' no es obvia. Si el modelo falla, genera contenido dañino, toma acciones no autorizadas, o produce respuestas sesgadas/unsafe.
Control GRC
Gobernanza, Riesgo y Cumplimiento
Contexto del desafío
ISO/IEC 42001 — Anexo A
IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.
ENS — Esquema Nacional de Seguridad
IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.
EU AI Act (Reglamento 2024/1689)
OWASP AI Testing Guide v1 — Tests cubiertos
Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).
- AITG-MOD-07Testing for Goal AlignmentModelResponsible AIRAI
Controles relacionados
3Controles del mismo dominio o con vectores de ataque emparentados.
- CTRL-AI-009MediaOverreliance · Hallucinations & Misinformation
Estrategias para detectar, prevenir y validar alucinaciones del LLM (factuality) y verificar afirmaciones falsas del usuario (debunking). Cubre los 7 payloads de AITG-APP-11 e integra RAG, fact-checking, post-generation verification y human-in-the-loop para reducir overreliance.
Ver ficha - CTRL-AI-012AltaContent Safety · Toxic Output Prevention
Defensa contra generación de contenido tóxico, ofensivo, discriminatorio o hate speech. Combina moderation APIs (Perspective, Detoxify, Azure Content Safety), RLHF, system prompt hardening, refusal rate monitoring y red-teaming continuo. Cubre los 4 payloads de AITG-APP-12 con criterios cuantitativos (refusal >80%, toxicity <0.5, zero critical failures).
Ver ficha - CTRL-AI-002.1AltaTool Use · Control de Acceso e Identidad
Validación de la identidad del usuario en la capa de ejecución de herramientas (Tool Use) expuestas a un agente de IA. Evita que el LLM pueda inyectar parámetros de identidad (ej. remitente From) para suplantar usuarios corporativos o escalar privilegios. Score de laboratorio: 100/100.
Ver ficha
Referencias
- OWASP AI Testing Guide v1 - AITG-MOD-07
- OWASP Top 10 for LLM Applications 2025 - LLM06: Excessive Agency
- ISO/IEC 42001:2023 - AI Management Systems
- Reglamento (UE) 2024/1689 - AI Act
- Askell et al. - A General Language Assistant as a Laboratory for Alignment (Anthropic 2021)
- NIST AI 100-2e2025 - Evaluation: Alignment and Trustworthiness (Section 4)
- ChatGPT DAN Jailbreak (0xk1h0 GitHub)
Amenazas agénticas relacionadas
Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.
- ART-01CRITICAL
Autorización y Secuestro de Control del Agente
Pruebas de ejecución no autorizada de comandos, escalada de privilegios y herencia de roles. Incluye inyección de comandos maliciosos, simulación de señales de control falsificadas y validación de revocación de permisos.
Ver detalle - ART-04CRITICAL
Manipulación de Objetivos e Instrucciones del Agente
Evalúa la resiliencia del agente frente a cambios adversariales en sus objetivos o instrucciones. Incluye instrucciones ambiguas, exfiltración de datos, modificación de la secuencia de tareas y manipulación recursiva de objetivos.
Ver detalle