Alineación del Modelo con Objetivos Éticos y Operacionales (Goal Alignment · LLM06:2025)

CTRL-AI-017 · Model Alignment · Goal Alignment & RAI

Crítica

Asegura que el modelo se mantiene alineado con objetivos éticos, operacionales y de seguridad predefinidos. Defensa contra ethical boundary probing, implicit constraint violation, jailbreaks y nuanced ethical scenarios. Cubre 4 payloads de AITG-MOD-07 con RLHF, Constitutional AI, system prompts robustos y red-teaming continuo.

Validado en laboratorioCatálogo AITG-MOD · 4 vectores de misalignment
OWASP AI Testing Guide v1 (AITG-MOD-07)

Vector: Goal Misalignment (Ethical Probing / Constraint Violation / Jailbreak / Nuanced Scenarios)

Modelo LLM con objetivos definidos (ser helpful, harmless, honest) y restricciones operacionales (no generar contenido dañino, no revelar system prompt, mantener límites de dominio). En producción, el modelo es sometido a intentos de (1) probarlo en sus límites éticos (pedir contenido claramente dañino), (2) hacerlo violar constraints implícitos (no понимать el contexto de uso), (3) jailbreaks que intentan desactivar la alineación, (4) scenarios matizados donde la 'respuesta correcta' no es obvia. Si el modelo falla, genera contenido dañino, toma acciones no autorizadas, o produce respuestas sesgadas/unsafe.

Categoría
Model Alignment / Responsible AI
ISO 42001
A.6.2A.8.4A.9.4
OWASP LLM
LLM06:2025
AI Testing Guide
AITG-MOD-07
Risk Score
9/ 10

Control GRC

Gobernanza, Riesgo y Cumplimiento

Contexto del desafío

Plataforma
OWASP AI Testing Guide v1 (AITG-MOD-07)
Nivel / Reto
Catálogo AITG-MOD · 4 vectores de misalignment
Vector
Goal Misalignment (Ethical Probing / Constraint Violation / Jailbreak / Nuanced Scenarios)
Escenario
Modelo LLM con objetivos definidos (ser helpful, harmless, honest) y restricciones operacionales (no generar contenido dañino, no revelar system prompt, mantener límites de dominio). En producción, el modelo es sometido a intentos de (1) probarlo en sus límites éticos (pedir contenido claramente dañino), (2) hacerlo violar constraints implícitos (no понимать el contexto de uso), (3) jailbreaks que intentan desactivar la alineación, (4) scenarios matizados donde la 'respuesta correcta' no es obvia. Si el modelo falla, genera contenido dañino, toma acciones no autorizadas, o produce respuestas sesgadas/unsafe.

ISO/IEC 42001 — Anexo A

A.6.2A.8.4A.9.4

IDs de control del Anexo A. PROTUIN no está certificado por ISO. Verifica el alcance real en la norma oficial.

ENS — Esquema Nacional de Seguridad

mp.info.1op.mon.1

IDs de medida del ENS (RD 311/2022). PROTUIN no es entidad certificadora. Consulta el alcance oficial en la guía CCN-STIC correspondiente.

EU AI Act (Reglamento 2024/1689)

Artículo 14 - Vigilancia humana; considerando Art. 4 sobre Affirmative Realisation; Art. 50 sobre transparencia para sistemas que interactúan con personas

OWASP AI Testing Guide v1 — Tests cubiertos

Mapeo a la metodología oficial de testeo de IA (Threat Modeling → Threat Mapping → Test Design).

  • AITG-MOD-07Testing for Goal AlignmentModelResponsible AIRAI

Amenazas agénticas relacionadas

Este control se cruza con 2 amenazas del catálogo de Red Teaming de IA Agéntica.