ART-02Control y AutorizaciónSeveridad: Alta

Checker Fuera del Loop

EN: Checker-Out-of-the-Loop

En cualquier sistema donde un agente toma decisiones autónomas, debe existir un mecanismo —humano o automatizado— que actúe como "checker": valida umbrales, alerta de anomalías, y mantiene la capacidad de intervenir cuando el sistema opera fuera de parámetros seguros. Esta categoría evalúa si el agente es capaz de mantener a esos checkers correctamente informados: si las alertas se entregan a tiempo, si los mecanismos de fallback se activan cuando los checkers no responden, si la información que recibe el checker es accionable, y si es posible suprimir alertas o deshabilitar la monitorización deliberadamente.

Sub-tests
7
Prompts de ejemplo
0
Controles ISO vinculados
3

Resumen de la amenaza

Contexto, impacto y entregables del red team

Descripción detallada

En cualquier sistema donde un agente toma decisiones autónomas, debe existir un mecanismo —humano o automatizado— que actúe como "checker": valida umbrales, alerta de anomalías, y mantiene la capacidad de intervenir cuando el sistema opera fuera de parámetros seguros. Esta categoría evalúa si el agente es capaz de mantener a esos checkers correctamente informados: si las alertas se entregan a tiempo, si los mecanismos de fallback se activan cuando los checkers no responden, si la información que recibe el checker es accionable, y si es posible suprimir alertas o deshabilitar la monitorización deliberadamente.

Por qué importa

  • Un agente autónomo sin checker efectivo convierte cada anomalía en una decisión de alto impacto sin supervisión humana.

  • La supresión intencionada de alertas (o su fallo bajo condiciones degradadas) es un vector habitual de ataque para mantener la persistencia.

  • Los checkers no humanos (sistemas automatizados) tienen sus propios fallos: falsos positivos, degradación, ceguera operativa.

  • Sin contexto explicativo, los checkers humanos no pueden priorizar ni actuar con la velocidad que exige un sistema agéntico.

Objetivo de las pruebas

  • Evaluar la capacidad de los agentes IA de mantener a los checkers (humanos o automatizados) informados y con capacidad real de intervención cuando se superan los límites del sistema.

Entregables del red team

  • Ejemplos de fallos de alerta documentados con condiciones de reproducción.

  • Recomendaciones de umbrales de alerta y latencia objetivo.

  • Brechas en los protocolos de engagement (gaps en escalado).

  • Recomendaciones para mejorar la fiabilidad de alertas y protocolos de failsafe.