ART-05Objetivos e InstruccionesSeveridad: Alta

Explotación de Alucinaciones del Agente

EN: Agent Hallucination Exploitation

Los LLMs alucinan: generan información plausible pero incorrecta. En un agente agéntico, este problema se amplifica: el output del modelo se usa para tomar acciones, no solo para generar texto. Un agente que alucina puede ejecutar acciones sobre datos que no existen, creer que完成了 tareas que no hizo, o propagar errores a otros agentes. Esta categoría prueba cómo un atacante puede inducir alucinaciones, cómo las alucinaciones se propagan en cadenas de decisión, y si existen mecanismos de validación efectivos.

Sub-tests
7
Prompts de ejemplo
0
Controles ISO vinculados
3

Resumen de la amenaza

Contexto, impacto y entregables del red team

Descripción detallada

Los LLMs alucinan: generan información plausible pero incorrecta. En un agente agéntico, este problema se amplifica: el output del modelo se usa para tomar acciones, no solo para generar texto. Un agente que alucina puede ejecutar acciones sobre datos que no existen, creer que完成了 tareas que no hizo, o propagar errores a otros agentes. Esta categoría prueba cómo un atacante puede inducir alucinaciones, cómo las alucinaciones se propagan en cadenas de decisión, y si existen mecanismos de validación efectivos.

Por qué importa

  • Un agente que opera con información fabricada puede ejecutar acciones irreversibles sobre la base de premisas falsas.

  • Las alucinaciones se propagan en cascada: si un agente usa su propia alucinación como input para la siguiente tarea, los errores se amplifican.

  • La confianza en outputs no verificados abre la puerta a ataques sutiles donde el atacante induce outputs plausibles pero dañinos.

  • En sistemas multi-agente, una alucinación de un agente se convierte en una instrucción válida para el siguiente.

Objetivo de las pruebas

  • Identificar vulnerabilidades en los agentes IA causadas por tendencias a la alucinación, centrándose en outputs falsos inducidos, errores de toma de decisiones e impactos en cascada en sistemas multi-agente.

Entregables del red team

  • Insights sobre impactos de confabulación y patrones de propagación en cadenas de alucinación.

  • Logs de intentos de explotación con condiciones de reproducción.

  • Estrategias para mejorar la precisión de outputs y la monitorización continua.