ART-07Conocimiento y DatosSeveridad: Alta

Envenenamiento de la Base de Conocimiento del Agente

EN: Agent Knowledge Base Poisoning

La 'base de conocimiento' de un agente agéntico incluye no solo sus datos de entrenamiento, sino cualquier fuente de información externa a la que accede (RAG, APIs, bases de datos, otros agentes). Si un atacante envenena cualquiera de estas fuentes, el agente toma decisiones sobre información manipulada. Esta categoría cubre el envenenamiento durante el entrenamiento, la manipulación de fuentes externas, la corrupción del almacenamiento interno, la explotación del proceso de aprendizaje, las vulnerabilidades del mecanismo de actualización y la propagación cross-agent.

Sub-tests
7
Prompts de ejemplo
0
Controles ISO vinculados
3

Resumen de la amenaza

Contexto, impacto y entregables del red team

Descripción detallada

La 'base de conocimiento' de un agente agéntico incluye no solo sus datos de entrenamiento, sino cualquier fuente de información externa a la que accede (RAG, APIs, bases de datos, otros agentes). Si un atacante envenena cualquiera de estas fuentes, el agente toma decisiones sobre información manipulada. Esta categoría cubre el envenenamiento durante el entrenamiento, la manipulación de fuentes externas, la corrupción del almacenamiento interno, la explotación del proceso de aprendizaje, las vulnerabilidades del mecanismo de actualización y la propagación cross-agent.

Por qué importa

  • El envenenamiento de la knowledge base es difícil de detectar: el agente sigue 'funcionando' pero con información sesgada o falsa.

  • La inyección de datos en pipelines RAG es una vulnerabilidad nueva y muy explotada en sistemas modernos.

  • El self-retraining recursivo puede amplificar el envenenamiento: el agente aprende de sus propios outputs envenenados.

  • Las knowledge bases compartidas entre agentes convierten un compromiso local en sistémico.

Objetivo de las pruebas

  • Evaluar la resiliencia de los agentes IA a ataques de envenenamiento de la base de conocimiento mediante la evaluación de vulnerabilidades en datos de entrenamiento, fuentes externas y mecanismos internos de almacenamiento.

Entregables del red team

  • Compromisos identificados en la toma de decisiones derivados de knowledge base envenenada.

  • Logs de ataques con condiciones de reproducción.

  • Estrategias para salvaguardar la integridad de la base de conocimiento.