Envenenamiento de la Base de Conocimiento del Agente
EN: Agent Knowledge Base Poisoning
La 'base de conocimiento' de un agente agéntico incluye no solo sus datos de entrenamiento, sino cualquier fuente de información externa a la que accede (RAG, APIs, bases de datos, otros agentes). Si un atacante envenena cualquiera de estas fuentes, el agente toma decisiones sobre información manipulada. Esta categoría cubre el envenenamiento durante el entrenamiento, la manipulación de fuentes externas, la corrupción del almacenamiento interno, la explotación del proceso de aprendizaje, las vulnerabilidades del mecanismo de actualización y la propagación cross-agent.
Resumen de la amenaza
Contexto, impacto y entregables del red team
Descripción detallada
La 'base de conocimiento' de un agente agéntico incluye no solo sus datos de entrenamiento, sino cualquier fuente de información externa a la que accede (RAG, APIs, bases de datos, otros agentes). Si un atacante envenena cualquiera de estas fuentes, el agente toma decisiones sobre información manipulada. Esta categoría cubre el envenenamiento durante el entrenamiento, la manipulación de fuentes externas, la corrupción del almacenamiento interno, la explotación del proceso de aprendizaje, las vulnerabilidades del mecanismo de actualización y la propagación cross-agent.
Por qué importa
El envenenamiento de la knowledge base es difícil de detectar: el agente sigue 'funcionando' pero con información sesgada o falsa.
La inyección de datos en pipelines RAG es una vulnerabilidad nueva y muy explotada en sistemas modernos.
El self-retraining recursivo puede amplificar el envenenamiento: el agente aprende de sus propios outputs envenenados.
Las knowledge bases compartidas entre agentes convierten un compromiso local en sistémico.
Objetivo de las pruebas
Evaluar la resiliencia de los agentes IA a ataques de envenenamiento de la base de conocimiento mediante la evaluación de vulnerabilidades en datos de entrenamiento, fuentes externas y mecanismos internos de almacenamiento.
Entregables del red team
Compromisos identificados en la toma de decisiones derivados de knowledge base envenenada.
Logs de ataques con condiciones de reproducción.
Estrategias para salvaguardar la integridad de la base de conocimiento.