研究人员发现,面向检索增强生成(RAG)系统的一种新型投毒方式正在出现。与把虚假内容集中写进单一恶意文档不同,这种方法会把错误结论拆成多个片段,分别嵌入几份看似正常的材料中,等模型同时检索到这些内容后,再拼接出错误叙事。
这项方法被命名为“微协同投毒”。研究者 Pedro Pereira 在论文中指出,这类攻击更难被传统检查发现,因为单独看每份文档时,异常特征并不明显,风险主要出现在多份文档被一并召回之后。
攻击方式转向分散拼接
RAG 系统的关键环节,是先从外部数据库中检索文档,再据此生成回答。论文认为,只要攻击者能影响数据库中的部分内容,就可能间接左右模型输出。
以往的投毒方式,通常依赖一段足够强的恶意文本,争取在检索结果中压过其他正常材料。微协同投毒则不同。它不依赖单一文档主导结果,而是让多个弱信号在同一次检索中叠加,最终把模型推向错误答案。
研究覆盖 108 种配置

为验证这种攻击是否只在个别场景有效,研究在 108 种不同的 RAG 配置下进行了测试。测试变量包括数据集、检索器架构、检索深度、数据库构成、被投毒数据库数量,以及最终生成答案的模型。
论文称,不同配置下都出现了相似结果:攻击效果主要来自多个来源中的弱对抗信号累积,而不是某一份恶意文档单独发挥作用。这意味着,该方法并不局限于某一种检索器或单一数据环境。
检索更多文档会放大风险
研究还指出,系统一次检索的文档数量越多,攻击成功的概率越高。原因在于,较高的 top-k 设置会增加多个投毒片段同时进入上下文的机会,从而更容易在生成阶段汇合成完整的错误叙事。
如果攻击者还能同时污染多个数据库,风险会进一步上升,因为分散在不同来源中的对抗信号更容易在同一次回答中聚合。
不过,论文也提到两项缓解因素:一是提高干净数据库的多样性,二是使用更强的检索器。前者可以稀释投毒片段的相对权重,后者则更有机会在检索阶段过滤掉这些较弱信号。
传统逐篇审查难以识别
研究认为,这类攻击最棘手的地方在于可见性较低。由于每份文档本身都可能显得合理,依赖逐篇检查文档的安全审查方式,未必能识别出问题。
真正的风险不在某一个文件里,而在多份文件被同时检索后形成的组合效应。论文因此提示,面向 RAG 的防御思路,可能需要从寻找单一恶意文档,转向分析多份文档之间的联动关系,以及它们在同一检索结果中的共同作用。









