小红书精读:Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning
网页投毒分三级,AI搜索代理栽在哪一步
🎯 各位算法同学们,当几个看似独立的网页都在交叉引用同一个不存在的产品,AI搜索代理往往会先采信后验证,而且验证完也不一定翻案。这篇工作提出的HAE-GEO基准,把“暴露→采信→验证→恢复→终答”这条完整路径拆开统计,让你看清agent到底是在哪一道环节上被假证据带走的。
📄 Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning
🔧 把评估粒度从最终答案改成轨迹级:显式追踪暴露、采信、验证、恢复、终答五种状态,能区分是“被假证据骗进去”还是“验证之后没自纠”。 🧩 核心创新是分层投毒机制:同一句假话分别按L1直接断言、L2上下文伪装、L3跨页面交叉印证来包装,控制住虚构品牌和查询,再逐步加难度。 ⚙️ 配套了一个干净与投毒配对的语料库:72,039个真实网页,每个攻击层级再注入770个投毒页面,覆盖8个消费品类、154个品牌,让agent用多轮Search-Scrape真实搜索。
📊 在120条主评测query上跑了10个闭源和开源agent,得出了几个很一致的结论。 📈 agentic搜索确实比静态全上下文检索更能压低最终推荐被污染的比例,也就是说“多找几次”能减少最后翻车。 📉 但是攻击升级到L3表面佐证时,agent的证据识别表现反而比L1更差,看起来来源越互相印证,反而越难被识破。 ✅ 防御性prompt能明显增加验证动作,可验证完后真正改成正确结论的比例依然很低——看得见是坑,还是踩了进去。
💡 对做Agent安全评估的团队,这个基准最有用的地方是定位拦截点:最该关注的指标不是最终acc,而是Verification到Recovery的转化率。实际落地中最大的坑是防御prompt只是让agent“表演验证”,缺乏把验证结果反馈到结论的机制,所以想自救还得靠搜索策略或记忆结构上动刀。


原文:AlphaXiv