小红书精读:When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

less than 1 minute read

多轮RAG何时停?结构化裁判省3.7%检索

各位算法同学们,多轮RAG搜到什么时候该停?这篇工作用了一个2B小裁判,让Search-R1少检索77次,EM只掉0.6个点。最反直觉的是:它把停止建模成序列选择,而不是独立状态分类,所以哪怕状态排序变好了,线上策略也可能更差。对做自适应检索的人来说,这个坑必须知道。

📄 When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

🔧 核心创新是把S2G-RAG的结构化“充分性+缺失信息”判断迁移到冻结的Search-R1流程上,只训练一个Qwen3.5-2B的judge,不改reasoner、retriever、搜索预算。 🧩 Judge输出sufficient布尔值和gap_items列表,在线策略只用布尔字段的log-prob margin作为停止信号,结构化目标只用来正则化训练,避免早期误判。 ⚙️ 论文强调停止是轨迹级问题:策略由每条轨迹上第一个阈值交叉决定,状态分类指标再好看,也不代表线上安全,所以必须分开评估reachability、state ranking和first crossing。

📊 在800题的confirmatory测试集上,检索调用从2081降到2004,绝对减少77次,相对降3.70%。 📈 官方EM从0.44875降到0.44250,差值为−0.00625,损失0.625个百分点,95%区间上限是0,落在预先设定的允许损失2个百分点以内。 ✅ 69个early stop里42个安全、27个不安全,unsafe比例39.13%,验证时的STOP precision从0.9091掉到0.6216,说明这个策略远不算安全停止。

这篇真正有价值的地方在于把“省检索”和“省总推理成本”彻底拆开:judge自己也要算计算量,论文只报检索次数减少,没敢报总效率。落地时建议盯EM差值的置信区间和early-stop风险比例,纯看检索降幅容易被误导。对做RAG自适应停止的人是个干净的可复现基线,但想直接上生产还得加校准或风险控制。

原文:AlphaXiv

Updated: