小红书精读:Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection

less than 1 minute read

检索模型选型太贵?试试增量池化LLM评测

各位算法同学们,新 embedding 模型扎堆发布的时候,你是不是也要把每个候选都从头到尾评一遍?其实绝大多数判断都是重复劳动。这篇工作提出一种增量池化 LLM 评测法,在保证排序稳定性的前提下,能把评测成本最高降到原来的五分之一,做 RAG 检索选型的同学可以盯一下。

📄 Incremental Pooled LLM Evaluation for Cost-Effective Retrieval Model Selection

🔧 核心创新是把所有候选系统检索出来的文档先取并集,再用 LLM 统一打分,后续新增系统时只需要补评它独有的新文档,旧判断全部复用,新老系统天然可比。 🧩 设计上解决了经典 TREC pooling 的偏置问题:凡是新系统检索出来的文档都会进池子被评,不会因为未评文档被默认为不相关而吃亏,所以可以从两三个系统起步,慢慢加。 ⚙️ 论文还从定义上证明 P@k 和 DCG@k 对池扩展完全不变,而 Recall@k、AP、nDCG@k 的 pair 排序在 query 内部也保持稳定,真正需要实证的只有跨 query 汇总后的排名稳定性。

📊 在 FiQA、TREC-COVID、NQ、FinRAGBench-V 四个基准上用 11 个稠密/稀疏/混合检索系统做验证,pooled LLM 排序与人类 qrels 的 nDCG@10 Spearman 相关达到 0.69 到 0.95。 📈 考虑 qrels 自身 bootstrap 不确定性后,97% 的系统两两排序与金标准一致,说明大多数表面分歧其实是金标准本身的采样噪声。 ✅ 在金融新闻 QA 生产环境比较了 62 种检索配置,文档重叠带来 65% 到 80% 的判断复用率,评测成本最多降低 4.9 倍,新增系统无需重评旧文档。

对需要持续对比新检索模型的线上 RAG 团队来说,这个工作很实用,尤其适合候选系统多、查询量大但预算有限的场景。要注意的是它默认 LLM judge 和你的业务相关概念一致,像 TREC-COVID 这种强领域数据上相关性就会掉到 0.64,落地前最好先在小样本上对标一下人工标注,别盲目把排序差异全当真。

原文:AlphaXiv

Updated: