小红书精读:REDSI: Addressing the Reproducibility and Evaluation Consistency of Differentiable Search Indexing for Document Retrieval
复现DSI难?REDSI:原子ID最优🔧
各位算法同学们,你复现过DSI吗?同一份NQ320K,不同代码跑出来的Hits@1可能差三十个点——这锅不只在调参,更多是数据预处理和标识符实现不一致导致的。这篇REDSI把三种标识符统一了,还在小模型上发现了反直觉结论:原子标识符比想象中能打。
📄 REDSI: Addressing the Reproducibility and Evaluation Consistency of Differentiable Search Indexing for Document Retrieval
🔧 开源了第一个覆盖atomic、naive、semantic三种原始DSI标识符的实现,训练和评估管线统一,不用再各自复现各说各话。 🧩 把NQ320K的构建流程参数化,从NQ到检索语料的清洗、去重、选标题还是页码都能配置,解释了为什么以前各家数据差很多。 ⚙️ 在模型缩小场景下做了系统对比,不只看大模型刷分,还评估了参数效率、训练方式和解码策略,给后续研究提供了新角度。
📊 在论文给出的四种NQ320K重建变体上,T5-Base加atomic标识符的Hits@1为62.0~63.1,而原论文中DSI报告的atomic Hits@1是20.7(数据版本不同不能直接横比,但差距之大确实吓人)。 📈 在MRR@10上,44M参数的atomic模型甚至超过220M参数的naive或semantic模型——小参数反而赢过5倍大的模型,这个结论很反直觉。 ✅ 公平统一条件下,atomic在每个模型规模上都优于naive和semantic,而且训练也更快;之前的DSI复现很少把atomic当主力,这算是一种纠偏。
💭 这篇工作对想做生成式检索的同学来说是一个靠谱的起点,代码和数据都开放,能省掉很多自己踩坑的时间。个人觉得最有价值的判断是:别再默认模型越大越好,原子标识符在小参数区间反而更省更稳。落地时要注意坑:atomic需要往词表里加额外token,动态语料场景要重训;semantic虽然不扩词表但需要聚类预处理,选型前先想清楚自己的数据更新频率。
原文:AlphaXiv