小红书精读:PDMR: Passage-Driven Multi-ID Document Retrieval
文档只配一个ID?PDMR拆段多ID
各位算法同学们,生成式检索里每个文档只绑定一个标识符,真的是最优解吗?PDMR这篇工作用实验回答:不是,把文档拆成段落、每个段落给一个ID,看起来绕路,反而能提升检索效果。
📄 PDMR: Passage-Driven Multi-ID Document Retrieval
🔧 大多数GR模型假设“一文档一ID”,把多面内容硬塞进一条序列里。PDMR先按语义把长文档切成小段落,再用LLM挑出关键片段,为每个片段生成标题式ID,相当于给文档开了多个访问入口。 🧩 训练时把相关文档的所有段落ID都当作合法目标,用加权多目标损失分散概率质量,消除一对多监督带来的歧义;推理时生成任意一个段落ID就能映射回原文档。 ⚙️ 和MINDER那种多视图描述不同,PDMR不是给整篇文档换花样,而是真正操作段落级语义单元,并且只做一次受约束解码,不额外增加推理开销。
📊 NQ320K上,PDMR在Recall@1和MRR@100上双双超过强生成式与非生成式基线。 📈 MS MARCO Document上,PDMR的Recall@1和MRR@10在报告方法中最高,Recall@10也保持在有竞争力的一档。 ✅ 消融实验显示,段落级监督、TC-ID标识符设计、训练查询增强、多目标学习这四个模块都能带来互补增益。
我觉得这套路适合长文档和弱标注场景,落地时的主要坑是前端的LLM切段和ID构建会引入额外成本,需要控制质量。复现时盯着Recall@1和MRR@10,同时调好多目标损失的权重,防止模型在多个候选ID之间摇摆。
原文:AlphaXiv