小红书精读:Learning Multiresolution Relevance for Hierarchical Generative Retrieval
SID监督粒度不对?这篇来对齐🔧
各位算法同学们,同一 query 的多篇相关文档,在 SID 里常常共享粗前缀、只在细粒度才分叉,但标准 full-SID 监督把它们当成互不相干的目标路径。这篇把“相关性在不同检索分辨率上如何分配”显式建模,直接补上这个监督–分辨率错位。
📄 Learning Multiresolution Relevance for Hierarchical Generative Retrieval
🔧 把文档级 relevance 投影到每层 SID,得到一致的逐层条件分布:父节点质量等于子节点质量之和,不同深度看的是同一个 query 相关性。
🧩 RARS 用共享 query 表示加 prefix-conditioned predictor,让所有带相关性的兄弟分支参与局部竞争,局部损失按到达父节点的 relevance mass 加权。
⚙️ predictor 只在训练时使用,推理仍走标准自回归解码,不改变检索规则和索引。
📊 在 ESCI 英语、西班牙语、日语三个 locale 上,相比匹配的 full-SID 训练,自回归解码下都有一致提升。
📈 同一检索规则下,超过 grouped soft-target、decoder soft-target、sampled-tree 三类监督。
✅ 换不同 SID 结构和 relevance 定义后,增益仍然存在。
做生成式检索、SID/trie 解码、多正例监督的同学适合跟。落地先看多正例比例和中间层分叉是否常见;指标盯 Recall@k 和 NDCG,同时确认训练目标是否只盯 leaf。坑在于相关性标注不完整会模糊分支分布,另外预测器千万别带进推理,否则白做。
原文:AlphaXiv