小红书精读:Learning Multiresolution Relevance for Hierarchical Generative Retrieval

less than 1 minute read

SID监督粒度不对?这篇来对齐🔧

各位算法同学们,同一 query 的多篇相关文档,在 SID 里常常共享粗前缀、只在细粒度才分叉,但标准 full-SID 监督把它们当成互不相干的目标路径。这篇把“相关性在不同检索分辨率上如何分配”显式建模,直接补上这个监督–分辨率错位。

📄 Learning Multiresolution Relevance for Hierarchical Generative Retrieval

🔧 把文档级 relevance 投影到每层 SID,得到一致的逐层条件分布:父节点质量等于子节点质量之和,不同深度看的是同一个 query 相关性。

🧩 RARS 用共享 query 表示加 prefix-conditioned predictor,让所有带相关性的兄弟分支参与局部竞争,局部损失按到达父节点的 relevance mass 加权。

⚙️ predictor 只在训练时使用,推理仍走标准自回归解码,不改变检索规则和索引。

📊 在 ESCI 英语、西班牙语、日语三个 locale 上,相比匹配的 full-SID 训练,自回归解码下都有一致提升。

📈 同一检索规则下,超过 grouped soft-target、decoder soft-target、sampled-tree 三类监督。

✅ 换不同 SID 结构和 relevance 定义后,增益仍然存在。

做生成式检索、SID/trie 解码、多正例监督的同学适合跟。落地先看多正例比例和中间层分叉是否常见;指标盯 Recall@k 和 NDCG,同时确认训练目标是否只盯 leaf。坑在于相关性标注不完整会模糊分支分布,另外预测器千万别带进推理,否则白做。

原文:AlphaXiv

Updated: