小红书精读:Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
检索之前先想一步?TTP把推理揉进召回✨
各位算法同学们,过去做个性化检索都是把用户历史拼进特征再学个向量,但有没有想过:与其让模型自己从嘈杂行为里猜意图,不如让它先把“这人到底想买啥”推理出来,再拿这个推理结果去检索?今天这篇美团和科大的工作就把这件事做成了端到端,线上订单量还涨了。
📄 Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval
🔧 核心创新是把用户历史序列和当前query一起喂给LLM,让它先输出一个
📊 在自建数据集上,TTP在General上Recall@20达到47.52%,比最强的隐式建模基线MAPs高1.76%;在Broad这种模糊query场景,Recall@20比Qwen-Embedding高7.47%,说明它对意图消歧特别有效。 📊 在公有Amazon和KuaiSearch上也是全面领先,Amazon的HR@20到90.17%,KuaiSearch的HR@20到21.94%,都比Decoupled-Stage这种拆成两段的强。 📈 线上A/B测试订单量提升0.46%,虽然数字不大,但检索场景这种量级已经能说明问题了。
总结一下,这个思路适合那些query短、历史行为丰富的电商/本地生活场景。注意点是推理会带来额外延迟,论文里加了长度惩罚来控制输出,落地时得评估线上时延;另外RL阶段的检索奖励依赖SFT模型打分,如果SFT模型本身很拉,奖励信号也不可信,所以先得把第一段训扎实。

原文:AlphaXiv