小红书精读:Scaling Articulated Rationales for MLLM-based Recommendation

less than 1 minute read

🔍推荐模型开始读用户“为什么”

各位算法同学们,推荐系统最擅长学你点了什么,却几乎不学你为什么点。这篇快手 SARA 把问卷里的稀疏理由做成工业可用的排序特征:覆盖从 86,564 个作者扩到 10M 作者,线上还真的涨了 watch time、降了 Hate 反馈。

📄 Scaling Articulated Rationales for MLLM-based Recommendation

🔧 数据引擎先解决“理由太稀疏”:问卷延迟 10 秒触发、投递概率约 5% 动态调整,再用 LLM/Agent judge 筛质量,攒出 187,532 条 SARA-HQ。

🧩 对齐分两步:先用 SARA-HQ 做大规模 SFT,再用 Quality-Refining DPO 提质量,得到 SARA-7B,让理由生成从问卷覆盖的 86,564 位作者扩到全部 10M 作者。

⚙️ 理由不直接当文本塞模型,而是拆成正负两类特征:正理由进用户-作者交互建模,负理由进 negative-feedback history,用于跨语义相关作者泛化拒绝记忆。

📊 在未见作者上,SARA-7B 生成的 rationale 比通用 MLLM baseline 更 specific、relevant、grounded。

📈 多模态排序 baseline 上,正 rationale 集成让 watch time +0.99%。

✅ 负 rationale 集成让 Hate 反馈 -8.16%。

🕒 支持每日刷新,线上部署超过 30 天。

如果业务里有显式负反馈或问卷入口,这套“先收集再对齐再当特征”的路径可参考;要盯的是 rationale 质量评估器与排序特征的增益是否稳定,别只看生成文本像不像人话。坑在于问卷覆盖和用户疲劳,以及负理由跨作者泛化会不会误伤。

图 1

图 2

原文:AlphaXiv

Updated: