小红书精读:Netflix Artwork Personalization via LLM Post-training

less than 1 minute read

Netflix封面个性化:LLM后训练提升5%

各位算法同学们,同一个剧的封面,在不同用户眼里值多少?Netflix用LLM后训练来做封面个性化,效果比生产模型高5%。这篇把封面选择从“一张图走天下”变成了“按用户口味生成式选图”,思路挺有意思。

📄 Netflix Artwork Personalization via LLM Post-training

🔧 核心是把多幅封面图像用视觉语言模型转成约200词的文本caption,这样LLM就能直接处理多模态输入,而且能扩展到40+个候选封面。 🧩 后训练走的是SFT + 推理蒸馏 + DPO的组合:先用110K样本做监督微调,再用Qwen 3-32B生成推理过程做蒸馏,最后用DPO对齐偏好。 ⚙️ 为了让模型区分不同候选,往prompt里加了 两个新token,推理时用n-gram匹配从生成的文本里挑出最可能的封面。

📊 训练集110K条,评估集5K条user-title对,都是没见过的组合。 📈 用SFT+推理蒸馏,比Netflix生产模型提升5%。 ✅ 只用DPO,也能提升3%。

对做推荐系统、内容个性化、尤其是封面/图文选择这类细粒度任务的人,这篇很有参考价值。但要留意一个坑:caption是压缩过的图像信息,复杂视觉细节可能有损失;另外5%是相对提升,具体还得看IPS等指标。如果要在线上落地,还得衡量caption生成的耗时和成本,不一定比现有图像特征方案划算。

图 1

原文:AlphaXiv

Updated: