小红书精读:Multimedia Asset Personalization via Multimodal Embeddings at Netflix
五个变一个?Netflix多模态嵌入
各位算法同学们,Netflix用了五个各管一类画布的推荐模型,到头来合并成了一个,靠的就是把CLIP图像嵌入塞进双塔模型。这篇论文讲的是工程落地经验,不是新算法,但里面有怎么用多模态嵌入做冷启动和视频预览的实际经验。
📄 Multimedia Asset Personalization via Multimodal Embeddings at Netflix
🔧 创新点一是给双塔模型的物品塔拼上CLIP图像嵌入,让模型能“看到”图片内容,实现跨标题、跨画布的知识迁移,一个模型服务全部五种画布,替换了五个单独训练的画布模型,冷启动表现有明显改善。 🧩 创新点二是视频预览个性化,用了自研三模态基础模型MediaFM,融合视觉SeqCLIP、音频wav2vec 2.0和时间文本信号,多模态效果明显强于单一模态。 ⚙️ 创新点三是一个离线代理任务:直接用嵌入预测流行度胜者,这个代理指标和线上结果相关,能提前筛掉一堆嵌入模型和版本,省掉不必要的端到端集成和A/B测试。
📊 实验效果上,一个模型顶替五个画布模型,跨画布知识共享,冷启动提升实打实。 📈 MediaFM在视频预览个性化上,离线IPS和在线A/B都超过了视觉-only的强基线。 ✅ 现在Netflix每个新的MediaFM checkpoint都要先过这个代理任务门禁,过了才放行。
总结:对做推荐和物料个性化的同学,这套“共享嵌入基础设施+代理筛选”的思路可以抄作业。但注意,不是套个CLIP就能复现,Netflix还有Embedding Store做嵌入版本管理,以及专门的探索流量做IPS评估,这些配套工程才是真正的地基。坑在于嵌入更新需要基础设施支撑,小团队直接硬上可能不划算。

原文:AlphaXiv