小红书精读:Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation

less than 1 minute read

⚙️多模态推荐别再硬融,正交净化来破局

💡 各位算法同学们,你默认多模态特征对推荐都是正向的吗?这篇工作直接说“模态和谐”是个脆弱假设——视觉诱饵、语义错位这些模态噪声越融越脏。

📄 Beyond Modality Harmony: Orthogonal Purification and Topology-Guided MoE for Conflict-Aware Multimodal Recommendation

🛠️ 创新点集中在三个位置: 🔧 先建立协作锚点:只用纯ID嵌入跑图卷积,得到用户-物品的协同共识方向;再把视觉/文本特征几何分解为与锚点平行和正交两个分量,平行分量保留安全语义,正交分量被当作可疑噪声做能量保持截断,只矫正方向不砍表达能力。 🧩 融合阶段不搞零和博弈:传统softmax注意力给视觉加权重必然压制文本,OrthoRec改用拓扑感知的解耦sigmoid门控,让每个净化后的模态独立决定注入规模,权重不再抢一个总量。 ⚙️ safe-SSL目标给对比损失踩刹车:用几何冲突分数动态降低矛盾视觉-文本对的对比惩罚,避免被强行对齐拉崩表征。

📊 实验效果: 📈 三个Amazon真实数据集上,OrthoRec一致超过多个近期baseline,在Recall和NDCG指标上拿到SOTA。 ✅ 在注入模态噪声和item稀疏设置下,性能下降更小,表现出更强的抗欺骗鲁棒性。 🧪 消融显示去掉CGOP或TAR-MoE都有明显回退,验证两个模块各有其用。

✏️ 我的判断是,这个框架把多模态推荐从盲目融合拉回到“先共识、后融合”的路线,整体实现不复杂,对做推荐噪声治理的同学是个很好的对比参照。但落地时我会紧盯一个坑:协同锚点本身要够稳,如果交互数据很稀疏,锚点不准,正交净化反而可能放大错误方向,所以建议同时在长尾item上观测NDCG,别只看总体均值。

图 1

图 2

原文:AlphaXiv

Updated: