小红书精读:MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation
大模型当老师,7B学生反超32B老师?
各位算法同学们,产品关系定义一变就要重新标数据的苦日子,可能到头了。这篇工作把大VLM当老师,蒸馏出7B小模型,零人工标注PR-AUC还反超32B大模型。
📄 MERGED: Multimodal Entity Resolution via Generated Expert Reasoning Distillation
🧩 多教师共识蒸馏:不用一个强模型直接生成标签,而是让两个大VLM对每个产品对分别给标签和推理理由;标签一致的样本进SFT,标签冲突的样本不丢弃,交给meta-judge大模型判断哪个推理更好,构造成偏好对。 ⚙️ 分段训练:先在共识高置信样本上做SFT,让7B学生学会当前关系定义下的决策边界和推理格式;再用DPO在分歧样本上优化,强化学生对硬样本的判别式推理,而不是死记标签。 🔁 低成本适配新关系:从已有checkpoint上重新跑一遍MERGED,只需要10K样本就能适配一个新关系定义,不用从零训练,几天内就能交付新任务。
📊 零人工标注下,MERGED在多语言电商数据上达到90.96% PR-AUC,比同一backbone用人工标签训练出的模型高了13.79%。 📈 对比Qwen2.5-32B-VL zero-shot,7B学生PR-AUC高出6.32%,推理成本只有32B的1/6(每百万预测$600 vs $3600)。 ✅ 对于新定义关系,只用10K样本做增量适配,PR-AUC达到89.48%,比zero-shot高6.97%;同时推理与标签的一致性超过32B baseline超过10%。
对做电商知识图谱或商品去重的同学,这条路很值得跟,尤其是业务里关系定义老变的情况。坑也有:教师VLM的质量决定蒸馏上限,教师选不好会带偏见;另外实验基于特定电商数据,换个域要自己重测。建议盯住两个指标:PR-AUC和reasoning alignment,光看acc容易被带偏。


原文:AlphaXiv