小红书精读:Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

less than 1 minute read

📊 多模态LLM选checkpoint,别只盯平均分

各位算法同学们,多模态LLM训练到后期,候选checkpoint的分数差异可能比评估噪声还小,这时候靠平均分定胜负很容易翻车。这篇工作把checkpoint选择当成不确定性下的稳健决策问题,用多阶段排序和稳定性估计来解决,思路很直接。

📄 Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

🔧 多阶段渐进式排序:先点式打分过滤明显差的,再对剩下的候选做列表式排序,最后用两两对比解决临界情况。高置信度就提前收手,低置信度才增加评估力度,控制成本。 🧩 子采样稳定性估计:对评估集重复子采样,用非参数bootstrap算排名置信度,不假设分数分布,比参数化置信区间更贴合实际评估噪声。 ⚙️ 百分位聚合评分:用P50、P20、P80组合代替均值,惩罚尾部糟糕表现,同时适当奖励高分,避免离群值和模态崩塌干扰选择。

📊 把OCR模糊、不可判读的数据过滤掉后,排名翻转率从32.5%降到11.2%,跨次评估一致性从0.61升到0.84,说明数据可评估性是可靠选择的前提。 📈 列表式排序的Top-1一致性是0.82,点式只有0.38;两两对比进一步到0.89,分数标准差从0.112降到0.018,区分度明显增强。 ✅ 置信度方面,点式P(A>B)只有0.61,列表式0.83,两两对比0.92;换成百分位评分后排序稳定性从0.76提到0.85,最坏情况错误率从18.3%降到11.7%。

这套框架对正在做多模态LLM后期训练的同学很有参考价值,尤其是OCR-heavy场景。坑在于评估数据本身要先做质量清洗,否则排名反复横跳;复现时重点盯子采样置信度和listwise ranking,别迷信验证集loss走势。

图 1

图 2

原文:AlphaXiv

Updated: