摘要
将多模态大语言模型(MLLM)用作裁判已成为新兴范式,但现有基准未能捕捉根本的评判能力。本文提出 M-JudgeBench,一个十维面向能力的基准,涵盖成对思维链比较、长度偏差避免及过程错误检测等任务,以诊断模型可靠性。针对发现的系统性弱点,作者提出 Judge-MCTS 框架,生成具有不同正确性和长度的成对推理轨迹,并据此训练出强大的 M-Judger 系列模型。实验表明,该方法在现有基准及新基准上均表现优越,为裁判模型评估与训练奠定了坚实基础。
AI 推荐理由
论文核心在于评估和提升多模态裁判模型的推理能力,通过思维链和 MCTS 生成推理轨迹。
研究机构
清华大学
ByteDance
论文信息