Self-Evolution Multilingual LLM LLM-as-a-Judge Self-Reflection
摘要

多语言大模型作为评判器广泛应用于跨语言评估,但受限于跨语言不一致性问题。现有方法通常将其视为噪声并通过投票缓解。本文指出这种不一致性可提供互补评估信号,并提出 SEMJ,一种利用跨语言不一致性进行迭代优化的自进化多语言评判器。该方法构建输入的多语言变体,收集独立评判与理由,将不一致输出反馈以触发自我反思和重评估。实验表明,SEMJ 在准确性和一致性上均优于基线方法。

AI 推荐理由

论文提出自进化多语言评判器,核心机制是利用不一致性进行自我反思与迭代优化。

研究机构
南京工程学院
论文信息
作者 Xiyan Fu, Wei Lu
发布日期 2026-06-06
arXiv ID 2606.08092
相关性评分 9/10 (高度相关)