摘要
多语言大模型作为评判器广泛应用于跨语言评估,但受限于跨语言不一致性问题。现有方法通常将其视为噪声并通过投票缓解。本文指出这种不一致性可提供互补评估信号,并提出 SEMJ,一种利用跨语言不一致性进行迭代优化的自进化多语言评判器。该方法构建输入的多语言变体,收集独立评判与理由,将不一致输出反馈以触发自我反思和重评估。实验表明,SEMJ 在准确性和一致性上均优于基线方法。
AI 推荐理由
论文提出自进化多语言评判器,核心机制是利用不一致性进行自我反思与迭代优化。
研究机构
南京工程学院
论文信息