摘要
大语言模型日益依赖显式推理解决编码任务,但其推理质量评估仍具挑战。现有评估器非专为编码设计,且基准多集中于代码生成。本文提出 CodeRQ-Bench,首个涵盖生成、摘要和分类三类任务的推理质量基准。通过分析不匹配案例,识别五大局限并提炼四项设计洞察。据此提出 VERA,一种结合证据验证与歧义感知评分修正的两阶段评估器。实验表明,VERA 在多个数据集上显著优于强基线,大幅提升了评估指标。
AI 推荐理由
论文核心聚焦于编码任务中 LLM 推理质量的评估基准与方法,直接针对推理能力。
研究机构
University of California, Irvine
论文信息