LLM Evaluation Dynamic Benchmarking Reasoning Assessment Multi-Agent System
摘要

针对现有大语言模型评估依赖静态数据集、难以捕捉模型 evolving 推理能力的局限,本文提出一种以智能体为中心的动态基准范式。该协议通过教师智能体生成问题、协调者智能体验证有效性、学生智能体求解的迭代机制,实现基准难度的自动扩展。采用需跨句逻辑推断的文本异常检测作为评估形式,系统性地揭示了传统基准未能发现的角落案例推理错误。该方法将评估焦点从固定数据集转向动态协议,为评估不断进化的语言模型提供了可持续方向。

AI 推荐理由

论文核心在于评估 LLM 推理能力,提出动态协议以暴露传统基准无法发现的推理错误。

研究机构
LG AI 研究院,计算机工程系,汉阳大学外国语学院
论文信息
作者 Seungdong Yoa, Sanghyu Yoon, Suhee Yoon, Dongmin Kim, Ye Seul Sim et al.
发布日期 2026-02-27
arXiv ID 2602.23729
相关性评分 9/10 (高度相关)