摘要
针对现有大语言模型评估依赖静态数据集、难以捕捉模型 evolving 推理能力的局限,本文提出一种以智能体为中心的动态基准范式。该协议通过教师智能体生成问题、协调者智能体验证有效性、学生智能体求解的迭代机制,实现基准难度的自动扩展。采用需跨句逻辑推断的文本异常检测作为评估形式,系统性地揭示了传统基准未能发现的角落案例推理错误。该方法将评估焦点从固定数据集转向动态协议,为评估不断进化的语言模型提供了可持续方向。
AI 推荐理由
论文核心在于评估 LLM 推理能力,提出动态协议以暴露传统基准无法发现的推理错误。
研究机构
LG AI 研究院,计算机工程系,汉阳大学外国语学院
论文信息