Rule Induction Benchmark Text Games LLM Evaluation
摘要

本文提出“英雄之旅”基准,用于评估目标导向 episodic 任务中的规则归纳能力。智能体需从演示中推断隐藏规则并执行多步操作。该基准涵盖属性与过程归纳两大类的八个任务,具备可控的词法 grounding 和可识别性条件。实验表明,当前最先进的大语言模型虽展现出一定的规则归纳能力,但在不同任务间表现不均且受限。执行过程构成主要瓶颈,而表面语义影响较小。针对归纳的引导方法提升了属性任务性能,但在过程任务上未见显著增益,表明过程归纳仍是开放挑战。

AI 推荐理由

论文核心研究规则归纳与逻辑推理能力,评估 LLM 在隐藏规则推断上的表现。

研究机构
得克萨斯大学奥斯汀分校语言学系
论文信息
作者 Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li
发布日期 2026-06-01
arXiv ID 2606.02556
相关性评分 9/10 (高度相关)