ARC-AGI 抽象推理 任务生成 推理链 基准测试
摘要

针对 ARC-AGI 基准测试中因过拟合和数据泄露导致的进度评估困难,本文提出了 ARC-TGI(ARC 任务生成器清单)。这是一个开源框架,旨在生成保留潜在规则的多样化视觉网格任务。其核心在于面向求解器的表示形式,将每个生成的任务与自然语言输入、转换推理链及部分评估的 Python 代码配对。ARC-TGI 支持任务级约束,确保训练样本能充分暴露推断底层规则所需的变体,克服了独立采样无法保证人类可解性的缺陷。所有生成器均经过人工优化与本地验证,以确保网格和推理轨迹的自然性与一致性。该研究发布了 461 个生成器,覆盖大量 ARC 任务,实现了可扩展的数据集采样与受控基准测试。

AI 推荐理由

论文核心聚焦于抽象推理与规则归纳,提供推理链模板以解决 ARC-AGI 难题。

研究机构
德累斯顿工业大学 亚马逊 蒂宾根信息中心 汉诺威大学
论文信息
作者 Jens Lehmann, Syeda Khushbakht, Nikoo Salehfard, Nur A Zarin Nishat, Dhananjay Bhandiwad et al.
发布日期 2026-03-05
arXiv ID 2603.05099
相关性评分 9/10 (高度相关)