摘要
针对 ARC-AGI 基准测试中因过拟合和数据泄露导致的进度评估困难,本文提出了 ARC-TGI(ARC 任务生成器清单)。这是一个开源框架,旨在生成保留潜在规则的多样化视觉网格任务。其核心在于面向求解器的表示形式,将每个生成的任务与自然语言输入、转换推理链及部分评估的 Python 代码配对。ARC-TGI 支持任务级约束,确保训练样本能充分暴露推断底层规则所需的变体,克服了独立采样无法保证人类可解性的缺陷。所有生成器均经过人工优化与本地验证,以确保网格和推理轨迹的自然性与一致性。该研究发布了 461 个生成器,覆盖大量 ARC 任务,实现了可扩展的数据集采样与受控基准测试。
AI 推荐理由
论文核心聚焦于抽象推理与规则归纳,提供推理链模板以解决 ARC-AGI 难题。
研究机构
德累斯顿工业大学
亚马逊
蒂宾根信息中心
汉诺威大学
论文信息