ARC-AGI 少样本学习 视觉推理 测试时训练
摘要

ARC-AGI-2 是一个衡量机器从有限示例中泛化、解释符号意义并在不同语境下灵活应用规则能力的基准测试,包含人类直观的视觉谜题。本文探讨了利用 TinyLM 模型结合测试时微调(包括测试时训练 TTT 和专家乘积 POE 策略)来解决 ARC-AGI-2 谜题的方法。实验结果显示,该模型在训练集上达到了 96.1% 的准确率,在评估集上取得了 21.7% 的准确率,展示了在强泛化推理任务上的潜力与挑战。

AI 推荐理由

论文聚焦 ARC-AGI-2 基准,核心解决从有限样本中归纳规则、解释符号及灵活应用的推理难题。

研究机构
未提供
论文信息
作者 Caleb Talley, Vedant Tibrewal, Seun Adekunle, Weiwen Dong, Xinyu Wu et al.
发布日期 2026-05-01
arXiv ID 2605.01154
相关性评分 9/10 (高度相关)