摘要
本文系统分析了 ARC-AGI-3 的 25 个公开游戏,发现非智能策略即可通关,表明该基准无法有效区分智能探索与简单启发式方法。为此,作者提出了自适应认知推理智能体(AERA),采用“探索 - 验证 - 规划”三阶段框架,在极小模型上显著优于随机基线。研究形式化了速度与深度的权衡机制,指出当前交互推理基准在衡量探索能力上的失效,并强调了私有评估集的重要性。
AI 推荐理由
论文提出认知推理智能体 AERA,核心解决交互式环境下的探索与推理权衡问题。
研究机构
未提供
论文信息