摘要
本文报告了由 Gemini 3 Deep Think 驱动的数学研究代理 Aletheia 在首届 FirstProof 挑战中的表现。在规定时间内,Aletheia 根据多数专家评估,自主解决了 10 个问题中的 6 个(第 2、5、7、8、9、10 题),其中仅第 8 题专家意见未完全一致。为确保透明度,文章阐述了对 FirstProof 挑战的理解,披露了实验细节及评估方法。原始提示词与输出结果已开源。
AI 推荐理由
论文核心展示 Agent 在数学证明挑战中的自主推理与求解能力,属推理领域核心研究。
研究机构
Google DeepMind
论文信息