Research Agent Verification Long-horizon Reasoning Multi-step Problem Solving
摘要

本文提出 MiroThinker-1.7,一种专为复杂长程推理任务设计的研究智能体,并通过引入重型推理能力扩展为 MiroThinker-H1,以提升多步问题解决的可靠性。MiroThinker-1.7 通过强调结构化规划、上下文推理及工具交互的智能体中期训练阶段,优化了每一步交互的可靠性。MiroThinker-H1 进一步在局部和全局层面将验证机制直接融入推理过程,允许在推理期间评估并修正中间决策,同时审计整体推理轨迹以确保最终答案由连贯的证据链支持。实验表明,该模型在开放网络研究、科学推理及金融分析等基准测试中取得了最先进性能。

AI 推荐理由

论文核心在于通过验证机制增强复杂长程推理能力,直接提升多步问题解决可靠性。

研究机构
MiroMind
论文信息
作者 MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li et al.
发布日期 2026-03-16
arXiv ID 2603.15726
相关性评分 9/10 (高度相关)