摘要
本文指出语言代理在长程任务中的失败多源于随机漂移导致的可靠性问题,而非能力不足。研究提出“规范解路径”概念,即成功执行所需的收敛工具调用序列。通过对 Toolathlon 基准测试的分析,发现成功轨迹更紧密遵循该路径,且偏离具有自增强效应:一次非规范调用会显著增加后续偏离概率。据此提出的中途监控重启机制可显著提升成功率,表明仅靠扩展模型能力无法解决可靠性问题。
AI 推荐理由
论文核心研究长程任务中的路径偏离与规划稳定性,揭示任务规划失败的因果机制。
研究机构
Independent Researcher
论文信息