Chain-of-Thought Function Calling Reasoning Budget Agent Reliability
摘要

本文系统研究了思维链(CoT)预算对函数调用代理性能的影响。研究发现,在 Qwen2.5-1.5B 模型上,简短推理(32 token)显著提升准确率,而长推理反而导致性能急剧下降甚至低于无推理基线。错误分解表明,简短 CoT 有效充当函数路由步骤,减少错误选择;长 CoT 则引发幻觉。基于此,作者提出函数路由 CoT(FR-CoT),通过结构化模板强制模型在推理初期承诺有效函数名,消除了函数幻觉并提供结构可靠性保证,无需精细调整预算。

AI 推荐理由

核心研究思维链长度对函数调用准确性的非单调影响机制,提出结构化推理方法。

研究机构
清华大学人工智能研究院
论文信息
作者 Xuan Qi
发布日期 2026-04-02
arXiv ID 2604.02155
相关性评分 9/10 (高度相关)