摘要
本文系统研究了思维链(CoT)预算对函数调用代理性能的影响。研究发现,在 Qwen2.5-1.5B 模型上,简短推理(32 token)显著提升准确率,而长推理反而导致性能急剧下降甚至低于无推理基线。错误分解表明,简短 CoT 有效充当函数路由步骤,减少错误选择;长 CoT 则引发幻觉。基于此,作者提出函数路由 CoT(FR-CoT),通过结构化模板强制模型在推理初期承诺有效函数名,消除了函数幻觉并提供结构可靠性保证,无需精细调整预算。
AI 推荐理由
核心研究思维链长度对函数调用准确性的非单调影响机制,提出结构化推理方法。
研究机构
清华大学人工智能研究院
论文信息