摘要
评估大语言模型在复杂定量金融任务中的推理能力是一项关键挑战。现有基准难以隔离代理解析查询与协调计算的核心能力。为此,本文提出一种新的评估方法与基准,旨在严格衡量 LLM 代理在金融时间序列分析中的推理表现。通过“时间序列增强生成”(TSAG)框架,我们让 LLM 代理将定量任务委托给可验证的外部工具。基于包含 100 个金融问题的基准,我们对比了多种前沿代理在工具选择准确性、忠实度及幻觉方面的表现。结果表明,优秀代理可实现近乎完美的工具使用准确率且幻觉极少,验证了工具增强范式的有效性。
AI 推荐理由
论文核心研究 Agent 如何调用外部工具执行量化任务,评估工具选择准确性,属技能学习范畴。
研究机构
SingularityNET Foundation
论文信息