摘要
大语言模型融入金融领域正推动从被动信息检索向动态智能体交互的范式转变。针对现有金融评估忽视工具执行复杂性、通用工具基准缺乏金融严谨性的问题,本文推出 FinToolBench,首个可运行的真实世界金融工具学习评估基准。该基准包含 760 个可执行金融工具及 295 项严格查询,并提出超越二元执行成功的评估框架,涵盖时效性、意图类型及监管合规性。此外,文章提出 FATR 基线以增强稳定性与合规性,旨在为可信金融 AI 设立新标准。
AI 推荐理由
论文核心聚焦金融领域工具使用评估,提出基准与检索推理方法,属技能学习核心研究。
研究机构
上海AI实验室
复旦大学
西安交通大学
腾讯
加州大学圣塔芭芭拉分校
同济大学
湖南大学
论文信息