Benchmark Tool Use Financial Agents MCP
摘要

本文提出了 FinMCP-Bench,这是一个用于评估大语言模型(LLM)通过调用金融模型上下文协议(MCP)工具解决现实金融问题的新基准。该基准包含 613 个样本,涵盖 10 个主要场景和 33 个子场景,结合真实与合成查询以确保多样性。它集成了 65 个真实金融 MCP,并提供单工具、多工具及多轮对话三种测试类型,以评估不同任务复杂度下的模型表现。研究系统评估了主流 LLM,并提出了明确衡量工具调用准确性与推理能力的指标,为金融 LLM 智能体研究提供了标准化且具有挑战性的测试平台。

AI 推荐理由

论文核心在于评估 LLM 在金融场景下的工具调用能力,直接对应技能学习主题。

研究机构
Owen Dianjin Team, Alibaba Cloud Computing
论文信息
作者 Jie Zhu, Yimin Tian, Boyang Li, Kehao Wu, Zhongzhi Liang et al.
发布日期 2026-03-26
arXiv ID 2603.24943
相关性评分 9/10 (高度相关)