摘要
本文提出了 FinMCP-Bench,这是一个用于评估大语言模型(LLM)通过调用金融模型上下文协议(MCP)工具解决现实金融问题的新基准。该基准包含 613 个样本,涵盖 10 个主要场景和 33 个子场景,结合真实与合成查询以确保多样性。它集成了 65 个真实金融 MCP,并提供单工具、多工具及多轮对话三种测试类型,以评估不同任务复杂度下的模型表现。研究系统评估了主流 LLM,并提出了明确衡量工具调用准确性与推理能力的指标,为金融 LLM 智能体研究提供了标准化且具有挑战性的测试平台。
AI 推荐理由
论文核心在于评估 LLM 在金融场景下的工具调用能力,直接对应技能学习主题。
研究机构
Owen Dianjin Team, Alibaba Cloud Computing
论文信息