Financial Reasoning Benchmark AI Agents Evaluation
摘要

人工智能代理虽能处理检索文档、计算公式等机械性金融分析任务,但面对定义专家分析师工作的开放式问题时仍显不足。现有基准未能涵盖此类问题,或依赖模型评判输出导致噪声与循环论证。本文提出 Hedge-Bench 1.0,包含 102 项基于真实对冲基金分析师显式推理轨迹的实际工作任务。该方法支持针对已验证专家步骤的确定性评分。测试显示,前沿模型与代理在该基准上的得分低于 16%。数据集与评估工具已开源。

AI 推荐理由

论文核心聚焦于金融领域的复杂开放性问题推理,构建基准评估代理的推理能力。

研究机构
Trata Brigham Young University Osmosis
论文信息
作者 Eric Cho, Shawn Huang, Alice Lu, Andy Lyu
发布日期 2026-06-02
arXiv ID 2606.03918
相关性评分 9/10 (高度相关)