摘要
人工智能代理虽能处理检索文档、计算公式等机械性金融分析任务,但面对定义专家分析师工作的开放式问题时仍显不足。现有基准未能涵盖此类问题,或依赖模型评判输出导致噪声与循环论证。本文提出 Hedge-Bench 1.0,包含 102 项基于真实对冲基金分析师显式推理轨迹的实际工作任务。该方法支持针对已验证专家步骤的确定性评分。测试显示,前沿模型与代理在该基准上的得分低于 16%。数据集与评估工具已开源。
AI 推荐理由
论文核心聚焦于金融领域的复杂开放性问题推理,构建基准评估代理的推理能力。
研究机构
Trata
Brigham Young University
Osmosis
论文信息