Strategic Reasoning Forecasting Agents Benchmark Evaluation
摘要

本文提出 BTF-2 基准,包含 1417 个历史预测问题及固定研究语料库,旨在深入分析预测代理的准确性差异及其成因。该基准能检测微小的精度差距并区分研究与判断能力的强弱。通过构建优于现有前沿代理的预测模型,我们在无后见之明偏差下评估了代理的战略推理。研究发现,优秀预测者主要胜在事前分析盲点及考量黑天鹅事件;而当前代理的主要缺陷在于评估领导者动机、计划执行可能性及建模制度过程。

AI 推荐理由

论文核心评估代理的战略推理能力,分析其推理失败模式及改进策略。

研究机构
FutureSearch
论文信息
作者 Tom Liptay, Dan Schwarz, Rafael Poyiadzi, Jack Wildman, Nikos I. Bosse
发布日期 2026-04-28
arXiv ID 2604.26106
相关性评分 9/10 (高度相关)