摘要
本文提出 BTF-2 基准,包含 1417 个历史预测问题及固定研究语料库,旨在深入分析预测代理的准确性差异及其成因。该基准能检测微小的精度差距并区分研究与判断能力的强弱。通过构建优于现有前沿代理的预测模型,我们在无后见之明偏差下评估了代理的战略推理。研究发现,优秀预测者主要胜在事前分析盲点及考量黑天鹅事件;而当前代理的主要缺陷在于评估领导者动机、计划执行可能性及建模制度过程。
AI 推荐理由
论文核心评估代理的战略推理能力,分析其推理失败模式及改进策略。
研究机构
FutureSearch
论文信息