摘要
针对传统基准测试因饱和、主观性及泛化能力差而日益不可靠的问题,本文提出“交互式基准测试”这一统一评估范式。该范式旨在通过预算约束下的交互过程,评估模型主动获取信息及推理的能力。我们在两个场景中实例化了该框架:交互式证明(模型与裁判互动以推导逻辑和数学真理)及交互式游戏(模型进行策略推理以最大化长期效用)。结果表明,该方法能更稳健、真实地评估模型智能,并揭示当前模型在交互场景中仍有巨大提升空间。
AI 推荐理由
论文核心在于评估模型在交互过程中的逻辑与数学推理能力及策略性思维。
研究机构
普林斯顿大学
InteractiveBench
论文信息