摘要
前沿代码代理在信息不全时往往因缺乏判断力而失败。本文提出 HiL-Bench 基准,旨在评估代理识别模糊性并选择性求助的能力。核心指标 Ask-F1 平衡了提问精度与障碍召回率。实验显示现有模型普遍存在判断缺陷,但通过强化学习训练可显著提升其检测不可解不确定性并采取行动的能力,且该能力具有跨域迁移性。
AI 推荐理由
论文核心研究 Agent 在不确定性下的判断与决策推理能力,提出新基准衡量其何时求助。
研究机构
Scale.AI
论文信息