摘要
随着数据科学代理从辅助驾驶转向自动驾驶,静默的任务框架误判成为关键失败模式。现有基准仅评估流程运行,忽视任务未明确指定的问题。本文提出 Ambig-DS,包含预测目标歧义和评估目标歧义两套诊断套件。实验表明,歧义显著降低性能,主要体现为静默的错误承诺而非执行错误。虽然允许提问可恢复部分性能,但代理难以可靠判断何时提问。识别目标与评估标准的未指定性是当前评估缺失的瓶颈。
AI 推荐理由
论文聚焦 Agent 对任务歧义的理解与澄清推理,而非执行规划或技能调用。
研究机构
Novo Nordisk
论文信息