Deep Research Agents Action Planning User Feedback Long-horizon Tasks
摘要

科学深度研究(DR)智能体通过综合论文生成报告,但现有反馈仅针对最终结果,难以优化中间动作。本文提出 DRACULA 数据集,收集专家对智能体提议动作(如“添加数据集部分”)的偏好及执行判断。研究发现,利用用户完整历史可显著提升大模型对动作选择的预测能力;用户隐含目标导致选择差异,需引入引导机制。基于模拟结果设计的在线干预策略能有效生成更符合用户意图的动作,揭示了长程智能体中“决定执行何种动作”比“执行动作”更具挑战性。

AI 推荐理由

论文核心研究深度智能体在长程任务中如何规划并选择用户期望的中间动作,属于任务规划的关键机制。

研究机构
University of Maryland Allen Institute for Artificial Intelligence (AI2) New York University
论文信息
作者 Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh et al.
发布日期 2026-04-26
arXiv ID 2604.23815
相关性评分 9/10 (高度相关)