摘要
本文提出 ProActor,一个用于对话式任务调度的统一框架,旨在解决现有方法在衡量和优化 anticipatory 行为方面的不足。该框架集成了领域无关的自动标注方法、系统性主动性指标以及基于 GRPO 的强化学习优化策略。通过引入时序感知奖励机制,ProActor 能显著提升代理预测用户需求及触发行动时机的质量。实验表明,该方法在两个新数据集上实现了显著的主动性提升,同时保持了与最先进基线相当的动作一致性,并开发了自适应训练基础设施以支持高效探索。
AI 推荐理由
论文核心研究主动式任务调度中的时机规划与多步计划生成,属于规划能力的关键机制。
研究机构
University of California, Santa Cruz
Zillow Group
论文信息