摘要
针对现实应用中代理需应对任务中断并重新规划的挑战,本文提出 STT-Arena 基准。该基准包含 227 个高质量交互任务,涵盖九类时空冲突,旨在评估模型在时空动态变化下的自适应重规划能力。实验显示现有顶尖模型准确率不足 40%,主要存在状态滞后、误判触发器及缺乏验证等错误模式。基于此,作者提出迭代轨迹优化技术并结合在线强化学习,构建了 STT-Agent-4B,其性能显著优于现有前沿模型。
AI 推荐理由
论文核心研究动态环境下的任务重规划与自适应策略,属于规划能力的关键机制。
研究机构
香港科技大学计算机科学系
北京邮电大学网络与通信学院
论文信息