动态规划 智能体基准 时空推理 强化学习
摘要

针对现实应用中代理需应对任务中断并重新规划的挑战,本文提出 STT-Arena 基准。该基准包含 227 个高质量交互任务,涵盖九类时空冲突,旨在评估模型在时空动态变化下的自适应重规划能力。实验显示现有顶尖模型准确率不足 40%,主要存在状态滞后、误判触发器及缺乏验证等错误模式。基于此,作者提出迭代轨迹优化技术并结合在线强化学习,构建了 STT-Agent-4B,其性能显著优于现有前沿模型。

AI 推荐理由

论文核心研究动态环境下的任务重规划与自适应策略,属于规划能力的关键机制。

研究机构
香港科技大学计算机科学系 北京邮电大学网络与通信学院
论文信息
作者 Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan et al.
发布日期 2026-05-18
arXiv ID 2605.18548
相关性评分 9/10 (高度相关)