摘要
针对监督学习奖励模型存在的偏差及泛化局限,本文探究仅利用定义明确的世界状态表示能否实现跨域准确奖励预测。我们提出 StateFactory,一种利用语言模型将非结构化观测转化为分层对象 - 属性结构的因子化表示方法。该方法通过计算当前状态与目标状态在分层约束下的语义相似度来自然估计奖励。实验表明,StateFactory 诱导的紧凑表示结构具备强大的奖励泛化能力,在多个基准测试中优于现有模型,并显著提升了 Agent 在复杂环境中的任务规划成功率。
AI 推荐理由
论文提出状态工厂方法优化奖励预测,直接显著提升 Agent 规划性能,是规划核心研究。
研究机构
华东师范大学
香港科技大学
论文信息