摘要
本文研究了具有时变奖励函数的马尔可夫决策过程中子策略的时序连接问题。引入广义 Dijkstra 搜索(GDS),证明可通过中间最优子策略的时序组合恢复全局最优目标达成策略。受 GDS“搜索、选择、更新”原则启发,提出动态潜在路由(DLR),这是一种语言模型后训练方法,在单阶段训练中通过动态搜索联合学习离散潜在代码、路由策略及模型参数。在低数据微调场景下,DLR 在四个数据集和六个模型上表现匹配或优于监督微调,平均提升 6.6 个百分点,而先前离散潜在基线均不及监督微调。机制分析与代码消融实验表明,DLR 学会了具有不同因果角色的结构化路由行为。
AI 推荐理由
提出动态潜在路由机制,通过子策略时序组合实现目标导向行为,核心涉及任务规划与路径选择。
研究机构
Thoughtworks AI Labs (TAILS)
论文信息