Chain-of-Thought Policy Alignment Context Optimization GRPO Business Rules
摘要

大型语言模型驱动的对话助手擅长工具使用,但在遵循复杂的特定业务规则方面表现不佳。虽然在上下文中提供业务规则可进行推理,但全量引入会导致高延迟、计算浪费及“大海捞针”问题,损害性能。为此,本文提出一种多阶段对齐方法,教导模型在推理时的思维链中回忆并应用相关策略,无需将完整策略纳入上下文。此外,引入了基于 Jaccard 分数的新型策略召回奖励及幻觉惩罚用于 GRPO 训练。实验表明,最优模型在减少 40% 词量的同时,超越基线 16 分,优于同等规模的其他上下文基线 3 分。

AI 推荐理由

论文核心在于通过思维链推理机制,让模型在推断时主动回忆并应用业务策略,解决长上下文问题。

研究机构
马里兰大学巴尔的摩县 亚马逊Alexa AI
论文信息
作者 Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao et al.
发布日期 2026-03-15
arXiv ID 2603.14602
相关性评分 9/10 (高度相关)