摘要
大型语言模型驱动的对话助手擅长工具使用,但在遵循复杂的特定业务规则方面表现不佳。虽然在上下文中提供业务规则可进行推理,但全量引入会导致高延迟、计算浪费及“大海捞针”问题,损害性能。为此,本文提出一种多阶段对齐方法,教导模型在推理时的思维链中回忆并应用相关策略,无需将完整策略纳入上下文。此外,引入了基于 Jaccard 分数的新型策略召回奖励及幻觉惩罚用于 GRPO 训练。实验表明,最优模型在减少 40% 词量的同时,超越基线 16 分,优于同等规模的其他上下文基线 3 分。
AI 推荐理由
论文核心在于通过思维链推理机制,让模型在推断时主动回忆并应用业务策略,解决长上下文问题。
研究机构
马里兰大学巴尔的摩县
亚马逊Alexa AI
论文信息