摘要
在分层推理中,失败常源于代理在未识别关键信息缺失时错误提交分支。本文提出 ACTION-RATING 框架,将澄清请求纳入代理动作空间,使其与导航动作在同一序数尺度上竞争,从而使求助行为在中间状态可见。该机制衍生出强制性与机会性两种信息寻求模式。在关税分类任务上的实验显示,信息寻求有效性显著提升,且该模式独立于答案质量存在,证明了代理定位求助时机能力的实证分离性。
AI 推荐理由
论文核心研究分层推理中的决策机制,通过自我门控澄清解决中间状态信息缺失导致的推理失败。
研究机构
Amazon Web Services
论文信息