摘要
针对大型推理模型(如 DeepSeek-R1)生成长思维链时与现有检索增强生成(RAG)系统不匹配的问题,本文提出 ReaLM-Retrieve 框架。该框架通过三步创新实现推理感知检索:步骤级不确定性检测器识别知识缺口、学习最佳干预时机的检索策略、以及高效集成机制。实验表明,该方法在多个基准测试中显著提升了答案 F1 分数,同时大幅减少了检索调用次数,实现了效率与精度的新平衡。
AI 推荐理由
论文核心解决大型推理模型在长思维链中的动态检索问题,直接增强推理能力。
研究机构
The University of Hong Kong
Hong Kong, China
Brain Investing Limited
Stellarts AI Limited
论文信息