摘要
大型语言模型凭借思维链推理在复杂任务中表现卓越,但其冗长的推理轨迹和高上下文需求阻碍了边缘部署。本文提出一种轻量级方法,结合 LoRA 适配器与监督微调,使小型 LLM 具备推理能力;并通过强化学习引入“预算强制”机制,显著缩短响应长度且几乎不损失精度。此外,利用并行测试时扩展解决内存受限解码问题,并设计动态适配器切换与 KV 缓存共享策略,优化首 token 延迟。实验表明,该方法在严格资源约束下实现了高效准确的推理。
AI 推荐理由
论文核心研究边缘设备上的高效推理机制,提出 LoRA 适配与预算强制等关键方法。
研究机构
Qualcomm AI Research
论文信息