Edge AI Efficient Reasoning LoRA Mobile LLM
摘要

大型语言模型凭借思维链推理在复杂任务中表现卓越,但其冗长的推理轨迹和高上下文需求阻碍了边缘部署。本文提出一种轻量级方法,结合 LoRA 适配器与监督微调,使小型 LLM 具备推理能力;并通过强化学习引入“预算强制”机制,显著缩短响应长度且几乎不损失精度。此外,利用并行测试时扩展解决内存受限解码问题,并设计动态适配器切换与 KV 缓存共享策略,优化首 token 延迟。实验表明,该方法在严格资源约束下实现了高效准确的推理。

AI 推荐理由

论文核心研究边缘设备上的高效推理机制,提出 LoRA 适配与预算强制等关键方法。

研究机构
Qualcomm AI Research
论文信息
作者 Yelysei Bondarenko, Thomas Hehn, Rob Hesselink, Romain Lepert, Fabio Valerio Massoli et al.
发布日期 2026-03-17
arXiv ID 2603.16867
相关性评分 9/10 (高度相关)