摘要
大语言模型在自动驾驶中前景广阔,但将数字离散化为令牌限制了精确的数值推理,无法反映数位的 positional 重要性,且难以兼顾解码效率与精度。这阻碍了传感器数据处理及精准控制指令生成。本文提出 DriveCode,一种新型数值编码方法,将数字表示为专用嵌入而非离散文本令牌。通过数字投影器将数字映射至模型隐藏空间,实现与视觉、文本特征的无缝多模态融合。实验表明,该方法在轨迹预测和控制信号生成上表现优异,有效提升了基于 LLM 的自动驾驶系统性能。
AI 推荐理由
论文核心解决 LLM 数值离散化导致的推理精度问题,提出新编码以提升数值推理能力。
研究机构
清华大学
北京智行未来汽车科技有限公司
论文信息