Auto-Bidding Hierarchical Agent Offline RL LLM Reasoning
摘要

针对在线广告竞价规模扩大导致手动竞价失效的问题,现有自动竞价方法因黑盒训练和数据覆盖有限而缺乏可解释性与泛化能力。本文提出分层大型自动竞价模型(LBM),利用大语言模型的推理能力提升策略性能。该模型包含负责推理的高层 LBM-Think 和负责动作生成的低层 LBM-Act。我们设计了双嵌入机制融合语言与数值模态,并提出 GQPO 离线强化微调技术,在不依赖模拟的情况下减少幻觉并优化决策。实验表明该方法在训练效率与泛化性上表现优越。

AI 推荐理由

论文核心提出分层模型,利用 LLM 推理能力解决自动竞价问题,显式构建推理模块。

研究机构
快手科技 北京,中国 南洋理工大学 新加坡
论文信息
作者 Yewen Li, Zhiyi Lyu, Peng Jiang, Qingpeng Cai, Fei Pan et al.
发布日期 2026-03-05
arXiv ID 2603.05134
相关性评分 9/10 (高度相关)