Adaptive Learning Multi-Agent System Reinforcement Learning Policy Governance
摘要

针对在线广告治理中因监管政策非平稳性导致的标签不一致与推理模糊问题,本文提出 ARGUS 系统。该系统通过多智能体对抗仲裁实现进化强化,采用三阶段框架:策略种子初始化、基于“公诉人 - 被告 - 裁判”架构的对抗标签修正,以及利用三方辩证讨论挖掘潜在违规知识。结合 RAG 增强策略知识与思维链合成作为动态奖励,ARGUS 使推理路径与 evolving 法规同步。实验表明,其在极少黄金数据下显著优于传统微调基线,实现了卓越的策略自适应学习。

AI 推荐理由

论文核心提出基于对抗仲裁的进化强化机制,使系统能自适应不断变化的监管策略。

研究机构
Tencent Dalian University of Technology Tsinghua University Peking University Zhejiang University
论文信息
作者 Deyi Ji, Junyu Lu, Xuanyi Liu, Liqun Liu, Hailong Zhang et al.
发布日期 2026-05-04
arXiv ID 2605.02200
相关性评分 9/10 (高度相关)