Multi-Agent Debate Model Distillation Reasoning Enhancement Activation Steering Safety Alignment
摘要

多智能体辩论虽能提升大语言模型推理能力,但计算成本高昂。本文提出一种框架,通过结合辩论结构学习与动态奖励调度及长度剪枝的内化机制,将多智能体辩论蒸馏至单个 LLM 中。实验表明,该方法在减少高达 93% token 消耗的同时,性能匹配或超越显式辩论。此外,研究通过激活引导发现内化创造了特定于智能体的子空间,并展示了利用该机制定位和抑制恶意行为的应用潜力,为理解与控制内化推理行为提供了新视角。

AI 推荐理由

论文核心研究通过内化多智能体辩论机制来显著提升 LLM 的推理能力,并深入分析了其机理。

研究机构
Boston University
论文信息
作者 John Seon Keun Yi, Aaron Mueller, Dokyun Lee
发布日期 2026-04-27
arXiv ID 2604.24881
相关性评分 9/10 (高度相关)