Multi-Agent Value Alignment Negotiation RLAIF Collective Decision Making
摘要

针对现有大模型对齐方法在多利益相关者场景下的局限性,本文提出一种基于多智能体谈判的对齐框架。该框架通过让同一模型的两个实例扮演对立角色进行结构化对话,合成互利解决方案,并利用强化学习优化策略。实验表明,该方法在保持通用语言能力的同时,显著提升了模型的集体能动性对齐水平和冲突解决能力,为价值冲突场景下的集体决策提供了新路径。

AI 推荐理由

论文提出多智能体协商框架,通过自我博弈和强化学习实现价值观对齐与冲突解决能力的自我进化。

研究机构
Integral AI 东京大学
论文信息
作者 Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi
发布日期 2026-03-11
arXiv ID 2603.10476
相关性评分 9/10 (高度相关)