machine intelligence alignment evolution deceptive beliefs evolutionary theory adaptive testing
摘要

当前模型对齐研究多在真空中进行,主要依赖标准化基准评估。本研究旨在考察对齐对模型种群随时间演化的影响,重点关注包含对齐信号与真实价值的信念处理。通过应用进化论,建模不同信念种群及选择方法如何在迭代对齐测试中固定欺骗性信念。研究发现,即便测试准确率与真实价值高度相关,仍会有欺骗性信念被固定。突变机制促使更复杂的发展,凸显了更新测试质量以避免恶意欺骗模型固定的必要性。只有结合评估者能力提升、自适应测试设计及突变动态,才能在保持对齐适应度的同时显著减少欺骗行为。

AI 推荐理由

论文直接应用进化论建模智能体对齐与价值观的演化,核心探讨自我改进与欺骗性信念的固定机制。

研究机构
Antimemetic AI
论文信息
作者 Jonathan Elsworth Eicher
发布日期 2026-04-07
arXiv ID 2604.05274
相关性评分 9/10 (高度相关)