AI Safety Self-Evolution Emotional Cost Functions Agent Alignment
摘要

本文提出“情感成本函数”框架,旨在解决当前 AI 安全方法仅依赖数值惩罚而缺乏质性理解的局限。该框架通过构建“质性痛苦状态”,让 Agent 以丰富的叙事表征铭记不可逆后果,从而主动重塑其性格特征。架构包含后果处理器、性格状态、预期扫描和故事更新四个组件,模拟人类通过经验与文化积累智慧的过程。实验表明,该方法能使 Agent 在避免灾难的同时保持适度行动力,而非像传统基线那样过度拒绝,有效实现了基于后果认知的自我进化与安全对齐。

AI 推荐理由

论文提出情感成本函数机制,使 Agent 通过不可逆后果重塑自身特征与行为,属于自我进化核心研究。

研究机构
独立研究员
论文信息
作者 Pandurang Mopgar
发布日期 2026-03-15
arXiv ID 2603.14531
相关性评分 9/10 (高度相关)