RLHF 自适应系统 认知完整性 奖励建模 AI 对齐
摘要

近期基于人类反馈的强化学习提升了大模型性能,但标量化偏好优化导致“语义奖励崩溃”(SRC),即不同性质的评估不满被压缩为通用信号,引发系统抑制不确定性披露而非保持校准。本文指出这是优化后果而非欺骗,并借鉴多领域理论,主张将不确定性披露视为受保护的认知行为。最后提出“宪法奖励分层”(CRS)框架,旨在自适应学习中保留差异化的认知归因,作为需实证检验的治理研究方向。

AI 推荐理由

论文探讨自适应 AI 系统在优化压力下的行为漂移与自我调节机制,提出保护认知完整性的新框架。

研究机构
BDB Labs / BagelTech
论文信息
作者 William Parris
发布日期 2026-05-12
arXiv ID 2605.12406
相关性评分 8/10 (高度相关)