Self-Correction Debiasing Self-Improvement Chain-of-Thought
摘要

尽管大型语言模型具备卓越的推理能力,但固有的社会偏见常在思维链过程中级联,导致持续的“偏见传播”。现有方法多关注静态约束,难以中断此过程。本文提出 Self-Debias 框架,将去偏重构为战略资源重分配问题,动态调整输出概率以修正偏见路径。该方法采用细粒度的轨迹级目标,选择性修订偏见后缀并保留有效上下文前缀。此外,集成基于一致性过滤的在线自改进机制,自主合成监督信号。仅需少量标注样本,即可激活高效的自我纠正,在保持通用推理能力的同时实现优越的去偏效果。

AI 推荐理由

论文提出自我纠正框架与在线自改进机制,核心在于模型的自我进化与去偏能力。

研究机构
暨南大学 南京理工大学 新加坡国立大学
论文信息
作者 Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An
发布日期 2026-04-09
arXiv ID 2604.08243
相关性评分 9/10 (高度相关)