Domain Adaptation Hallucination Control Reinforcement Learning Insurance LLM
摘要

针对保险等高风险垂直领域对严格合规及零幻觉的严苛要求,本文提出 INS-S1 模型家族。该研究通过端到端对齐范式,创新性地引入了可验证数据合成系统以构建精算推理数据集,并设计了结合动态数据退火、验证性推理(RLVR)与 AI 反馈的渐进式课程学习框架。实验表明,该方法在保持通用智能的同时,显著提升了领域任务性能,将幻觉率降至 0.6%,证明了专业领域强化无需以牺牲通用能力为代价。

AI 推荐理由

论文核心在于通过验证性推理(RLVR)和分层数据集构建,解决保险领域的复杂逻辑推理与幻觉控制问题。

研究机构
Ant Group
论文信息
作者 Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu et al.
发布日期 2026-03-15
arXiv ID 2603.14463
相关性评分 9/10 (高度相关)