摘要
针对保险等高风险垂直领域对严格合规及零幻觉的严苛要求,本文提出 INS-S1 模型家族。该研究通过端到端对齐范式,创新性地引入了可验证数据合成系统以构建精算推理数据集,并设计了结合动态数据退火、验证性推理(RLVR)与 AI 反馈的渐进式课程学习框架。实验表明,该方法在保持通用智能的同时,显著提升了领域任务性能,将幻觉率降至 0.6%,证明了专业领域强化无需以牺牲通用能力为代价。
AI 推荐理由
论文核心在于通过验证性推理(RLVR)和分层数据集构建,解决保险领域的复杂逻辑推理与幻觉控制问题。
研究机构
Ant Group
论文信息