摘要
本文提出 ActuBench,一个多智能体 LLM 流水线,旨在自动生成并评估符合国际精算协会大纲的高级精算评估项目。该流程通过适配器分离四个 LLM 角色:起草、干扰项构建、独立验证及修复循环、辅助摘要。研究评估了来自八个提供商的 50 种语言模型。主要发现包括:多智能体验证机制至关重要,能识别并修复大部分初始缺陷;本地部署的开源模型在成本性能比上表现优异;多选题与 LLM 裁判评分的排名存在显著差异,后者更能区分前沿模型能力。
AI 推荐理由
论文核心构建精算推理任务基准,评估多模型在复杂逻辑与数学推理上的表现。
研究机构
TH Köln, Institut für Versicherungswesen (ivwKöln)
论文信息