Medical Agents Reinforcement Learning Multi-turn Planning Self-Distillation
摘要

临床推理需多步交互,但缺乏统一训练环境。本文构建了涵盖 10 个领域、3600+ 任务及专用工具的医疗强化学习环境。研究发现,多轮智能体易退化为冗长单轮对话,工具使用率下降,源于稀疏奖励与序列轨迹的不匹配。为此,提出轮级截断在线策略蒸馏(TT-OPD),利用教师模型提供密集正则化。该方法在 18 个基准中 10 个表现最佳,显著提升训练稳定性、控制响应长度并维持多轮工具使用能力。

AI 推荐理由

论文核心研究医疗场景下的多步交互规划,解决任务分解与长程决策中的奖励稀疏及崩溃问题。

研究机构
Upstage AI
论文信息
作者 Minbyul Jeong
发布日期 2026-05-01
arXiv ID 2605.02943
相关性评分 9/10 (高度相关)