Reinforcement Learning Tool Use Slide Generation Agent Evaluation
摘要

本文提出一个兼容 OpenEnv 的强化学习环境,使 LLM 智能体能够通过工具使用研究主题、规划内容并生成专业 HTML 幻灯片。我们引入多组件奖励系统,包含结构验证、渲染质量评估及一种新颖的“逆向规范奖励”,即通过让 LLM 从生成的幻灯片中恢复原始规范来衡量意图传达的忠实度。实验表明,仅微调 0.5% 参数的 Qwen2.5-Coder-7B 模型,其质量可达 Claude Opus 4.6 的 91.2%,并在指令遵循与工具使用合规性上显著优于基线,证明了这些因素比参数量更决定智能体任务表现。

AI 推荐理由

论文核心在于智能体通过工具使用生成幻灯片,重点评估指令遵循与工具合规性。

研究机构
得克萨斯大学达拉斯分校 得克萨斯A&M大学
论文信息
作者 Karthik Ragunath Ananda Kumar, Subrahmanyam Arunachalam
发布日期 2026-03-17
arXiv ID 2603.16839
相关性评分 9/10 (高度相关)