Autonomous ML LLM Fine-tuning Self-Improvement Agent System
摘要

针对垂直领域大模型微调耗时费力的问题,本文提出 FT-Dojo 环境与 FT-Agent 系统,旨在实现端到端的自主微调。该智能体模拟人类专家,利用评估驱动的反馈迭代诊断故障并优化策略。实验表明,专用微调智能体在多数任务上显著优于通用方案,并能从历史经验中累积学习以恢复失败,尽管在因果推理方面仍存在局限,展示了自主微调的潜力与边界。

AI 推荐理由

论文核心研究 Agent 通过评估反馈迭代诊断失败并优化微调策略,实现 LLM 的自我进化与改进。

研究机构
中国科学院自动化研究所 中国科学院大学
论文信息
作者 Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang et al.
发布日期 2026-03-02
arXiv ID 2603.01712
相关性评分 9/10 (高度相关)