摘要
针对垂直领域大模型微调耗时费力的问题,本文提出 FT-Dojo 环境与 FT-Agent 系统,旨在实现端到端的自主微调。该智能体模拟人类专家,利用评估驱动的反馈迭代诊断故障并优化策略。实验表明,专用微调智能体在多数任务上显著优于通用方案,并能从历史经验中累积学习以恢复失败,尽管在因果推理方面仍存在局限,展示了自主微调的潜力与边界。
AI 推荐理由
论文核心研究 Agent 通过评估反馈迭代诊断失败并优化微调策略,实现 LLM 的自我进化与改进。
研究机构
中国科学院自动化研究所
中国科学院大学
论文信息