Prompt Optimization Self-Reflection Function Calling Automated Tuning
摘要

针对提示设计耗时且敏感的问题,本文提出反思式提示微调(RPT)框架。该方法利用大语言模型的函数调用能力模拟人类工程师工作流:通过诊断函数评估整体数据集,总结 recurring 失败模式并生成结构化报告。优化器结合历史报告记忆迭代修订提示,并支持置信度感知优化。实验表明,RPT 在多步推理和数学任务中显著提升性能与校准能力,能有效识别错误模式并进行针对性改进。

AI 推荐理由

论文提出基于反思和失败历史积累的提示自动优化框架,核心在于模型的自我改进与迭代进化。

研究机构
Megagon Labs
论文信息
作者 Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka
发布日期 2026-05-20
arXiv ID 2605.21781
相关性评分 9/10 (高度相关)