摘要
针对多模态大语言模型(MLLM)驱动的移动代理存在的过度执行或过度求助问题,本文提出 Mobile-Aptus 框架。该框架包含交互能力增强与置信度偏差校正两阶段:首先通过监督微调使代理输出动作及置信度评分;其次结合语义相似度检索与直接偏好优化,提升置信度准确性。实验表明,该方法在多个基准测试中显著优于现有基线,大幅提升了任务成功率并减少了不必要的人工干预,实现了更鲁棒的自主交互。
AI 推荐理由
论文核心研究移动 Agent 的工具使用与交互技能,通过置信度机制优化执行与求助行为。
研究机构
Pengzhou Cheng
Yuan Guo
Aston Zhang
Zhuosheng Zhang
论文信息