Tool Calling Voice Agents Evaluation Framework Omni-modal Models
摘要

针对语音代理日益增长的可靠工具使用需求,本文提出一种与数据集无关的框架,将现有文本基准转化为可控的音频工具调用评估,无需重新标注。该框架利用文本转语音、说话人变化及环境噪声生成配对实例。通过对七种多模态模型在转换后数据集上的广泛评估,发现性能高度依赖模型与任务,主要失败源于对语音参数值的误解。此外,研究还验证了开源模型作为评判者的有效性,为隐私保护评估提供了可复现的诊断工具。

AI 推荐理由

论文核心研究语音场景下的工具调用(Tool Calling)能力评估,直接对应技能学习主题。

研究机构
Dialpad Inc.
论文信息
作者 Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson et al.
发布日期 2026-05-14
arXiv ID 2605.15104
相关性评分 9/10 (高度相关)