Tool Use Voice Agents Benchmark Full-Duplex Disfluency
摘要

本文提出 Full-Duplex-Bench-v3 (FDB-v3),旨在自然语音条件及多步工具使用场景下评估口语模型。该数据集完全由标注了五类不流畅性的真实人类音频组成,并配对涉及四个任务域中链式 API 调用的场景。研究评估了六种模型配置在准确率、延迟及话轮转换维度的表现。结果显示,GPT-Realtime 在单次通过率和避免打断方面领先;Gemini Live 3.1 延迟最低但话轮转换率最低;传统级联基线虽话轮转换完美但延迟最高。所有系统在自我修正处理及困难场景下的多步推理方面仍存在一致性的失败模式。

AI 推荐理由

论文核心评估语音 Agent 在真实场景下的多步工具使用与 API 调用能力。

研究机构
National Taiwan University NVIDIA
论文信息
作者 Guan-Ting Lin, Chen Chen, Zhehuai Chen, Hung-yi Lee
发布日期 2026-04-06
arXiv ID 2604.04847
相关性评分 9/10 (高度相关)