摘要
本文针对大语言模型在显式约束下进行工具使用这一高难度场景,提出了 CCTU 基准测试。该基准涵盖资源、行为、工具集和响应四个维度的 12 类约束,包含 200 个精心设计的测试用例。研究开发了可执行的约束验证模块以进行步骤级评估。实验结果显示,现有顶尖模型在严格遵循所有约束时的任务完成率不足 20%,且在收到反馈后自我改进能力有限,揭示了鲁棒工具智能体发展的关键瓶颈。
AI 推荐理由
论文核心评估 LLM 在复杂约束下的工具使用能力,直接对应技能学习主题。
研究机构
广州大学计算机科学与人工智能学院
论文信息