Tool Use Trust Calibration Preference Learning Human-in-the-loop
摘要

本文将代理工具使用中的信任校准(即决定自动提出的动作是自主执行还是需人工批准)形式化为一个偏好学习问题。策略网关维护关于潜在人类风险容忍函数的高斯过程后验,通过二元批准/拒绝反馈的 Probit 似然进行观测,并仅在审批结果最不确定时升级至人工干预。研究表明,这在结构上属于偏好贝叶斯优化实例,继承了其推理机制和样本效率论证,但目标在于将动作空间分类为允许、阻止或询问区域,而非优化设计。

AI 推荐理由

论文核心研究 Agent 工具使用中的信任校准与自主决策机制,直接决定技能执行权限。

研究机构
未提供具体单位
论文信息
作者 Changkun Ou
发布日期 2026-05-18
arXiv ID 2605.19151
相关性评分 9/10 (高度相关)