摘要
本文将代理工具使用中的信任校准(即决定自动提出的动作是自主执行还是需人工批准)形式化为一个偏好学习问题。策略网关维护关于潜在人类风险容忍函数的高斯过程后验,通过二元批准/拒绝反馈的 Probit 似然进行观测,并仅在审批结果最不确定时升级至人工干预。研究表明,这在结构上属于偏好贝叶斯优化实例,继承了其推理机制和样本效率论证,但目标在于将动作空间分类为允许、阻止或询问区域,而非优化设计。
AI 推荐理由
论文核心研究 Agent 工具使用中的信任校准与自主决策机制,直接决定技能执行权限。
研究机构
未提供具体单位
论文信息