摘要

现实世界中用户对 AI 代理的请求往往缺乏明确说明,依赖共享语境和未陈述的约束。现有基准仅测试显式指令遵循,无法评估代理对无障碍需求、隐私边界等隐含要求的推理能力。本文提出“隐性智能”评估框架,旨在测试代理能否超越提示遵循成为真正的目标达成者,并配套推出基于 YAML 定义并由语言模型模拟的

AI 推荐理由

论文核心评估 Agent 对隐含约束的推理能力,填补字面指令与上下文推理间的差距。

研究机构
Labelbox
论文信息
作者 Ved Sirdeshmukh, Marc Wetter
发布日期 2026-02-23
arXiv ID 2602.20424
相关性评分 9/10 (高度相关)