摘要
现实世界中用户对 AI 代理的请求往往缺乏明确说明,依赖共享语境和未陈述的约束。现有基准仅测试显式指令遵循,无法评估代理对无障碍需求、隐私边界等隐含要求的推理能力。本文提出“隐性智能”评估框架,旨在测试代理能否超越提示遵循成为真正的目标达成者,并配套推出基于 YAML 定义并由语言模型模拟的
AI 推荐理由
论文核心评估 Agent 对隐含约束的推理能力,填补字面指令与上下文推理间的差距。
研究机构
Labelbox
论文信息