metacognitive control resource constraints task planning agent evaluation
摘要

将大语言模型部署为自主智能体不仅需关注单任务准确率,更需在有限 Token 预算下面对任务队列时,于执行前决定尝试哪些任务、顺序及计算资源分配。本文提出 TRIAGE 评估框架,要求模型基于自身基线成本,提交包含选择、排序及资源分配的单一有序计划,并与全知预言机对比评分。实验显示,当前前沿模型在此类前瞻性元认知控制上存在显著差距,揭示了资源高效智能体部署中未被衡量的关键能力维度。

AI 推荐理由

论文核心研究 LLM 在资源约束下的任务选择、排序及计算分配的前瞻性规划能力。

研究机构
1 2
论文信息
作者 Zabir Al Nazi, Shubhashis Roy Dipta
发布日期 2026-05-13
arXiv ID 2605.13414
相关性评分 9/10 (高度相关)