摘要
近期多模态大模型在反应式问答中表现优异,但现实流式助手需对连续视觉输入进行主动推理。现有基准多关注孤立单轮场景,忽视了用户动态增删改请求与反应式查询交织的多轮情境。为此,本文提出 IPIBench,首个评估流式视频下交互式主动智能的基准,涵盖主动监控、任务管理及混合请求。评估揭示模型存在主动触发不稳定及行为协调弱的问题。作者进一步提出无需训练的 IPI-Agent 框架,通过交互控制策略与时序门控机制优化上述问题,显著提升现有模型性能。
AI 推荐理由
论文核心研究多模态 Agent 在流式输入下的主动任务管理与多步交互协调,属规划能力。
研究机构
清华大学
论文信息