摘要
针对传统机器人社会行为生成灵活性不足的问题,本研究提出 CRISP 框架。该框架利用视觉语言模型(VLM)作为“类人社会批评家”,自主批判并重规划机器人动作。系统整合了关节约束提取、情境化步骤计划生成、基于视觉的低层控制代码生成,以及 VLM 对社会适宜性的评估与基于奖励的迭代优化。该方法不依赖特定 API,仅需结构文件即可跨平台生成拟人化动作。用户研究表明,其在多种机器人及场景下的表现显著优于现有方法。
AI 推荐理由
论文核心提出基于 VLM 的批判与重规划框架,通过迭代优化生成社会行为计划。
研究机构
韩国科学技术院
论文信息