摘要
角色扮演为人机交互和社会学研究提供了坚实基础,但现有工作局限于文本模态,忽视了日常生活中占主导地位的语音,限制了真正的角色扮演。为此,本文通过 ActorMindBench 对语音角色扮演进行了概念化与基准测试,并提出了相应的推理框架 ActorMind。该框架是一种现成的、多智能体、思维链风格的推理系统,旨在模拟人类演员在剧院中的表现。具体而言,Eye Agent 读取角色描述,Ear Agent 理解上下文对话中的情感线索,Brain Agent 生成描述性情感状态,最后由 Mouth Agent 输出注入相应情感状态的台词。实验结果证明了 ActorMind 在增强语音角色扮演方面的有效性。
AI 推荐理由
论文提出模仿人类演员推理的多智能体思维链框架,核心在于推理机制。
研究机构
The Hong Kong University of Science and Technology
论文信息