论文

ActorMind:模拟人类演员推理进行语音角色扮演

ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

模型评测基准与评测资源

摘要

角色扮演越来越受到关注,因为它为人机交互提供了坚实的基础,并促进了社会学研究。然而,目前的工作仅限于文本形式,忽视了在日常生活中起着主导作用的言语,从而限制了真正的角色扮演。为了弥补这一差距,我们通过 ActorMindBench 对语音角色扮演进行概念化和基准测试,并提出了一个相应的推理框架,称为 ActorMind。具体来说,(1) 语音角色扮演使模型能够根据角色、场景和口头对话提供具有个性化言语特征的自发响应。 (2) ActorMindBench 是一个分层基准,包括具有 7,653 个话语的话语级内容、具有 313 个场景的场景级内容和具有 6 个角色的角色级内容。 (3) ActorMind 是一个现成的、多智能体、链式推理框架,可以模拟人类演员在剧院中的表演。具体来说,ActorMind 首先通过 Eye Agent 读取指定的角色描述,然后通过 Ear Agent 理解上下文对话中的情感线索。随后,Brain Agent 生成描述性的情绪状态,最后,Mouth Agent 传递注入相应情绪状态的脚本。实验结果证明了 ActorMind 在增强语音角色扮演方面的有效性。