论文

CogPortrait:通过分层代理规划在肖像动画中进行细粒度的眼部区域控制

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

应用与实践内容创作

摘要

肖像动画方法已经实现了显着的视觉质量和唇形同步,但眼睛区域的细粒度操纵仍然面临输入粒度和运动精度之间的权衡。使用情感标签或粗略文本提示的现有方法不足以描述微妙的视觉动态,而基于动作单元或驾驶视频的方法以较重的输入负担为代价提供了更高的保真度。这些限制对于超情绪状态(例如思考)和困倦仍然具有限制性。鉴于上述情况,我们提出了 CogPortrait,这是一个两阶段框架,可从高级标签生成肖像动画。在第一阶段,三个思想链多模态 大语言模型 (MLLM) 代理通过时间事件规划、原型检索和真实行为库的组合以及语义生理约束强制执行,将高级标签编译为面部关键点。在第二阶段,基于 DiT 的视频生成主干根据关键点、参考肖像、音频和文本提示合成最终动画,并通过动态无分类器指导策略(具有眼睛区域感知重新加权和基于 KTO 的边界情况细化)来增强。我们进一步介绍了涵盖不同情感和超越情感类别的 EMH 基准,以及两个 AU 级指标,用于评估细粒度的眼部区域和头部运动控制。 HDTF 和 EMH 基准的大量实验表明,CogPortrait 比现有方法实现了更精确的眼部区域控制,同时保持了卓越的视觉质量和身份一致性