哈喽,各位小伙伴大家好!今天我们要学习的是如何让静态照片动起来——即通过输入一张参考图片和一段动作视频,生成与之匹配的 AI 动画视频。

本期需要用到的核心节点是 Mimic Motion。访问其官网后,可以看到大量展示案例视频。实现这类效果的关键在于:向工作流中输入一张参考图片(如人像)和一段参考动作视频(如肢体运动、表情变化等)。向下滚动页面,还能看到更多官方提供的示例,整体效果非常自然,细节表现力强——例如人物的嘴型都能与参考视频中的语音节奏保持一致。

接下来,我们打开 ComfyUI 的节点管理器(Manager),搜索 Mimic Motion,点击安装 Mimic Motion Workflow 节点包。点击对应按钮下载压缩包,并将其解压至 custom_nodes 文件夹内。

随后进入模型部署环节。由于相关模型查找与配置流程较为复杂,这里已为大家整理好全部必要模型资源,包含四个文件夹及一份说明文档:

  • DW Pose 文件夹 → 放入 models/controlnet/ 目录
  • Facebook Models 文件夹 → 放入 models/clip_vision/ 目录
  • Mimic Motion 文件夹 → 放入 models/mimic_motion/ 目录
  • Stable Diffusion 模型文件夹 → 放入 models/checkpoints/ 或指定模型路径

完成上述步骤后,即可在 ComfyUI 中正常使用 Mimic Motion 节点。

现在我们从零开始搭建 Mimic Motion 工作流:

  1. 清空当前工作区所有节点;
  2. 将 Mimic Motion 相关节点拖入画布;
  3. 如需优化界面布局,可在 Manager 中搜索并安装 SEAR 节点以获得更清晰的侧边栏导航。

接着进行基础连接:

  • 将参考图像接入 Image Scale 节点,用于统一尺寸与比例;
  • 将处理后的图像输出连接至 RIF Image(Reference Image)端口;
  • 使用 Video Helper 节点加载动作视频(该节点需提前在 Manager 中安装);
  • 将视频帧输出连接至 Force Image 输入端;
  • 添加 Video Combine 节点用于预览骨骼动画效果;
  • 再复制一个 Video Combine 节点接在解码器之后,用于最终视频合成。

关键参数设置如下:

  • 采样步数(Steps)、CFG 最小值/最大值:保持默认即可;
  • 总子值(Total Subframes)与控制方式:选择 Faces Fixed
  • FPS(帧率):建议设为 30,数值越高画面越流畅,但生成耗时也越长;
  • 噪声长度(Noise Length)与上下文影响长度(Context Length):例如设为 16,则表示每帧受前后共 16 帧的影响;
  • 上下文重叠度(Context Overlap):保持默认值;
  • 人物参考动作骨骼影响强度:保持默认;若数值过低,可能导致动作失真或肢体变形;
  • 动作骨骼起始/结束影响时机:保持默认;
  • 参考图像影响强度:保持默认。

最后进行图像与视频的尺寸对齐操作:

  • 确保参考图像与视频帧分辨率一致,否则会报错“must have same resolution”;
  • 可将图像缩放节点(Image Scale)复制一份,连接至视频加载节点的输出端;
  • 同时注意将图像经 Image Recast 处理后的输出连接至 Postscript RIF 端口。

完成所有连接与参数设置后,点击生成按钮。生成成功后,可观察到输出视频中人物的五官、服饰、体态特征均高度还原参考图,动作节奏与参考视频完全同步,且无闪烁现象,整体流畅度优秀。