我在进行audio_driven的推理任务中发现一个问题: 如果denoising_unet, reference_unet,pose_guider这三个2D组件我使用的是我在train_stage1中训练好的版本,不论我的motion_module使用的是pretrained的motion_module.pth还是基于train_stage1 checkpoint训练好的motion_module.pth,我生成的视频几乎就是完全静止的,画面只有一些轻微的扰动。
我在进行audio_driven的推理任务中发现一个问题:
如果denoising_unet, reference_unet,pose_guider这三个2D组件我使用的是我在train_stage1中训练好的版本,不论我的motion_module使用的是pretrained的motion_module.pth还是基于train_stage1 checkpoint训练好的motion_module.pth,我生成的视频几乎就是完全静止的,画面只有一些轻微的扰动。