什么是 Volcengine 视频唇形同步?
它修改了现有的谈话视频,以便可见的嘴部动作遵循提供的替换音轨,而源视频的其余部分仍然是视觉基础。
使用 Volcengine 视频到视频唇形同步将现有视频中的可见语音同步到新音轨。上传清晰的人脸视频和匹配的语音音频,以创建本地化配音、翻译的对话、演示者更新和修订的音轨。
Volcengine Video-to-Video Lip Sync 指南
关于模型输入、核心功能、理想用例和提示策略的实用指南。
它修改了现有的谈话视频,以便可见的嘴部动作遵循提供的替换音轨,而源视频的其余部分仍然是视觉基础。
使用 Volcengine 视频到视频唇形同步将现有视频中的可见语音同步到新音轨。上传清晰的人脸视频和匹配的语音音频,以创建本地化配音、翻译的对话、演示者更新和修订的音轨。
保持源性能和视觉框架,同时调整可见的嘴部运动以遵循替换音轨,从而生成现有谈话视频的修订版本。使用翻译或新录制的演讲将演示者、课程、产品解释、采访和社交剪辑改编为另一种语言或纠正的画外音。
该模型将嘴型和时间与提供的声音对齐,同时保留周围的帧,这使得在重新拍摄原始说话者不切实际时非常有用。该工作流程需要具有可见说话面孔的源视频和包含目标语音的音频文件。清晰的正面镜头和干净的言语通常会产生最可靠的结果。
选择面部清晰可见、遮挡有限且围绕讲话对象的框架稳定的剪辑。上传带有预期对话和节奏的干净目标音频。修剪长时间的沉默并确认语音符合源剪辑。
生成修改后的视频,通过完整剪辑检查嘴部计时,然后下载结果或使用更清晰的输入重试。
主要参考文献
创建包含重点简介和所选工作流程所需的源媒体的视频。
选择面部清晰可见、遮挡有限且围绕讲话对象的框架稳定的剪辑。
上传带有预期对话和节奏的干净目标音频。修剪长时间的沉默并确认语音符合源剪辑。
生成修改后的视频,通过完整剪辑检查嘴部计时,然后下载结果或使用更清晰的输入重试。
它修改了现有的谈话视频,以便可见的嘴部动作遵循提供的替换音轨,而源视频的其余部分仍然是视觉基础。