特别说明:本篇文章是建立在前期文章的基础上的,有些前期文章已经讲过的细节问题,本章内容可能不会重复,若有看不懂的地方,请先看前期文章。
上一章我们实现了LTX-2.3模型,首尾帧视频工作流的搭建。
这一章我们将去实现,LTX-2.3模型,图像音频转视频工作流的搭建。图像音频转视频就是给一个人物的照片,再给一段录音,让图片中的人物把这段录音说出来。
有的同学可能会说了,LTX不是本身就能生成音频吗?为啥还要单独去弄个录音?
因为如果我们要创建一个数字人模特,除了外形好看,他的声音也得有自己的特色!就像我们人一样,每个人都有自己的音色,那么我们的数字人也是需要自己固定的音色的。你不能今天说话是这个声音,明天又变成了另外一个声音。
和前面一样我们先去看官方的图像音频转视频工作流是怎么搭建的。
一、官方高度集成版工作流
第一步:进入模板
第二步:搜索“LTX-2.3”,选择“图像音频转视频”工作流
先看看他所用到的模型,这些模型文件我们前面已经下载好了,这里重新选择一下,改成自己的路径就ok了!
我们先用这个工作流试试效果,这里有个小技巧,大家看下图,我给的这个音频是7s的时长,我给的视频长度要求是8s。因为如果视频也要求7s的时长的话,那么视频最后的一个字一般都不完整。
二、图像音频转视频工作流详解
这个工作流是做数字人很实用的工作流,我们就参考官方工作流,来一步一步的来自己搭建一个属于自己的工作流。
1)加载模型文件,这里面用到的文件,我们前面都已经下载过了,直接用就行。lora是ltx官方替工的一个加速lora。
2)加载两个clip文版框,用来输入提示词。
3)添加视频分辨率(高、宽)、帧率、时长,这里需要注意LTX2.3要求视频分辨率的高、宽必须能比32整除,因此其720P视频的分辨率为( 横板1280 × 704 竖版704 × 1280)、
1080P视频的分辨率为(横板1920 × 1056 竖版896 × 1536)。
4)加载图片并对图像进行处理(详细介绍请看前期文章)
5)构建生成尺寸二分之一的图像潜空间,缩小采样提升速度(详细介绍请看前期文章)
6)音频材料加载
7)音频裁剪,由于有时候音频时长会比较长比如1分钟,我们没法一次性生成一个1分钟的视频,需要分段去生成,因此需要对音频进行裁剪。设置一个起始时间,裁剪一段和视频时长相同的音频。
8)构建音频的潜空间
这里面我们需要主义的是这个“纯快遮罩”,他的作用是生成一张纯色、无渐变、矩形整体遮罩图。
明度 0.0(全黑遮罩)采样器看到这个 mask:音频 latent 整片区域禁止添加噪声,这样音频编码出来的特征全程被保护,采样过程不会破坏音频信息,保障音画联动、口型稳定,不会出现音频条件失效。
明度 1.0(全白遮罩)采样器允许对 audio_latent 正常加噪声。这样模型会改动音频潜空间,容易破坏原始音频特征,大概率导致音画脱节、口型乱掉。
9)汇总提示词条件和帧率
10)将视频和音频汇总到一个潜空间
11)实现初次采样(详细介绍请看前期文章)
12)对初次采样的结果进行二次放大,因为我们在初次采样时是在原本设置的分辨率上缩小1/2进行采样的,所以需要加一个二次放大,再使图像恢复到原本的分辨率。
我的电脑配置如果不加二次放大,直接一次采样出结果,720P的视频,会比先一次缩小采样 加 二次放大采样多出来近1倍的时间。
13)对放大后的图像进行二次采样 并 输出视频。
---------结束线---------
到这里,我们图像音频转视频的工作流就全部搭建好了。本篇文章发布后,我会在我们的交流群,把今天我们搭建好的工作流文件分享到群共享文件。
有兴趣的朋友可以加一下交流群,平时学习中有什么困惑,也可以和群里的朋友们互相交流。
如果大家在阅读文章的时候有什么困惑,可以在文章的底部留言,我看到的第一时间就会进行回复。
再一个,也可以在赞赏文章后,针对所赞赏文章的内容,有不明白的地方,可以和我约个时间,进行一对一的实时交流,赞赏金额不限制,多少都可以!