这是一款基于 LTX 2.3 音频驱动 + 人声分离 + PromptRelay 分段提示词 + 三阶渲染打磨 + 双重 Latent 放大 的高稳定数字人视频应用。用户上传一张 人物首帧图 和一段 驱动音频,系统会先对音频做人声提取,再将人声编码成 Audio Latent,并与视频 latent 融合,让人物根据音频节奏自然开口说话。相比普通图生视频或简单对口型流程,这条工作流不是只做嘴部贴合,而是把音频信号直接参与生成过程,从而让人物口型、表情、轻微头部动作和画面节奏更统一。
同时,它采用 三阶段采样 + 三阶段图像约束 + 双重 Latent Upsampler + 分块解码 的成片链路:第一阶段建立基础动态,第二阶段强化人物细节,第三阶段进行最终稳定和画质打磨。它特别适合做:AI口播数字人、虚拟人短视频、IP角色说话、剧情对白、课程讲解、品牌虚拟主播和小红书 / 抖音口播内容。核心优势是:一张图 + 一段音频,就能生成更自然、更稳定、更有质感的数字人说话视频。 使用时建议重点控制三项:人物首帧图决定身份,驱动音频决定说话节奏,PromptRelay 提示词决定表演状态和镜头氛围。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨