这是一款基于 LTX 2.3 图片驱动 + 音频驱动 + PromptRelay 分段提示词 + Dev-Dare 音画驱动增强 + 三阶渲染打磨 + 双重 Latent 放大 的高稳定数字人视频应用。用户上传一张 人物首帧图 和一段 驱动音频,系统会用图片锁定人物身份、脸部结构和画面构图,再把音频编码成 Audio Latent,与 Video Latent 融合,让人物根据声音节奏自然开口说话,产生口型变化、表情变化和轻微动态。
这版相比普通图片+音频数字人,重点增强在 Dev-Dare 音画驱动 和 运动跟踪控制 LoRA:前者增强音频与画面的同步控制,后者增强人物动作稳定和画面不跑偏。再配合三阶段采样、三阶段图像约束、双重 Latent Upsampler 和分块解码,最终更适合做稳定口播、虚拟人短视频、IP角色配音、课程讲解、品牌虚拟主播和小红书 / 抖音内容。核心优势是:一张图 + 一段音频,就能生成音画同步更稳、人物说话更自然的数字人视频。 使用时建议重点控制三项:人物首帧图决定身份,驱动音频决定说话节奏,PromptRelay 提示词决定表演状态和镜头氛围。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨