这是一款基于 LTX2.3 单人数字人 + 图片驱动 + 音频驱动 + PromptRelay 分段口播控制 + IC Edit 去字幕 / 去水印 LoRA + NAG 音画条件增强 + 三阶渲染打磨 的高稳定无字幕口播视频应用。用户上传一张 人物首帧图 和一段 驱动音频,系统会先提取人声,再把音频编码成 Audio Latent,与人物图生成的 Video Latent 融合,让人物根据声音节奏自然开口说话,同时保持人物身份、服装、背景和镜头稳定。
这版相比普通图片+音频数字人,重点增强在 IC Edit 无字幕链路。它不只是让人物开口说话,还额外加入了去字幕 LoRA、去水印 LoRA、强负向词和 IC Edit 修复提示词,用来压制口播视频里常见的字幕、乱码文字、水印、logo overlay、画面脏字和不稳定残影。再配合 VBVR、Crisp、运动跟踪控制 LoRA、三阶段采样和双重 Latent Upsampler,适合做无字幕口播、AI讲解、虚拟主播、品牌介绍、课程短视频、人物唱歌/说话视频和干净成片素材。核心优势是:一张人物图 + 一段音频,生成无字幕、无水印、人物更稳定的单人数字人口播视频。 使用时建议重点控制四项:人物首帧图决定身份,驱动音频决定口播节奏,全局提示词(用来写整体画面规则)决定整体画面,分段提示词(写每个时间段的动作变化)决定每段表演动作。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨


暂无作品

暂无作品