这是一款基于 LTX2.3 Dev-Dare TIES 蒸馏1.1 + OmniNFT 增强 + PromptRelay 分段控制 + 音频驱动 + MelBandRoFormer 人声分离 + Audio VAE 音频潜空间编码 + VBVR 时序稳定 + Crisp 画质增强 + LTX2_NAG + 三阶渲染 + IC Edit 去字幕去水印链路 的单人数字人口播视频应用。用户上传一张 人物首帧图 和一段 驱动音频 后,系统会自动提取人声、读取音频时长、计算视频帧数,并让人物按照音频节奏自然开口说话,同时保持人物身份、服装、背景和镜头稳定。
这版相比普通图片说话,重点增强在 OmniNFT 3.0 稳定性、音频自动时长适配、PromptRelay 分段表演、三阶高清渲染和 IC Edit 无字幕清理。它不只是让人物张嘴,而是用人声分离和音频 latent 驱动口型,再用人物图约束、VBVR、Crisp、NAG 和三阶采样提升成片稳定性,最后通过去字幕 / 去水印 LoRA 清理画面脏字。适合做 AI口播、虚拟主播、课程讲解、品牌介绍、人物唱歌、角色发声、短视频带货、IP数字人和无字幕干净成片。使用时建议重点控制四项:人物首帧图决定人物身份,驱动音频决定口型节奏,全局提示词(用来写整体画面规则)决定画面稳定规则,分段提示词(写每个时间段的动作变化)决定每段表情和动作。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨


暂无作品

暂无作品