这是一款基于 LTX-2.3 + IC LipDub + 音频驱动 + 单人头像参考 + 三阶高清渲染 的 AI 数字人口播唱歌应用。
用户只需要上传一张单人头像或角色参考图,再上传一段口播、唱歌或配音音频,系统就会根据音频节奏和提示词生成一段数字人开口表演视频。
和普通头像动起来不同,这个流程加入了音频驱动链路。系统会读取用户上传的音频,进行人声分离、音频裁剪、音频时长计算和音频 latent 编码,再结合 IC LipDub 口型引导,让角色根据音频进行更自然的开口、说话或唱歌。
整个流程会自动完成:头像图读取、音频上传、人声分离、音频裁剪、音频时长计算、视频帧数匹配、全局提示词读取、分段表演提示词读取、反向提示词约束、一阶口型生成、二阶潜空间放大、三阶高清精修、相似度保持、尾帧裁剪、音频接回和最终 MP4 输出。
最终生成的是一段带原始音频、人物身份尽量稳定、口型跟随音频节奏、画面经过三阶增强的数字人视频。
它适合用于数字人口播、头像唱歌、AI 虚拟主播、角色配音视频、单人角色表演、虚拟 IP 宣传、短视频口播素材、歌曲演绎、广告人物视频和 RunningHub 视频类应用封装。
如果包装成 RunningHub 应用,核心卖点可以直接表达为:
上传一张头像和一段音频,一键生成会说话会唱歌的三阶高清数字人视频。