这是一款基于 WanVideo + InfiniteTalk / MultiTalk 的单图音频唱歌视频应用。
用户上传一张人物图和一段音频后,工作流会先统一图片尺寸,再结合大模型对画面内容和用户输入做提示词整理,随后用 WanVideoTextEncodeSingle 编码文本,用 MultiTalkWav2VecEmbeds 提取音频驱动特征,再交给 WanVideo 主模型生成会跟着音频开口、带轻微表情和动作变化的视频。整条流里同时能看到 WanVideoModelLoader、WanVideoTextEncodeSingle、MultiTalkWav2VecEmbeds、WanVideoApplyNAG、WanVideoVAELoader 等结构,说明它不是普通图生视频,而是偏 音频驱动数字人演唱/说唱 的工作流。
这条工作流适合:
-
单图生成唱歌视频
-
数字人演唱
-
人像音频驱动视频
-
AI翻唱演示
-
短视频口播 / 清唱类内容
推荐使用方式:
上传一张正脸清晰、主体明确的人物图;上传一段清楚的人声音频;提示词尽量写“人物在什么场景下如何唱歌/说话”,不要写过度夸张的大动作。当前文件里还接了一条 llama_cpp_instruct_adv 链路,会先结合图片和提示词做整理,再送入最终生成流程,所以这条流本身就有“帮用户整理提示词”的能力。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨