这是一款基于 LongCat-Avatar-15 + LongCat DMD Distill LoRA + Whisper Large V3 音频口型特征 + GPT-5 图像反推提示词 + For循环续写 + 重叠帧拼接 + 单图软续稳定口播 的数字人视频生成应用。用户上传一张数字人参考图和一段口播音频后,系统会自动把音频转成口型特征,再根据参考图生成 LongCat 适用的口播提示词,先生成首段,再通过 For 循环继续续写后续片段,最后拼接成完整口播视频。
这条流的核心优势是:用一张图持续生成长口播,而不是只做短短几秒的图片说话。 当前工作流设置里,提示词模式为 0、参考图模式为 0、强切入模式为 0,意味着它会固定使用同一张人物参考图和同一套动作提示词,并通过软续方式让后续片段尽量接上前一段。相比多图切镜版,它的画面变化更克制,但人物身份、服装、背景和镜头连续性更稳,适合做正式口播、课程讲解、新闻播报、产品介绍、虚拟主播和品牌数字人内容。
使用时建议重点控制六项:输入音频决定口型和视频长度,参考图决定人物身份,用户反推需求决定动作幅度,手动循环次数决定生成长度,重叠帧数决定接缝稳定性,软续模式决定人物连续性。
当前文件仍然保留了 10 图池和 10 组提示词池,但因为 提示词模式=0、参考图模式=0,发布时不要主打“多图切镜”,应主打 单图循环长口播。
发布前建议修正三处:第一,[245] / [246] 节点标题和实际宽高不一致,当前实际是 720×1280 竖屏;第二,输出前缀仍带 10POOL,如果发布单图版,建议改成 LongCat15_SingleImage_Loop_Avatar;第三,图2-图10可以隐藏,避免用户误以为必须上传多图。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨


暂无作品

暂无作品