这是一款基于 LongCat-Avatar-15 + LongCat DMD Distill LoRA + Whisper Large V3 音频口型特征 + 10图参考图池 + 10组 GPT-5 图像反推提示词池 + For循环续写 + 重叠帧拼接 + 强切镜模式 的多图切镜数字人应用。用户上传一段音频,并准备多张数字人参考图后,系统会自动把音频转成口型特征,再用 LongCat Avatar 逐段生成口播视频;每一轮循环都可以切换参考图和对应提示词,从而实现多镜头、多形象、多场景的口播视频。
这条流的核心优势是:它不是单张图说到底,而是“音频驱动 + 多图轮换 + 循环续写 + 自动拼接”的数字人口播生产线。 首段用图1和首段提示词建立人物与画面,后续通过 For 循环继续生成;参考图模式为 1 时,每轮从 10 图池里换图;提示词模式为 1 时,每轮从 10 组 GPT-5 反推提示词里换对应描述;强切入模式为 1 时,每轮更明显地切进当前参考图,适合做多镜头切换感。它特别适合做虚拟主播、多镜头口播、AI新闻播报、课程讲解、产品介绍、角色轮换访谈、IP矩阵口播和短视频分段成片。使用时建议重点控制六项:输入音频决定口型和时长,参考图池决定每段镜头人物,GPT-5反推提示词决定每段动作描述,参考图模式决定是否轮换,提示词模式决定是否轮换,强切入模式决定切镜明显程度。
发布前建议你顺手修正三处命名:第一,[245] / [246] 的标题和实际宽高值不一致,当前实际是 720×1280 竖屏;第二,部分图5-图10当前看起来可能是复用同一张占位图,如果要真正多图切镜,需要替换成不同参考图;第三,输出前缀里可以保留 LongCat15,但建议补上“多图切镜数字人”,方便用户下载后识别结果。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨


暂无作品

暂无作品