这是一款基于 LTX2.3 Dev-Dare TIES Distilled 1.1 + 单图人物参考 + 音频驱动 + MelBandRoFormer 人声分离 + PromptRelay 全局/分段提示词 + VBVR 时序稳定 + OmniNFT 增强 + sULph LoRA + LTX2_NAG + 三阶采样 + 10S人脸相似度保持体系 的单人数字人视频应用。用户上传一张人物图和一段口播或唱歌音频后,系统会自动裁剪音频、提取人声、读取音频时长、计算视频帧数,并让人物按照声音节奏自然开口说话或唱歌,同时尽量保持角色脸部、发型、服装、背景和身份一致。
这版最大的升级点是 10S相似度保持。它不是只靠图生视频 strength 硬压参考图,而是新增了人脸检测、相似度引导、相似度锚点、latent 锚点感知、STG 高级引导和 Sigmas Easing。整体策略是:一阶强相似度建立人物身份,二阶中相似度保持高清放大不换脸,三阶弱化锚点以保留口型和表情自然度。这比单纯 I2V strength 更适合做 10 秒左右的口播、唱歌、角色一致性视频。
适合场景包括:AI口播、角色唱歌、虚拟主播、数字人讲解、IP角色发声、动漫角色开口、广告口播、短视频带货、MV角色片段和 RunningHub 单人数字人应用。使用时建议重点控制五项:人物首帧图决定角色身份,驱动音频决定口型和节奏,全局提示词(用来写整体画面规则)决定画面稳定规则,分段提示词(写每个时间段的动作变化)决定表情动作,相似度保持强度决定像不像原图。
发布前建议修正四点:第一,[520] / [521] 节点标题仍写“单人对话”,建议统一改成你现在固定的“全局提示词(用来写整体画面规则)”和“分段提示词(写每个时间段的动作变化)”;第二,当前有多个 SaveVideo 预览输出,前台建议只保留三阶最终输出 [510];第三,OmniNFT 节点标题写 0.65 但实际强度约 1.0,建议实测后统一标题和数值;第四,IC 去字幕 / 去水印 LoRA 当前是旁路,不要主打“IC Edit 去字幕去水印”,除非重新启用清理分支。
🎁先领RH币,再去体验工作流!右上角头像→邀请码→输入【rh-v1111】,立领1000RH币,每天登录还能再领100币~更多ComfyUI工作流、教程和玩法,欢迎关注公众号(AIKSK),抖音 / 哔哩哔哩 / 小红书 / YouTube(AI-KSK)同步更新中✨
暂无作品

暂无作品