这是一款基于 LTX-2.3 + SDPose 姿态控制 + 人物相似度保持 + 三阶渲染增强 的 AI 控片视频生成应用。
用户只需要上传一段动作参考视频,再上传一张人物参考图,并输入一句视频提示词,系统就会根据参考视频中的动作、姿态、节奏和镜头运动,生成一段由参考图人物完成动作的新视频。
和普通图生视频不同,这个流程不是只让一张图片随机动起来,而是通过参考视频进行控片。参考视频负责提供动作和运动节奏,人物参考图负责锁定角色身份、脸部特征、发型、服装和整体外观,提示词负责控制视频内容、场景风格和画面氛围。
整个流程会自动完成:参考视频读取、人物参考图读取、视频帧率和帧数识别、参考视频预处理、SDPose 姿态提取、人物图像锚定、人脸检测、一阶强相似度生成、二阶潜空间放大、三阶高清精修、音频 latent 处理、视频解码和最终 MP4 输出。
最终生成的是一段动作受参考视频控制、人物尽量保持参考图一致、画面经过三阶增强的视频。它适合做人物跳舞、动作迁移、角色表演、数字人控片、AI 短剧动作镜头、口播动作素材、广告人物视频和短视频二创素材。
如果包装成 RunningHub 应用,核心卖点可以直接表达为:
上传一段动作视频和一张人物图,一键生成三阶高清控片视频。