minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_resized_avg_rank_64_bf16.safetensors
返回
minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_resized_avg_rank_64_bf16.safetensors

minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_resized_avg_rank_64_bf16.safetensors

6 浏览0 点赞0 收藏
画风加强人物加强主体加强元素加强画面控制

SVIP专属

SVIP专属

画风加强人物加强主体加强元素加强画面控制

模型信息

未冻结
模型类型:
LoRA
基础模型:
minimax-h3
文件名称:
models/loras/minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_resized_avg_rank_64_bf16.safetensors
MD5:
78ca252ee33cebb227da72a141524605

LightX2V/ModelTC团队推出的MiniMax H3 FL2VA专属4步极速蒸馏LoRA v1.2版本,专为ComfyUI原生适配的768p BF16精度模型‌,是目前社区FL2V方向速度最快的商用级衍生版本之一。

  • 核心定位‌:基于MiniMax官方开源的H3-Base-FL2VA基础模型做CFG步数蒸馏得到的轻量LoRA适配器,专门面向首尾帧生视频、文生音视频、首帧/尾帧生视频三类场景,无需依赖官方未开源的模块,完全支持本地ComfyUI部署。
  • 硬件与性能表现‌:原生训练分辨率为1344×768 16:9标准画幅,BF16全精度格式,叠加rank_64平均权重裁剪优化后,在RTX 5090上搭配SLA稀疏注意力可实现约2.5倍推理加速,生成15秒768p音视频仅需数分钟,远快于原版30-50步的基础模型。
  • 输出规格‌:严格对齐H3官方原生能力,输出24fps视频+32kHz同步立体声音频,支持11种主流语言指令,兼容21:9、9:16等多种常用画幅,最长可生成15秒完整音视频片段。
  • 适配特性‌:文件名中的resized_avg_rank_64代表该版本完成了参考图尺寸对齐与低秩权重平均优化,直接放入ComfyUI的models/loras目录即可通过标准LoRA加载器运行,无需额外格式转换。

LightX2V/ModelTC团队推出的MiniMax H3 FL2VA专属4步极速蒸馏LoRA v1.2版本,专为ComfyUI原生适配的768p BF16精度模型‌,是目前社区FL2V方向速度最快的商用级衍生版本之一。

  • 核心定位‌:基于MiniMax官方开源的H3-Base-FL2VA基础模型做CFG步数蒸馏得到的轻量LoRA适配器,专门面向首尾帧生视频、文生音视频、首帧/尾帧生视频三类场景,无需依赖官方未开源的模块,完全支持本地ComfyUI部署。
  • 硬件与性能表现‌:原生训练分辨率为1344×768 16:9标准画幅,BF16全精度格式,叠加rank_64平均权重裁剪优化后,在RTX 5090上搭配SLA稀疏注意力可实现约2.5倍推理加速,生成15秒768p音视频仅需数分钟,远快于原版30-50步的基础模型。
  • 输出规格‌:严格对齐H3官方原生能力,输出24fps视频+32kHz同步立体声音频,支持11种主流语言指令,兼容21:9、9:16等多种常用画幅,最长可生成15秒完整音视频片段。
  • 适配特性‌:文件名中的resized_avg_rank_64代表该版本完成了参考图尺寸对齐与低秩权重平均优化,直接放入ComfyUI的models/loras目录即可通过标准LoRA加载器运行,无需额外格式转换。