ComfyUI 节点介绍与 MiniMax H3 模型解析

前言

ComfyUI 把一次生成过程拆成一个个节点,连成工作流,模型加载、提示词编码、采样、解码各管一段。
刚上手视频类工作流时,最容易犯迷糊的是 models 目录下那一堆 safetensors 文件:它们分别是什么、由哪个节点加载、在一次生成里扮演什么角色。

MiniMax 是海螺 Hailuo 视频背后的公司,H3 是其新一代视频生成模型,能同时生成画面与声音。
本文以 ComfyUI 官方整理的模型仓库为线索,先补一点节点基础,再逐个拆解各文件的用途。
文中信息以官方 README 与 ComfyUI 文档为依据。

下载地址

全套文件来自 Comfy-Org 为 ComfyUI 整理的打包仓库,下载后按目录放进 models 对应子目录即可:

节点入门

ComfyUI 是节点式工作流编辑器,一个节点就是一个功能模块,输出口连线到下一个节点的输入口,数据沿连线流动。
一套完整的生成流程,通常就是加载、条件、采样、解码、保存这五段各来一两个节点。

常见节点分类

  • 加载器类:把磁盘上的模型文件读进显存,是整条流水线的入口;
  • 条件类:把提示词文本编码成模型能理解的条件向量;
  • 采样器KSampler 是核心引擎,在潜空间里迭代去噪;
  • 解码与保存类:把潜空间结果还原成图片、视频或音频,并落盘输出。

一条典型的视频生成链路大致是下面这样:

1
加载模型 → 编码提示词 → 初始化潜空间 → KSampler 去噪 → 解码 → 保存视频/音频

models 目录

ComfyUI 启动时会扫描 models 下的各子目录,按目录判定模型类型,节点下拉列表里的选项就来自这些目录。
H3 全套文件按官方仓库给出的目录结构放置:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ ├── minimax_h3_fl2va_bf16.safetensors
│ │ ├── minimax_h3_fl2va_int8_convrot.safetensors
│ │ ├── minimax_h3_fl2va_pruned_bf16.safetensors
│ │ ├── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ │ ├── minimax_h3_fl2va_pruned_fp8_scaled.safetensors
│ │ ├── minimax_h3_ref2va_bf16.safetensors
│ │ ├── minimax_h3_ref2va_int8_convrot.safetensors
│ │ ├── minimax_h3_ref2va_pruned_bf16.safetensors
│ │ ├── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ │ └── minimax_h3_ref2va_pruned_fp8_scaled.safetensors
│ ├── 📂 text_encoders/
│ │ ├── qwen3vl_32b_minimax_h3_bf16.safetensors
│ │ ├── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ ├── 📂 loras/
│ │ ├── minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors
│ │ ├── minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors
│ │ └── minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors
│ ├── 📂 vae/
│ │ ├── minimax_h3_audio_vae_fp32.safetensors
│ │ └── minimax_h3_video_vae_fp16.safetensors
│ ├── 📂 embeddings/
│ │ ├── minimaxh3_art_is_explosion.safetensors
│ │ ├── minimaxh3_blooming_flowers.safetensors
│ │ ├── minimaxh3_bullet_time.safetensors
│ │ ├── minimaxh3_dark_magic.safetensors
│ │ ├── minimaxh3_fire_breath.safetensors
│ │ ├── minimaxh3_four_seasons.safetensors
│ │ ├── minimaxh3_kiss_camera.safetensors
│ │ ├── minimaxh3_spiral_ascent.safetensors
│ │ ├── minimaxh3_storm_magic.safetensors
│ │ └── minimaxh3_truman_show.safetensors

五个目录正好对应五类模型,下面逐一拆解。

两类生成权重

diffusion_models 与 loras 按生成方式分为两套,选文件时先确认走哪条路:

  • fl2va:首尾帧生视频音频,对应 T2V / I2V;
  • ref2va:全能参考生视频音频,对应 R2V。

text_encoders 和 vae 在两种方式中是同一份,不用纠结;
embeddings 是可选的风格触发向量,一般用不到。

推荐配置

如果只想装一套够用的,按下表选即可:

1
2
3
4
5
6
7
8
9
10
11
12
13
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ ├── minimax_h3_fl2va_int8_convrot.safetensors
│ │ ├── minimax_h3_ref2va_int8_convrot.safetensors
│ ├── 📂 text_encoders/
│ │ ├── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│ ├── 📂 loras/
│ │ ├── minimax_h3_fl2v_lightx2v_turbo_4step_v0.1_comfy_resized_avg_rank_21_bf16.safetensors
│ │ └── minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors
│ ├── 📂 vae/
│ │ ├── minimax_h3_audio_vae_fp32.safetensors
│ │ └── minimax_h3_video_vae_fp16.safetensors

五类模型解析

diffusion_models 主模型

这个目录放的是去噪主模型,也就是通常说的 DiT(Diffusion Transformer),整条工作流里算力开销最大的一环。
H3 按任务分了两套权重,不能混用:

  • fl2va 用于 T2V 文生视频与 I2V 图生视频,支持首尾帧控制,输出视频与音频;
  • ref2va 用于 R2V 参考生视频,最多支持 9 张参考图、3 段参考视频和 3 段参考音频,用来锁定角色、风格、运镜与声音。

每套权重又各提供 5 个变体,按显存与 PyTorch 条件选择:

  • bf16 全量版约 62 GB;
  • pruned_bf16 剪枝版约 37.5 GB;
  • int8_convrot int8 量化加卷积旋转约 31.7 GB;
  • pruned_int8_convrot 剪枝叠加量化约 19.5 GB,社区最常用;
  • pruned_fp8_scaled fp8 缩放量化约 19.5 GB。

官方建议优先选 int8_convrot 系列,需要 PyTorch cu130 及以上,环境跑不动再退到 fp8_scaled。
主模型通过 UNETLoader 节点加载,输出 MODEL 接给采样器。

text_encoders 文本编码器

qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 是文本编码器,底座是 Qwen3-VL 32B 这个视觉语言模型。
用视觉语言模型当编码器,意味着提示词不只提供一句话的语义,模型还能结合参考图理解画面,对图生视频场景尤其重要。

仓库提供三种量化版本,体积依次为 48 GB、25.3 GB 与 14.6 GB:

  • bf16 全量;
  • int8_convrot int8 量化;
  • nvfp4_awq 4 bit 浮点加 AWQ。

官方特别说明 nvfp4 版不需要 Blackwell 显卡也能使用,显存紧张时的首选。
它由 CLIPLoader 节点加载,编码结果作为条件接给采样器。

vae 视频与音频解码

VAE 负责潜空间与真实信号之间的互转,采样发生在潜空间,最终结果要靠 VAE 还原。
这套模型配了两个 VAE,分工明确:

  • minimax_h3_video_vae_fp16.safetensors 是视频 VAE,把视频潜码解码成一帧帧画面,fp16 是体积与精度的折中;
  • minimax_h3_audio_vae_fp32.safetensors 是音频 VAE,把音频潜码还原成波形,用 fp32 是因为音频对数值精度更敏感,误差大了容易听出杂音。

两个文件都用 VAELoader 加载,采样输出的潜码分别送进视频分支和音频分支解码。

loras 加速蒸馏

仓库提供三个 turbo LoRA,都是步数蒸馏的产物,定位是给主模型提速,每个约 1.8 GB:

  • fl2v_turbo_8step 配 fl2va 主模型,官方默认 20 步采样,挂上后 8 步出片;
  • fl2v_turbo_4step_768p 是 4 步的 768p 版本,速度更快;
  • ref2v_turbo_4step_v0.1 配 ref2va 主模型,供 R2V 工作流使用。

LoRA 必须与主模型的任务形态配对,fl2v 与 ref2v 不能混挂。
提速的代价是音频与运动质量略有下降,文件名尾部的 comfyui_bf16 标注了适配 ComfyUI 的权重格式与 bf16 精度。

挂载方法

LoRA 不能独立使用,要用 LoraLoaderModelOnly 串在主模型之后,只改模型权重,不占文本编码器那份显存。
接入步骤:

  1. 确认文件已放进 models/loras 目录,按 R 键刷新模型列表;
  2. 添加一个 LoraLoaderModelOnly 节点,把主模型与采样器串起来:
1
UNETLoader (MODEL) → LoraLoaderModelOnly (MODEL) → KSampler (model)
  1. 节点里 lora_name 下拉选中该文件,strength_model 先用 1.0,效果过猛再往下调。

之所以用 ModelOnly 版本而不是普通 LoraLoader,是因为该 LoRA 只作用于主模型,而这套工作流的文本编码器是独立的 Qwen3-VL,没有可挂的 CLIP 模型。

配套采样参数

挂上 turbo LoRA 之后,KSampler 的参数必须配套修改,否则画面容易发灰或糊掉:

  • steps:官方默认 20 步,挂 LoRA 后改为 8,4 步版对应 4;
  • cfg:蒸馏模型通常吃不下高 CFG,先按 1 试,此时负向提示词基本不生效,属正常现象;
  • samplerscheduler:优先用官方模板的推荐值,没有就先试 eulersimple 的常规组合。

embeddings 风格触发

embeddings 目录是 10 个现成的风格触发向量,每个不到 1.5 MB,由社区成员整理,并非 MiniMax 官方出品。
从文件名就能看出各自的效果:

文件名 效果
art_is_explosion 爆炸艺术
blooming_flowers 花开
bullet_time 子弹时间
dark_magic 暗黑魔法
fire_breath 喷火
four_seasons 四季
kiss_camera 吻镜头
spiral_ascent 螺旋上升
storm_magic 风暴魔法
truman_show 楚门的世界

每个文件把一种固定效果压成向量,在提示词里用 embedding:文件名 的形式引用即可,例如 embedding:minimaxh3_bullet_time,不需要单独的加载节点。

生成方式

H3 支持三种视频生成方式,对应官方的 T2V、I2V、R2V 三套模板工作流,全部同时输出画面与声音。

T2V 文生视频

只靠一段提示词生成视频,使用 fl2va 主模型。
提示词经 Qwen3-VL 编码成条件,采样出的潜码再分别解码成画面与声音,是最轻量的一种玩法。

I2V 图生视频

给一张图作为首帧,让画面从这张图动起来,同样使用 fl2va 主模型。
通过 MiniMaxH3ImageToVideo 节点接入,first_frame 口必填,last_frame 口可选,填了尾帧就变成首尾帧插值控制。

R2V 参考生视频

不写分镜,直接喂参考素材:最多 9 张参考图、3 段参考视频和 3 段参考音频。
使用 ref2va 主模型,通过 MiniMaxH3ReferenceToVideo 节点接入,适合锁定角色形象、画风、运镜节奏或指定音色。
注意这套走的是另一份权重,turbo LoRA 也要换成 ref2v 版。

分辨率约定

原生分辨率以短边 768 px 为基准,16:9 下约为 1344×768。
宽高需对齐 32 的倍数,总像素面积还有上限,官方提示避开 1.0 MP 档,以免 1376×768 超出面积限制。

节点对应关系

目录、加载节点与作用的关系整理如下,搭工作流时按这张表取模型:

目录 加载节点 作用
diffusion_models UNETLoader 去噪主模型
text_encoders CLIPLoader 提示词与图像编码
vae VAELoader 潜空间解码
loras LoraLoaderModelOnly 蒸馏提速
embeddings 提示词 embedding 语法 风格触发

搭建工作流

ComfyUI 官方为 H3 提供了 T2V、I2V、R2V 三套模板工作流,以及专门的首尾帧节点 MiniMaxH3ImageToVideo 与参考生视频节点 MiniMaxH3ReferenceToVideo,新手建议直接从模板改起。
想理解各模型如何协作,可以把模板拆开看,核心链路大致是这几步:

  1. UNETLoader 加载主模型,MODEL 口接入 KSampler
  2. CLIPLoader 加载 Qwen3-VL 编码器,分别编码正向与负向提示词,接到 KSampler 的 conditioning 口。
  3. LoraLoaderModelOnly 把 turbo 8step LoRA 插在主模型与采样器之间,并把采样步数设为 8、CFG 设为 1。
  4. 建一个视频潜空间(空视频 latent,或首尾帧对应的 latent),接到 KSampler 的 latent 口。
  5. 采样完成后走两条解码分支:视频分支用视频 VAE 解码后保存视频,音频分支用音频 VAE 解码后保存音频。
  6. 想要爆炸艺术风格时,在提示词开头加上 embedding:minimaxh3_art_is_explosion

推荐节点

孤海 MiniMax-H3 整合节点

打包了常用的 H3 节点能力,开箱即用:

导演台

能同时生成连续的多段视频,适合做长镜头叙事: