ComfyUI 节点介绍与 MiniMax H3 模型解析
前言
ComfyUI 把一次生成过程拆成一个个节点,连成工作流,模型加载、提示词编码、采样、解码各管一段。
刚上手视频类工作流时,最容易犯迷糊的是 models 目录下那一堆 safetensors 文件:它们分别是什么、由哪个节点加载、在一次生成里扮演什么角色。
MiniMax 是海螺 Hailuo 视频背后的公司,H3 是其新一代视频生成模型,能同时生成画面与声音。
本文以 ComfyUI 官方整理的模型仓库为线索,先补一点节点基础,再逐个拆解各文件的用途。
文中信息以官方 README 与 ComfyUI 文档为依据。
下载地址
全套文件来自 Comfy-Org 为 ComfyUI 整理的打包仓库,下载后按目录放进 models 对应子目录即可:
节点入门
ComfyUI 是节点式工作流编辑器,一个节点就是一个功能模块,输出口连线到下一个节点的输入口,数据沿连线流动。
一套完整的生成流程,通常就是加载、条件、采样、解码、保存这五段各来一两个节点。
常见节点分类
- 加载器类:把磁盘上的模型文件读进显存,是整条流水线的入口;
- 条件类:把提示词文本编码成模型能理解的条件向量;
- 采样器:
KSampler是核心引擎,在潜空间里迭代去噪; - 解码与保存类:把潜空间结果还原成图片、视频或音频,并落盘输出。
一条典型的视频生成链路大致是下面这样:
1 | 加载模型 → 编码提示词 → 初始化潜空间 → KSampler 去噪 → 解码 → 保存视频/音频 |
models 目录
ComfyUI 启动时会扫描 models 下的各子目录,按目录判定模型类型,节点下拉列表里的选项就来自这些目录。
H3 全套文件按官方仓库给出的目录结构放置:
1 | 📂 ComfyUI/ |
五个目录正好对应五类模型,下面逐一拆解。
两类生成权重
diffusion_models 与 loras 按生成方式分为两套,选文件时先确认走哪条路:
- fl2va:首尾帧生视频音频,对应 T2V / I2V;
- ref2va:全能参考生视频音频,对应 R2V。
text_encoders 和 vae 在两种方式中是同一份,不用纠结;
embeddings 是可选的风格触发向量,一般用不到。
推荐配置
如果只想装一套够用的,按下表选即可:
1 | 📂 ComfyUI/ |
五类模型解析
diffusion_models 主模型
这个目录放的是去噪主模型,也就是通常说的 DiT(Diffusion Transformer),整条工作流里算力开销最大的一环。
H3 按任务分了两套权重,不能混用:
fl2va用于 T2V 文生视频与 I2V 图生视频,支持首尾帧控制,输出视频与音频;ref2va用于 R2V 参考生视频,最多支持 9 张参考图、3 段参考视频和 3 段参考音频,用来锁定角色、风格、运镜与声音。
每套权重又各提供 5 个变体,按显存与 PyTorch 条件选择:
bf16全量版约 62 GB;pruned_bf16剪枝版约 37.5 GB;int8_convrotint8 量化加卷积旋转约 31.7 GB;pruned_int8_convrot剪枝叠加量化约 19.5 GB,社区最常用;pruned_fp8_scaledfp8 缩放量化约 19.5 GB。
官方建议优先选 int8_convrot 系列,需要 PyTorch cu130 及以上,环境跑不动再退到 fp8_scaled。
主模型通过 UNETLoader 节点加载,输出 MODEL 接给采样器。
text_encoders 文本编码器
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 是文本编码器,底座是 Qwen3-VL 32B 这个视觉语言模型。
用视觉语言模型当编码器,意味着提示词不只提供一句话的语义,模型还能结合参考图理解画面,对图生视频场景尤其重要。
仓库提供三种量化版本,体积依次为 48 GB、25.3 GB 与 14.6 GB:
bf16全量;int8_convrotint8 量化;nvfp4_awq4 bit 浮点加 AWQ。
官方特别说明 nvfp4 版不需要 Blackwell 显卡也能使用,显存紧张时的首选。
它由 CLIPLoader 节点加载,编码结果作为条件接给采样器。
vae 视频与音频解码
VAE 负责潜空间与真实信号之间的互转,采样发生在潜空间,最终结果要靠 VAE 还原。
这套模型配了两个 VAE,分工明确:
minimax_h3_video_vae_fp16.safetensors是视频 VAE,把视频潜码解码成一帧帧画面,fp16 是体积与精度的折中;minimax_h3_audio_vae_fp32.safetensors是音频 VAE,把音频潜码还原成波形,用 fp32 是因为音频对数值精度更敏感,误差大了容易听出杂音。
两个文件都用 VAELoader 加载,采样输出的潜码分别送进视频分支和音频分支解码。
loras 加速蒸馏
仓库提供三个 turbo LoRA,都是步数蒸馏的产物,定位是给主模型提速,每个约 1.8 GB:
fl2v_turbo_8step配 fl2va 主模型,官方默认 20 步采样,挂上后 8 步出片;fl2v_turbo_4step_768p是 4 步的 768p 版本,速度更快;ref2v_turbo_4step_v0.1配 ref2va 主模型,供 R2V 工作流使用。
LoRA 必须与主模型的任务形态配对,fl2v 与 ref2v 不能混挂。
提速的代价是音频与运动质量略有下降,文件名尾部的 comfyui_bf16 标注了适配 ComfyUI 的权重格式与 bf16 精度。
挂载方法
LoRA 不能独立使用,要用 LoraLoaderModelOnly 串在主模型之后,只改模型权重,不占文本编码器那份显存。
接入步骤:
- 确认文件已放进 models/loras 目录,按
R键刷新模型列表; - 添加一个
LoraLoaderModelOnly节点,把主模型与采样器串起来:
1 | UNETLoader (MODEL) → LoraLoaderModelOnly (MODEL) → KSampler (model) |
- 节点里
lora_name下拉选中该文件,strength_model先用 1.0,效果过猛再往下调。
之所以用 ModelOnly 版本而不是普通 LoraLoader,是因为该 LoRA 只作用于主模型,而这套工作流的文本编码器是独立的 Qwen3-VL,没有可挂的 CLIP 模型。
配套采样参数
挂上 turbo LoRA 之后,KSampler 的参数必须配套修改,否则画面容易发灰或糊掉:
steps:官方默认 20 步,挂 LoRA 后改为 8,4 步版对应 4;cfg:蒸馏模型通常吃不下高 CFG,先按 1 试,此时负向提示词基本不生效,属正常现象;sampler与scheduler:优先用官方模板的推荐值,没有就先试euler配simple的常规组合。
embeddings 风格触发
embeddings 目录是 10 个现成的风格触发向量,每个不到 1.5 MB,由社区成员整理,并非 MiniMax 官方出品。
从文件名就能看出各自的效果:
| 文件名 | 效果 |
|---|---|
| art_is_explosion | 爆炸艺术 |
| blooming_flowers | 花开 |
| bullet_time | 子弹时间 |
| dark_magic | 暗黑魔法 |
| fire_breath | 喷火 |
| four_seasons | 四季 |
| kiss_camera | 吻镜头 |
| spiral_ascent | 螺旋上升 |
| storm_magic | 风暴魔法 |
| truman_show | 楚门的世界 |
每个文件把一种固定效果压成向量,在提示词里用 embedding:文件名 的形式引用即可,例如 embedding:minimaxh3_bullet_time,不需要单独的加载节点。
生成方式
H3 支持三种视频生成方式,对应官方的 T2V、I2V、R2V 三套模板工作流,全部同时输出画面与声音。
T2V 文生视频
只靠一段提示词生成视频,使用 fl2va 主模型。
提示词经 Qwen3-VL 编码成条件,采样出的潜码再分别解码成画面与声音,是最轻量的一种玩法。
I2V 图生视频
给一张图作为首帧,让画面从这张图动起来,同样使用 fl2va 主模型。
通过 MiniMaxH3ImageToVideo 节点接入,first_frame 口必填,last_frame 口可选,填了尾帧就变成首尾帧插值控制。
R2V 参考生视频
不写分镜,直接喂参考素材:最多 9 张参考图、3 段参考视频和 3 段参考音频。
使用 ref2va 主模型,通过 MiniMaxH3ReferenceToVideo 节点接入,适合锁定角色形象、画风、运镜节奏或指定音色。
注意这套走的是另一份权重,turbo LoRA 也要换成 ref2v 版。
分辨率约定
原生分辨率以短边 768 px 为基准,16:9 下约为 1344×768。
宽高需对齐 32 的倍数,总像素面积还有上限,官方提示避开 1.0 MP 档,以免 1376×768 超出面积限制。
节点对应关系
目录、加载节点与作用的关系整理如下,搭工作流时按这张表取模型:
| 目录 | 加载节点 | 作用 |
|---|---|---|
| diffusion_models | UNETLoader | 去噪主模型 |
| text_encoders | CLIPLoader | 提示词与图像编码 |
| vae | VAELoader | 潜空间解码 |
| loras | LoraLoaderModelOnly | 蒸馏提速 |
| embeddings | 提示词 embedding 语法 | 风格触发 |
搭建工作流
ComfyUI 官方为 H3 提供了 T2V、I2V、R2V 三套模板工作流,以及专门的首尾帧节点 MiniMaxH3ImageToVideo 与参考生视频节点 MiniMaxH3ReferenceToVideo,新手建议直接从模板改起。
想理解各模型如何协作,可以把模板拆开看,核心链路大致是这几步:
- 用
UNETLoader加载主模型,MODEL 口接入KSampler。 - 用
CLIPLoader加载 Qwen3-VL 编码器,分别编码正向与负向提示词,接到KSampler的 conditioning 口。 - 用
LoraLoaderModelOnly把 turbo 8step LoRA 插在主模型与采样器之间,并把采样步数设为 8、CFG 设为 1。 - 建一个视频潜空间(空视频 latent,或首尾帧对应的 latent),接到
KSampler的 latent 口。 - 采样完成后走两条解码分支:视频分支用视频 VAE 解码后保存视频,音频分支用音频 VAE 解码后保存音频。
- 想要爆炸艺术风格时,在提示词开头加上
embedding:minimaxh3_art_is_explosion。
推荐节点
孤海 MiniMax-H3 整合节点
打包了常用的 H3 节点能力,开箱即用:
- 节点仓库:https://github.com/goohai/Goohai-MiniMax-H3_Integration
- 依赖 MiniMax-H3-T8 节点
- 示例工作流:https://www.runninghub.cn/post/2086579374731649025
导演台
能同时生成连续的多段视频,适合做长镜头叙事: