
HY
折腾进行时
Hello, I'm HY.








暂未播放

MiniMax H3 官方说 3060 能跑,但实际上很多人跑起来还是很吃力。我折腾了好几天,找到了一个工作流,不仅能跑,而且直接提速 500%。
更离谱的是,这个工作流甚至没用官方 4 步 LoRA,但生成速度和质量都比用了 LoRA 的更优秀。
下面把模型下载、插件、配置、实测数据都整理一遍。
Share/Comfyui/Workflow/H3-3.0.json at main · hy4962/Share

| 来源 | 地址 |
|---|---|
| HuggingFace | Comfy-Org/MiniMax-H3 |
| 国内源 | ModelScope |
下面这套组合实测可以正常运行:
| 文件类型 | 文件名 |
|---|---|
| diffusion_models | minimax_h3_fl2va_int8_convrot.safetensors |
| text_encoders | qwen3vl_32b_minimax_h3_int8_convrot.safetensors |
| vae | MiniMax-H3 VAE |
有些插件在 ComfyUI Manager 里可能搜不到,可以直接从 GitHub 安装:
工作流里自带了提示词模板,用法很简单:
强烈建议本地部署 Qwen 3.5 无审查版本来生成提示词,怎么在自己电脑上跑起来,可以看我那篇本地部署 Qwen3.5 完全指南。哪怕是 Grok,也容易遭到拒绝回答。
如果你是 8G 显存,把红色的节点换成绿色的即可。

使用 Max 模式可以保持非常优秀的人物一致性,但速度会慢一倍。一般 Match 模式也够用了。

由于没有使用 4 步 LoRA,所以步数可以自己设置。默认 10 步,速度很快,质量也不错。追求更高质量可以设成 15 步,这个工作流很快,多几步没什么影响。

跑了好几天,生成了三四十个 10 秒视频,以下是两个典型场景的耗时:
总时长 249 秒,直出 0.4 像素 8 秒视频。

也可以直出 0.9 像素 10 秒视频,总时长约 1000 秒。

有时候衣服或者部分场景对不上文字描述,这是因为在 Full-Reference Mode(全参考模式)下,AI 的优先级逻辑是:
<Picture N>(参考图)中的视觉特征<Subject N> 定义的文字描述detailed_description 中的动态场景描写不过实测更强烈的文字描述可以跨越优先级,所以描述写详细一点是有用的。
目前只推荐官方原版的提示词 Skill。试了很多其他 UP 主的,发现效果都不如官方 Skill。有些 UP 的提示词适用范围太小,有些太短,不太通用。
这个工作流的核心优势就是:不用官方 4 步 LoRA,速度反而更快,质量也不错。对于显存有限的用户来说,是个比较好的选择。
如果有什么问题或者更好的配置方案,欢迎交流。
如果这篇文章对你有帮助,欢迎分享给更多人或打赏支持!
部分内容可能已过时
分享你的想法,与大家交流讨论