MiniMax H3 开源,开源视频终于上桌吃饭了
免费。本地跑。没人审你。人脸没限制,版权没限制。还能多参考,图、视频、音频一起喂。
最关键的是,社区还在发力中。工作流、模型、提示词模板,每天都在往外冒
文生视频 | 图生视频 | 全能参考生成视频 8G显存就能跑,支持图生/文生/首尾帧/多参考(图+视频+音频),效果接近闭源

8月3日,MiniMax 把他们的新一代通用视频模型 H3 开源了。
我第一时间跑了一遍。跑完之后,脑子里就一句话,开源视频模型
这不是我随便吹。在权威榜单 Artificial Analysis 里,H3 的视频编辑能力排到了全球第一,文生视频第二,图生视频第三。注意,这是和一堆闭源旗舰放一起排的。开源模型头一回,真正摸到了闭源旗舰的腰。
先说它到底是个啥。
H3 支持 4 到 15 秒的视频生成,最高 2K 分辨率,还能同步输出 32kHz 的立体声音频,支持中英日韩法等 11 种语言。
模型分了两个分区。一个叫 FL2VA,管首尾帧生成。你只丢首帧进去,它就等于图生视频。你同时丢首尾帧,它就自动把中间的动作补全。另一个叫 Ref2VA,管全模态参考生成,最多可以吃 9 张图片、3 段视频、3 段音频的混合参考。
这个全模态输入,是目前开源模型里领先的存在。图、视频、音频一起喂
回到对比这块,我才觉得 H3 的「上桌」有多实在。
跟 LTX 那批老模型比,H3 已经不是同一个桌子的玩家了,效果提升是断档式的。你如果还停留在 LTX 时代,真的该更新认知了。
跟 Flux 3 的预览版比,情况有点意思。Flux 3 的真实感确实更强,还能干到 20 秒。但它的参考一致性极差,你 Reference 进去的人脸、物体,出来经常对不上。这点上 H3 反而稳。
综合实力排下来,H3 就是现在开源视频模型里最均衡、综合实力最强的一个。没有哪一项拉胯到不能看,也没有哪项靠堆参数硬撑。
说到这,我必须单独聊聊 Seedance。
我自己最近一直在拿 Seedance 2 做打斗镜头,越用越来气。我发现它现在特别喜欢偷懒,省算力。各种动作,能慢就慢,能拖就拖。
结果就是,要么运镜出问题,要么角色或者动作直接穿帮。这也是 Seedance 现在打斗特别容易抽卡的核心原因。
而一抽卡,它就让你重生成,它多赚钱。真的就是一声叹息。
我现在越测越觉得,这不是它能力不行,更像字节是故意的。不是技术做不到,是商业上选择不把算力给你铺满。
这话可能有点刺耳,但我是真这么认为的。说真的,一个能做好运镜的模型,被调教成能拖就拖,你说巧合我是不信的。
回到 H3 的优点上
它正好在 Seedance 翻车的地方站住了。
第一,中文提示词理解优秀。这点对国内玩家太重要了,你用大白话写,它真能懂。
第二,人物面部稳定。五官、发型、服装的一致性保持得很好,不像有些模型每帧换张脸。
第三,音频干净。同步出来的立体声,没有那种明显的爆音和炸麦,能直接用。
第四,全模态输入,开源里领先。图加视频加音频一起参考,这功能目前就它能打。
缺点我也得说清楚
生成速度慢,高分辨率下耗时特别长。多参考的时候资源消耗巨大,生成时间直接翻倍。INT8 量化版虽然能降门槛,但细节丢失挺多,脸和纹理会糊一点。

“480p 生产、768p 精选”策略:抽卡 480p/640×640(v1 ~109s / v2 ~300s)→ 成片 1344×768(~600-900s)
坦率的讲,这些不是小问题。如果你指望它跟闭源旗舰拼生产效率和画质上限,现在还差一口气。但作为开源,它已经把桌子掀了。
顺着部署这块再聊,门槛到底多低。
官方宣传 8G 显存就能跑,但我实测下来的建议是,想跑得舒服,INT8 量化版配合 24G 单卡更稳,它有自动按层 offload 机制撑着。
你需要 ComfyUI 0.27 以上的版本。模型权重要放两份,models/MiniMax-H3/ 放单文件权重,models/diffusers/MiniMax-H3/ 放分片 release 含 config.json,两个路径缺一不可。国内用户我建议直接走 ModelScope 下,快很多。
速度方面,官方采样 50 步,配合 res_multistep 加速能到大概 2.2 倍提速,21 个 sigma 点就能达到 50 步 Euler 的质量。实测 480P 五秒的视频,大概 5 到 10 分钟,看硬件。

如果你不想折腾上面这些,我整理了一键整合包。
解压,双击 bat,启动就能用。里面包含了 ComfyUI 工作流、模型还有提示词模板。注意,先把 ComfyUI 更新到最新版再装。
一键整合包 下载解压双击bat启动即可使用,
夸盘夸克网盘分享
度盘: 百度网盘 请输入提取码 提取码: 2026
附带
cofmyui模型及工作流,
记得更新cofmyui到最新版再安装
视频超清软件

说到这,我想扯远一点。
当年 Stable Diffusion 开源那一刻,AI 绘画从几家的闭源玩具,变成了全民能玩的平民工具。那次开源,磨平了很大一块信息差。
今天 H3 干的事,几乎一模一样,只是换到了视频。
我们曾经以为,影视级视频生成会被几家闭源巨头锁死,普通人只能隔着屏幕看,掏钱才能用。H3 证明,开源社区追上来,只是时间问题。8G、24G 的卡就能跑,算力平权的拐点,被它推到了我们面前。
这比任何一家公司的发布会都重要。

950

被折叠的 条评论
为什么被折叠?



