MiniMax H3 开源视频模型测评总结(附一键整合包)

开源视频模型终于“上桌吃饭”
2026年8月3日,MiniMax正式开源新一代通用视频模型H3,这是开源视频模型首次真正逼近闭源旗舰水平。在权威榜单Artificial Analysis中,H3的视频编辑能力位列全球第一,文生视频、图生视频能力分列第二、第三。
关键规格:支持4~15秒视频生成,最高2K分辨率,同步输出32kHz立体声音频,支持中英日韩法等11种语言。模型分为FL2VA(首尾帧生成)和Ref2VA(全模态参考生成)两个分区,FL2VA输入首帧即图生视频,同时输入首尾帧则自动补全中间动作;Ref2VA最多支持9张图片+3段视频+3段音频的混合参考。
本地部署门槛与性能
INT8量化版本配合24GB单卡即可运行,采用自动按层offload机制。推荐使用ComfyUI 0.27+,模型权重需同时存放于models/MiniMax-H3/(单文件权重)和models/diffusers/MiniMax-H3/(分片release含config.json),缺一不可。国内用户推荐通过ModelScope下载。
生成速度方面,官方采样50步,配合res_multistep加速可实现约2.2倍提速,21个sigma点即可达到50步Euler的质量。实测480P五秒视频约5-10分钟,具体视硬件而定。
一键整合包获取
本测评配套全套资源已整理,包含ComfyUI工作流、模型及提示词模板:
803免费版Seedance 2,Minimax-H3视频生成模型开源,影视级视频效果!文生视频 | 图生视频 | 全能参考生成视频 8G显存就能跑,支持图生/文生/首尾帧/多参考(图+视频+音频),效果接近闭源
一键整合包
下载解压双击bat启动即可使用
ComfyUI模型及工作流,
记得更新cofmyui到最新版再安装
附视频超清软件


MiniMax H3开源视频模型——8G显存就能跑,支持图生/文生/首尾帧/多参考(图+视频+音频),效果接近闭源
对比LTX等旧模型: H3已“上桌”,效果显著提升
对比Flux 3预览版: Flux 3真实感更强、支持20秒,但参考一致性极差
综合能力: H3是目前开源视频模型中综合实力最强、最均衡的选择
缺点 生成速度慢,高分辨率耗时较长 多参考时资源消耗巨大,生成时间翻倍 量化版(INT8)细节丢失较多 优点 中文提示词理解优秀 人物面部稳定,五官、发型、服装一致性良好 音频干净,无明显爆音/炸麦 全模态输入,开源模型中领先
优点 •中文提示词理解优秀 •人物面部稳定,五官、发型、服装一致性良好 音频干净,无明显爆音/炸麦 •全模态输入,开源模型中领先
现在seedance我发现特别喜欢偷懒节省算力,各种动作能慢就慢,能拖就拖,结果就是要么运镜出问题,要么就是角色或者动作穿帮,这也是seedance现在打斗非常容易抽卡的主要原因。然后一抽卡他就多赚钱,已经黑心到没救了。不是他不行,而是字节故意的。
一句话总结
H3是视频生成开源领域的分水岭——性能追上闭源,门槛降到消费级显卡,社区生态刚刚启动。现在下载整合包,你的显卡就能跑起来。
&spm=1001.2101.3001.5002&articleId=163455184&d=1&t=3&u=fdab0683ca1a4735b7b797babcf91ca2)
2524

被折叠的 条评论
为什么被折叠?



