💡 一句话总结:MiniMax H3 是个 33B 的全模态视频生成模型(不是语言模型),7 月底预告、8 月初开放了 H3-Base 权重;但「开源」指的是基础权重,2K 超分和多模态上下文编排这两个亮点能力还在闭源 API 后面,协议也是 MiniMax 自有的——想本地玩、想商用、想看跑分,各有各的注意点。 \
导语:先别急着以为是新语言模型
最近 AI 视频生成这条赛道卷得厉害——OpenAI 的 Sora、快手的可灵、字节的即梦、Google 的 Veo,再加上开源这边的阿里 Wan,隔三差五就有人放新东西。所以当「MiniMax H3 开源」这几个字刷出来的时候,不少人的第一反应可能是:哦,MiniMax 又出新一代语言模型了?
不是。这次的开源主角 H3,跟语言模型没半点关系——它是 MiniMax 旗下「海螺」(Hailuo)视频生成产品线的第三代,干的是文生视频、图生视频、多模态参考生成,还顺带原生生成立体声音频的活儿。属于「你看的、你听的,它一条龙包了」那种模型。
所以这篇就把这事拆开讲清楚:H3 到底是什么、强在哪、那个「开源」到底开了什么没开什么、在 GitHub 上闹了一下的「虚假宣传」风波是怎么回事,以及——如果你想本地跑或者拿来做产品,得先知道哪些事。
想自己动手试? \
- 🌐 官方公告(中文):MiniMax H3 开源
- 🌐 官方 blog(英文):MiniMax H3 介绍
- 💻 代码与权重:GitHub MiniMax-AI/MiniMax-H3
- 🎬 在线体验:海螺 AI
🧩 H3 是什么:先把最大的误会拆了
先把最容易踩的坑填了:MiniMax H3 是视频/多模态生成模型,不是大语言模型。 MiniMax 自己的模型矩阵是分线的——语言那头有 M3、有 H1-MoE(混合专家架构的语言模型);视频这头是「海螺」系列,从 Hailuo 01(从零搭系统)到 Hailuo 02(优化架构、数据、规模),再到这次的 H3,定位从「专用」转向「通用多模态」。两条线,别串了。
时间上一句话带过:2026 年 7 月 31 日官方英文 blog 先放出预告(说「未来几天开源权重」),8 月 3 日正式把权重放到 HuggingFace 和魔搭社区 ModelScope。中英文页对日期的标注有点对不齐(中文页标 8/3,英文 blog 标 7/31),更像是「预告 + 正式开源」两步走。
那 H3 到底能干嘛?一句话:文本、图像、视频、音频,它用一套模型统一理解和生成。 具体到产出:
- 视频时长 4–15 秒,默认 768p 短边(最高能到 2K,但见后面「开源拆开看」那节),24 帧/秒
- 原生立体声音频,32kHz 采样率——注意「原生」两个字,下一节讲为什么重要
- 支持 21:9、16:9、4:3、1:1、3:4、9:16 六种宽高比
- 对话稳定支持 11 种语言(中、英、日、韩、法、德、西、葡、俄、意、阿)
架构上几个对技术爱好者有意义的数字:主体是 33B 参数的 Dense Transformer(Dense 就是「密堆」,所有参数每次都上场,区别于 MoE 那种「大部分参数轮休」的稀疏架构),其中约 13B 参数在 AdaLN 分支里(推理时可以预计算缓存掉、不用加载);多模态编码器直接用了 Qwen3-VL-32B 的预训练权重(取第 50 层隐藏状态)。精度 BF16。
✨ 强在哪:开源视频模型里少见的「全模态 + 原生声音」
开源视频模型现在不稀奇了,H3 想站住脚,得有不一样的东西。把官方信息和现状放一起看,它真正稀缺的点有两个。
一是原生立体声音频。 大多数视频生成模型要么不生成声音(出个无声视频,你再去配),要么后接一个独立的语音/音乐模型。H3 是把音频塞进同一个模型里一起生成,32kHz 立体声、跟画面同步。对做短片、广告、品牌内容的人来说,「出片自带声」这个体验差异是实打实的——少一道工序。
二是统一的多模态参考输入。 它有个「全参考模式」(官方叫 Ref2VA),能同时吃进去最多 9 张图、3 段视频、3 段音频,然后用自然语言告诉它「把这些素材的关系这样处理」。这在做风格迁移、角色一致性、品牌素材延展的时候,比单纯「文生视频」灵活得多。
价格上官方话术也很猛:说 2K 分辨率「每秒价格不到主流模型的 1/3」,768p「不到主流模型 720p 价格的一半」。但这里得插一句澄清:这些是官方自报的相对说法,没给绝对数字,也没给 benchmark 跑分。 同行对比、第三方评测,截至目前公开渠道都还缺位——一份能查到的、权威的横向评测,比官方自报的「最强/最便宜」更值得等。所以「又强又便宜」这个印象,先存疑,等实测。
🔍 但「开源」要拆开看:开了什么、留了什么在 API
这是整件事最该看仔细的地方。MiniMax 说的「开源」,开的是 H3-Base 的两个任务变体权重:
FL2VA(首尾帧模式):给 0、1 或 2 张图生成视频——文生视频、首帧生视频、首尾帧生视频Ref2VA(全参考模式):就是上面说的多图/多视频/多音频参考生成
这两个权重走的是 MiniMax H3 Community License——注意,这是 MiniMax 自己的社区协议,不是 Apache 2.0、MIT 那种 OSI 认证的「开源」协议。个人玩没问题,但你要拿去做商用产品,得老老实实把协议条款读一遍(用途限制、商业门槛、合规义务),别默认能随便用。
更要紧的是没开的部分:
- H3-Context-IR(多模态上下文编排)——就是那个「把多张图、多段视频、音频的关系理清楚」的编排系统,没开源,只给 API
- H3-Regenerate-2K(2K 分辨率再生成)——把 768p 的结果升到 2K 的模块,也没开源,只给 API
这意味着什么?你本地能跑出来的,是 768p 的 H3-Base;那个最亮眼的「原生 2K 直出」和「复杂多模态参考编排」,本地权重跑不出来,得调 MiniMax 的 API。 所以「开源」和「官方 demo 里那个完整体验」,不是一个东西。这是「开源 vs 开放权重」这个老议题的又一次典型再现——开了基础底座,把差异化的上层能力留在自己的 API 后面。社区对这种事一向敏感,下面那个风波就跟它有关。
🌀 那个「虚假宣传」风波:起因是搞错了,可它戳中了一个真问题
开源没几天,GitHub 上就冒出来一个刺眼的 issue(#5,8 月 6 日)。发帖人的标题直接叫 "Same tactics as used by alibaba wan team"——翻译过来就是「和阿里 Wan 团队一个套路」,潜台词是「你们跟阿里 Wan 一样,嘴上开源、实际开源的跟闭源的不是一回事」。他在正文里说自己用同一个提示词测,闭源版能生成视频,开源权重(两种模式都试了)完全跑不通,措辞里带着「虚假宣传」。
但事情有个反转:这个发帖人后来自己在 issue 里编辑承认搞错了。 他在调整了系统提示词(system prompt)之后,模型成功跑了起来,于是撤回了「虚假宣传」的指控,承认「H3 确实是有能力的模型」,问题出在自己用法上。
所以这是一起已经澄清的「假争议」——不是模型不行,是用法没对。但值得拎出来说的是,这条帖子虽然撤回了,它戳中的那个真问题并不会凭空消失:开源权重(768p Base)和官方闭源体验(2K + Context-IR 编排)本来就不是一回事,跑不通的时候,到底是你用法的问题,还是能力对等性的问题? 这个疑虑,不会因为一条帖子撤回就打消——尤其是当一个模型「最亮的能力都在 API 后面」的时候。
顺带一提,同期还有两个更「接地气」的 issue:一个吐槽没给 requirements.txt(装环境费劲),一个报 diffusers 推理跑不通。这些就是新开源项目常见的工程打磨问题,能修,但会让头一批想上手的人多花点试错成本。
🖥️ 想本地跑:门槛和现实
如果你是那种「看到权重就想自己拉起来跑」的人,这里有几个实在数字:33B 参数、BF16 精度,官方给的 SGLang 部署示例是 4 张 GPU(用 Ulysses 并行)。推理框架支持 SGLang、vLLM、diffusers、ComfyUI 四种,覆盖算全。
但官方没明确给最小显存、单卡可行性这些细节。 所以现实是:33B 这个量级 + 官方示例的 4 卡配置,基本就是企业卡或者工作室级别的部署场景。消费级单卡用户(比如一张 4090/5090)大概率停在「下下来观摩」,而不是「日常生产用」。「人人可跑」和 MiniMax 那句 "Intelligence with everyone" 的普惠叙事之间,还隔着一块显存的墙。
把话说明白
回到开头那个钩子——H3 的「开源」,确实得拆开看。
站得住的是:它是开源视频生成模型里一份实打实的贡献——33B Dense、全模态统一、原生立体声音频、6 种宽高比、11 种语言,这套组合在开源侧目前确实少见,Hailuo 01→02→H3 这条线的迭代也是实打实的。
要拆开看的是:「开源」指的是 768p 的 H3-Base 权重,2K 直出和多模态上下文编排这两个亮点还在 API 后面;License 是 MiniMax 自有的,不是 Apache/MIT;价格「不到主流 1/3」是官方自报的相对值、没绝对数字;benchmark 跑分到现在也没公开。那个「虚假宣传」风波被发帖人自己撤回了,但它折射出的「开源权重 ≠ 闭源完整体验」这个普遍疑虑,对任何一个把核心能力留在 API 后面的「开源」都成立。
对不同人,意味不同:想体验完整能力的,去海螺或者调 API 最直接;想本地部署、魔改、做研究的,H3-Base 够你玩,但要接受 768p 的天花板和发布初期的工程打磨;想拿去做商用产品的,那份 Community License 得先过一遍。
一句话:H3 是开源视频模型里一份有分量的贡献,但「开源」两个字背后的边界、协议、和待补的实测数据,比标题里那四个字重要得多。
参考来源
- MiniMax 官方中文公告(一手/官方)— 发布与开源细节、架构参数
- MiniMax 官方英文 blog(一手/官方)— 能力介绍、定价话术、Hailuo 脉络
- GitHub 仓库 MiniMax-AI/MiniMax-H3(一手/官方)— 权重、部署示例、License
- GitHub Issue #5 "Same tactics as used by alibaba wan team"(社区/开发者,已由发帖人自行撤回)
- 海螺 AI 在线体验(官方产品)— 闭源完整能力入口
作者:lusca
版本:lusca-report-blog v1.4.0
出处:https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-report-blog \
