MiniMax H3 私有化部署方案
深度研究笔记 · 2026-09-07 · 全部关键事实经一手来源核对(许可原文 / HF 模型卡 / SGLang 与 vLLM 官方配方)
开源 2026-07-31
许可 中国大陆可用(排除 EU/UK/韩/美)
商用门槛 年营收 >
0.13/s,与直接 2K 同价——先 768p 迭代再一次性 2K 不多花钱。
生成时间: 2026-09-07 21:37 · 源文件 SHA256: 9ccdb97100a67678 · 由 markdown 渲染为独立 HTML
(function () {
var toc = document.getElementById(‘toc’);
var headings = document.querySelectorAll(‘#content h2, #content h3’);
headings.forEach(function (h, i) {
var id = ‘sec-‘ + i;
h.id = id;
var li = document.createElement(‘li’);
if (h.tagName === ‘H3’) li.style.paddingLeft = ‘1.2rem’;
var a = document.createElement(‘a’);
a.href = ‘#’ + id;
a.textContent = h.textContent;
li.appendChild(a);
toc.appendChild(li);
});
})();
*** QuickLaTeX cannot compile formula:
20M 需授权</b></span>
<span>开源部分 <b>仅 H3-Base 768p</b></span>
<span>生产首选 <b>SGLang</b></span>
</div>
<h2>目录</h2>
<ol></ol>
<div>
<h1>MiniMax H3 私有化部署方案 — 深度研究</h1>
日期:2026-09-07 | 全部关键事实来自一手来源(许可原文、HF 模型卡、SGLang/vLLM 官方配方,均已抓取原文核对)
<hr>
<h2>0. 一句话结论</h2>
<strong>MiniMax H3 不是文本大模型,而是开源的"视频+原生立体声"生成模型</strong>(2026-07-31 开源)。开源的只有 H3-Base(768p 主干),2K 超分和复杂提示词理解两个模块仍只有官方 API。私有化部署在中国大陆<strong>许可上完全可行</strong>(社区许可排除的只有 EU/UK/韩/美),商用门槛是年营收 >2000 万美元才需书面授权。生产部署首选 SGLang(4×H100/H200 或 8 卡昇腾 NPU 均有官方验证配方),单卡/工作站走 ComfyUI 量化生态(24GB 卡即可起步,12GB 是地板),要 2K 官方画质只能"本地 768p + 官方 API 混合"。
<hr>
<h2>1. H3 是什么:先把对象搞清楚</h2>
<table>
<thead>
<tr>
<th>维度</th>
<th>事实</th>
</tr>
</thead>
<tbody>
<tr>
<td>定位</td>
<td>通用全模态<strong>生成</strong>系统:统一理解文本/图像/视频/音频上下文,生成<strong>带原生立体声的视频</strong></td>
</tr>
<tr>
<td>官宣开源</td>
<td>2026-07-31(Reuters 报道);许可证落款 2026-08-02</td>
</tr>
<tr>
<td>输出规格</td>
<td>4-15 秒、24 FPS、32kHz 立体声、宽高比 21:9~9:16、短边默认 768px(画布 32 的倍数)</td>
</tr>
<tr>
<td>提示词语言</td>
<td>11 种稳定支持(含中英)</td>
</tr>
<tr>
<td>两个开源 checkpoint</td>
<td><strong>FL2VA</strong>(文生视频+首/尾帧控制)、<strong>Ref2VA</strong>(全参考:\le9 图 + \le3 视频 + \le3 音频,共 \le12 文件,纯音频被拒)</td>
</tr>
<tr>
<td>开源边界</td>
<td><strong>只有 H3-Base(768p 生成主干)开源</strong>。H3-Context-IR(多模态提示词理解/改写)和 H3-Regenerate-2K(768p→2K 再生成)<strong>均未开源</strong>,只有官方 API</td>
</tr>
<tr>
<td>精度</td>
<td>BF16,且是 <strong>CFG 蒸馏</strong>后的权重(部署时 <code>cfg-parallel-size</code> 必须为 1,没有负分支)</td>
</tr>
</tbody>
</table>
<h3>架构(决定硬件需求的三件事)</h3>
<ol>
<li><strong>H3-Omni-Transformer</strong>:33B dense 单流 Transformer,50 个 block;其中 <strong>~13B 参数在 AdaLN 分支里</strong>——推理时这部分可预计算/跳过(社区 "pruned" 量化版就是砍这个,体积小 ~40%)。视频+音频各一份 52-block DiT,单份 61.73 GiB (BF16)。</li>
<li><strong>H3-Encoder = Qwen3-VL-32B</strong>(取前 50 层隐状态),约 46-51.5 GB BF16,<strong>Apache 2.0</strong> 无附加限制。</li>
<li><strong>双 VAE</strong>:VisualVAE(f16t4d24,patch 后等效 32× 空间/4× 时间压缩,含 ViT 解码器,约 10GB 级)+ AudioVAE(32kHz→40Hz 潜变量,左右声道独立编解码)。</li>
</ol>
训练时用了原生稀疏注意力,但<strong>开源首发只有全注意力推理</strong>,稀疏实现"未来更新"。
<blockquote>
由此总账:一套 FL2VA 分区 ~134 GiB BF16 权重(DiT+编码器+双 VAE),两个任务分区全下 ~270 GiB;HF 官方仓库全量 464.2 GiB(含 diffusers 格式重复份)。存储预算按 \ge 500GB NVMe 规划。
</blockquote>
<hr>
<h2>2. 许可与合规(私有化前必须过的一关)</h2>
来源:许可原文 + 官方 License Q&A(均已核对原文,媒体报道与原文有出入,以本节为准)。
<ul>
<li><strong>许可类型</strong>:MiniMax H3 Community License Agreement(v2026-08-02),授予方为 MiniMax 新加坡主体 <strong>Nanonoble Pte. Ltd.</strong>,管辖法域<strong>香港</strong>。下载/使用即视为接受。</li>
<li><strong>适用地域 = 全球,排除四处:欧盟、英国、韩国、美国</strong>。官方 Q&A 明确这是监管原因(EU AI Act、美方视频生成版权诉讼等),"not yet, not ever";被排除地区可走 <a>申请表</a> 单独拿授权。<strong>中国大陆属于适用地域,社区许可直接覆盖。</strong></li>
<li><strong>商用门槛</strong>:使用 H3 的商业产品/服务<strong>年营收 > 2000 万美元</strong>需事先书面授权(api@minimax.io,主题 "MiniMax H3 licensing - authorization request");低于门槛自由商用。</li>
<li><strong>商用硬义务</strong>:在产品 UI 上<strong>显著标注 "MiniMax H3"</strong>(许可第 IV.2 条,强制);分发需附协议副本和 NOTICE 文件;鼓励 "Powered by MiniMax H3" 和给生成文件加 AI 标识。</li>
<li><strong>使用限制</strong>:不得用 H3 或其输出改进其他 AI 模型;不得军事用途;对外提供服务需自建与 AUP 等强的安全护栏 + 违规举报机制(<strong>本地部署后内容审核责任在自己</strong>,这点对国内企业还叠加《生成式 AI 服务管理暂行办法》/深度合成标识义务)。</li>
<li><strong>编码器豁免</strong>:Qwen3-VL-32B 部分是 Apache 2.0,不受上述约束。</li>
<li><strong>下载渠道</strong>:HF 仓库当前<strong>未设门禁</strong>(2026-09-07 实测 <code>gated:false</code>,匿名可下;vLLM 配方里"需申请访问"的说法已过时);国内走 ModelScope 官方镜像 <code>MiniMax/MiniMax-H3</code>(SGLang 支持 <code>SGLANG_USE_MODELSCOPE=true</code> 直拉)。</li>
</ul>
<hr>
<h2>3. 硬件门槛总账</h2>
<table>
<thead>
<tr>
<th>资源</th>
<th>最低</th>
<th>生产推荐</th>
</tr>
</thead>
<tbody>
<tr>
<td>存储</td>
<td>FL2VA 单分区 ~135 GiB</td>
<td>全仓库 500+ GiB NVMe(权重随机读取,HDD 会拖垮流式加载)</td>
</tr>
<tr>
<td>显存(数据中心)</td>
<td>4×80GB(H100,TP2+Ulysses2,峰值 ~57GB/卡)</td>
<td>4×141GB H200(Ulysses4)或 8×B300 FP8</td>
</tr>
<tr>
<td>显存(单卡)</td>
<td>12GB VRAM + 32GB 内存 + NVMe(SGLang 极简路径,流式)</td>
<td>单卡 96GB 可容纳 FL2VA 分区不卸载(容量检查通过)</td>
</tr>
<tr>
<td>显存(消费级 ComfyUI)</td>
<td>8GB(DiffSynth NF4 重卸载,很慢)</td>
<td>24GB(pruned INT8 19.5GB + TE 量化 14.6GB)</td>
</tr>
<tr>
<td>主机内存</td>
<td>32GB(极简流式路径)</td>
<td>双卡 recipe 需 \ge 200GB,<strong>推荐 384GB</strong>;RTX 2080Ti 22G 老卡也有 W4A8 方案</td>
</tr>
<tr>
<td>特殊平台</td>
<td>Turing sm_75、Apple Silicon(h3.c Metal 原生)、AMD MI300X/MI355X、<strong>华为昇腾 NPU</strong> 均有可跑方案</td>
<td></td>
</tr>
</tbody>
</table>
<strong>H20(96GB)</strong>:未找到任何官方验证配方。按"单卡 96GB 容量检查通过(B300 代理峰值 92.9GB)"推断 FL2VA 分区 BF16 大概率装得下,但 H20 算力弱、去噪是算力受限任务,速度会很差——能买验证过的卡就别赌。
<hr>
<h2>4. 路线 A:SGLang(生产首选,配方最全)</h2>
SGLang Diffusion 有 H3 原生 pipeline,<code>sglang serve</code> 一条命令起服务,官方 cookbook 每条配方都在真机验证过:
<pre><code>sglang serve --model-path MiniMaxAI/MiniMax-H3
--num-gpus 4 --ulysses-degree 4 --performance-mode speed
--host 0.0.0.0 --port 30010 --model-variant fl2va # Ref2VA 换 --model-variant ref2va
</code></pre>
<table>
<thead>
<tr>
<th>硬件</th>
<th>配方</th>
<th>实测</th>
</tr>
</thead>
<tbody>
<tr>
<td>4×H100 80GB</td>
<td>TP2+Ulysses2(最快的无损配方)</td>
<td>峰值 ~57GB/卡(比替代拓扑低 30GB)</td>
</tr>
<tr>
<td>4×H200 141GB</td>
<td>Ulysses4 最快;TP2+U2 峰值最低(~64GB)</td>
<td>1344×768/124帧/50步:lossless 中位 <strong>85.5s</strong>;<code>quality=high</code>(Cache-DiT)<strong>63.4s</strong>(1.35×,SSIM 0.9709)</td>
</tr>
<tr>
<td>8×H200</td>
<td>LMSYS 08-27 加速优化</td>
<td>无损 <strong>1.95×</strong>,允许质量损失最高 <strong>6.24×</strong>(SSIM 0.76-0.91)</td>
</tr>
<tr>
<td>B200/B300</td>
<td>在线 FP8 量化(权重盘上仍 BF16,运行时转换)</td>
<td>8×B300 峰值 ~52GB/卡</td>
</tr>
<tr>
<td>2×RTX 5090 32GB</td>
<td>TP2+逐层卸载</td>
<td>峰值 26.3GiB/卡;50 步 5s 768p 全程 559.7s</td>
</tr>
<tr>
<td>单卡 RTX 4090 24GB</td>
<td><code>kitchen_int8</code></td>
<td>峰值 ~18GB;1011×576/4s/50步 130.7s</td>
</tr>
<tr>
<td>AMD MI300X/MI355X</td>
<td>ROCm+AITER,day-0</td>
<td>官方验证</td>
</tr>
<tr>
<td><strong>华为昇腾 NPU</strong></td>
<td>8 卡 TP2+SP4 + Laser Attention + Cache-DiT(另有 4 卡 TP2+SP2)</td>
<td>8 卡比 4 卡 E2E 延迟低 <strong>46.8%</strong>——<strong>国产化路线已验证</strong></td>
</tr>
</tbody>
</table>
关键工程结论(官方审计数据):
- <code>quality=high</code>(Cache-DiT):SSIM 0.931 / PSNR 28.16dB,批量生产场景的性价比开关。
- <strong>AdaLN 预计算缓存</strong>:把 13B AdaLN 分支预计算缓存,推理省显存省算力(固定采样计划下无损)。
- 跨节点:2×8 H200,Ulysses8×Ring2,V2V 去噪 128.6s → 68.2s(<strong>-47%</strong>)。
- V2V(视频改写)是 ref2va 的用例,同一个服务覆盖。
- 同硬件下 SGLang 快于 ComfyUI 前端方案。
<hr>
<h2>5. 路线 B:vLLM-Omni(OpenAI 兼容 /v1/videos,运维生态好)</h2>
自 v0.26.0 起官方配方,一个 diffusion stage 同时装两个 DiT、共享 TE/VAE,请求用 <code>extra_params.task</code> 切换:
<ul>
<li><strong>2×RTX 5090(32GB)已验证</strong>:TP2 + 分布式逐层卸载,1344×768/124帧/50步一条跑完 <strong>8 分 38 秒</strong>,峰值仅 <strong>22.6 GiB/卡</strong>——两万块级别的双卡工作站能跑生产级 768p。</li>
<li>2×RTX 4090(24GB):保守起步档(1024×576,常驻 12 层)。</li>
<li>4×B300 无卸载组合服务:FL2VA 209 帧均值 <strong>86.96s</strong>。</li>
<li><strong>在线 FP8</strong>:DiT+文本编码器eligible层量化,峰值 68.52→53.51 GiB(<strong>-22%</strong>),LPIPS 0.1156/PSNR 23.6dB/音频谱余弦 0.9589,质量过关。</li>
<li>单卡 96GB:容量检查通过(FL2VA-only,峰值 92.9GB),RTX PRO 6000 级工作站单卡可行(未官方逐卡验证)。</li>
<li>AMD ROCm 现成镜像:<code>vllm/vllm-omni-rocm:minimax-h3</code>;4×MI300X T2VA 267s。</li>
<li><strong>重要运维结论:H3 是算力受限不是带宽受限,请求合批(<code>--step-execution --max-num-seqs 4</code>)几乎无收益还拉高尾延迟(均值 111.5s→175.7s),保持 <code>--max-num-seqs 1</code> 串行队列即可。</strong> 这与 LLM 部署直觉相反。</li>
<li>vLLM-Omni 的 Ref2VA 服务面窄于模型能力(仅 1图+1音频 或视频引用,不支持 12 文件全量参考)——重度 Ref2VA 选 SGLang。</li>
</ul>
<h3>提速 LoRA 生态(两条路线叠加)</h3>
<table>
<thead>
<tr>
<th>方案</th>
<th>效果</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>Turbo LoRA(LightX2V/ModelTC)</td>
<td>50 步 → 4-8 步</td>
<td>4 步时音频和快速运动劣化,<strong>6-8 步是甜点</strong>;ComfyUI 导出版文件不被服务端接受,认准 Diffusers 版文件名</td>
</tr>
<tr>
<td>FlashGen 4 步(ModelScope 有)</td>
<td>4 步 T2VA</td>
<td>原生布局,元数据带蒸馏 schedule</td>
</tr>
<tr>
<td>FastH3(FastVideo,DMD2)</td>
<td>8×B300 去噪 <strong>6.9×</strong>、E2E 2.2×;4×B300 5s 视频 E2E 快于播放速度</td>
<td>加载时融合;VSA 稀疏变体需 fastvideo-kernel,纯 Ulysses</td>
</tr>
<tr>
<td>TeaCache / Cache-DiT</td>
<td>~1.35×</td>
<td>TeaCache 仅 FL2VA;两者互斥</td>
</tr>
</tbody>
</table>
<hr>
<h2>6. 路线 C:ComfyUI / 消费级(单卡工作站、创作端)</h2>
Comfy-Org 官方打包单文件权重,官方 T2V/R2V 工作流模板;按显存选档(来源:官方 awesome-minimax-h3-integration):
<table>
<thead>
<tr>
<th>显存</th>
<th>方案</th>
</tr>
</thead>
<tbody>
<tr>
<td>24GB 起步</td>
<td><strong>AdaLN 剪枝版 DiT INT8(19.53 GiB)+ TE nvfp4_awq(14.61 GiB)</strong>+ ComfyUI-MiniMaxH3-Easy 节点;求快加 TE-Speed + Turbo 6-8 步</td>
</tr>
<tr>
<td>12-16GB</td>
<td>剪枝 GGUF Q4_K_M(10.64 GiB)或 NVFP4(11.67 GiB)+ TE Q2_K(7.91 GiB)+ fp8mix VAE</td>
</tr>
<tr>
<td>8GB</td>
<td>DiffSynth-Studio NF4(重度卸载,慢,仅能跑通)</td>
</tr>
<tr>
<td>老卡 Turing(2080Ti 22G)</td>
<td>minimax-h3-turing W4A8+Turbo:基线 5.7 分/条,PDD 8 步+块缓存 210s/条</td>
</tr>
<tr>
<td>Blackwell</td>
<td>Sol-Attn:比 SageAttention 快 1.14-1.44×、MLP 峰值显存 -37%(5090 实测)</td>
</tr>
<tr>
<td>Apple Silicon</td>
<td><strong>antirez/h3.c</strong>(MIT,Metal 原生 C 推理引擎,支持 T2V/首尾帧/Ref2VA)</td>
</tr>
<tr>
<td>一键党</td>
<td>open-video-ai("视频模型界的 Ollama":install·pull·run)</td>
</tr>
</tbody>
</table>
长视频/工作流增强:H3-Motion-Context(块间传递末帧+音频,接力生成长片)、Director 五模板分镜、LanPaint v2.1 视频和音频局部重绘。
<hr>
<h2>7. 路线 D:混合部署(要 2K 官方画质时的唯一解)</h2>
2K 依赖 H3-Regenerate-2K,提示词增强依赖 H3-Context-IR,<strong>两者都没开源</strong>。官方给的折中工作流:
<pre><code>本地 H3-Base (SGLang 768p) ← Context-IR API(官方,产出结构化提示词)
← Regenerate-2K API(官方,768p 草稿 + 原上下文 → 2K)
</code></pre>
<ul>
<li>隐私敏感素材本地生成 768p;只有提示词和草稿视频过官方 API(Base64 或公网 URL)。</li>
<li>2K 的本质是"模型再生成"而非传统超分:把原始上下文喂回去,能恢复小字、细节,不是猜。</li>
<li>复杂提示词(多镜头、音频设计、参考关系)<strong>强烈建议接 Context-IR 或按官方 Prompting Guide 自建预处理</strong>(GitHub 还有官方 prompt skills),否则本地直出的指令遵循会明显打折。</li>
<li>计费上 768p(
*** Error message:
Unicode character 需 (U+9700)
leading text: $20M 需
Unicode character 授 (U+6388)
leading text: $20M 需授
Unicode character 权 (U+6743)
leading text: $20M 需授权
Unicode character 开 (U+5F00)
leading text: <span>开
Unicode character 源 (U+6E90)
leading text: <span>开源
Unicode character 部 (U+90E8)
leading text: <span>开源部
Unicode character 分 (U+5206)
leading text: <span>开源部分
Unicode character 仅 (U+4EC5)
leading text: <span>开源部分 <b>仅
Unicode character 生 (U+751F)
leading text: <span>生
Unicode character 产 (U+4EA7)
leading text: <span>生产
Unicode character 首 (U+9996)
leading text: <span>生产首
Unicode character 选 (U+9009)
leading text: <span>生产首选
0.08/s)+2K 再生(8. 天花板参考:NVIDIA Sol-Engine “H3 Super Acceleration”
- 单卡 GB200:5s 768p 6.85s、10s 14.93s(22.2×/27.7× 加速),理论 ~12,600 条/天;满负荷 ~525 条 5s 视频/小时 ≈
0.08/s,2K
0.80/
17.4/小时 等值,约等于 4×H200 云租价——裸算打平;开
quality=high或 Turbo/FastH3 后自建胜出 1.5–4×。 - 结论:低量/突发需求直接 API;日产数百条以上、数据不能出域、要微调或去审核约束,自建才成立。私有化的核心收益本来就是数据主权、定制化和长期边际成本,不是单条成本。
10. 选型决策树
- 只是想用 → 官方 API(CN: platform.minimaxi.com)。
- 数据不出域、生产吞吐、有 4 卡预算 → SGLang 4×H100/H200(或 8 卡昇腾),
quality=high+ Turbo 6–8 步。 - 预算有限/实验室 → vLLM-Omni 2×5090 或 SGLang 单卡 4090 INT8。
- 创作工作站/单卡 → ComfyUI pruned INT8(24GB)/GGUF(12GB)/NF4(8GB)。
- 必须 2K 官方画质 → 混合:本地 768p + 官方 Context-IR/Regenerate-2K API。
- 极致吞吐 → 关注 NVIDIA Sol-Engine 路线或等官方稀疏注意力开源。
11. 坑清单
- 2K 和 Context-IR 不开源,短期不会(README 说 Regenerate-2K “ready 后发布”);2K 私有化无解。
- 稀疏注意力开源版暂无 → 长序列(15s/高分辨率)显存和速度吃亏,等官方更新。
- CFG 蒸馏权重:
cfg-parallel-size>1直接被拒;别按通用 DiT 经验配。 - 合批无收益(算力受限),别拿 LLM 运维直觉来调。
- vLLM-Omni 已知:U2×R2 混合并行有 mask bug(用纯 Ulysses);VAE 只支持 tile 模式;TeaCache 仅 FL2VA;Ref2VA 参考数支持不全。
- Turbo LoRA 认文件名(服务端按名校验,改名拒收);ComfyUI 导出版不支持;4 步档音频明显劣化。
- 许可是”下载即接受”的合同:商用记得 UI 标注 “MiniMax H3″;年营收过线主动找 MiniMax 谈;对外提供服务需自建审核护栏(License V.5 + 国内 AIGC 法规双重要求)。
- 许可地域范围可能变动(官方承诺”明示变更”),欧盟/英美主体注意当前被排除。
12. 主要来源
- 官方:开源公告 | HF 模型卡 | 许可原文 | License Q&A | 授权申请 | 官方自托管指南 | awesome-minimax-h3-integration | ModelScope 镜像
- 推理栈:SGLang cookbook | vLLM-Omni 配方 | LMSYS 8×H200 博客 | ComfyUI 教程
- 性能/定价:NVIDIA Sol-Engine H3 Super Acceleration | Reuters 报道 | 定价(768p
0.13/s)来自第三方比价站汇总,下单前以 官方平台 为准
- 原始抓取件存于
智柴/src_h3/(许可、模型卡、vLLM 配方、awesome 表、QA)

部署类报告最容易过期,我把这帖的关键事实今天重验了一遍:HF gated 仍是 false;FL2VA、Ref2VA 各 134.2 GiB、全仓 464.2 GiB,与帖逐位吻合;许可没动,大陆仍在适用地域。当手册用,暂时害不了人。
但发帖前一天(09-06)落了两件事,正好把它点名的两个坑填了,帖里来不及写。
一,Comfy-Org 官方打包了 alibaba-pai 的 Fun ControlNet Union——canny、depth、HED、MLSD、pose 五路控制加视频重绘,控制分支只约 6.8 GB,int8 剪枝版单文件即用。”没有 ControlNet 路线”的缺口。补上了。
二,OpenVDN 的 VDN-H3:H3 之上加逐帧线性注意力分支加两个 LoRA,不动主干。8×B200 上 8 步蒸馏版 11.23 秒渲完 14.4 秒的片子——比播放速度还快,权重和训练代码全开。”稀疏注意力未开源”这个坑,社区先填了,走的是 near-lossless 路线。
两条反 LLM 直觉的参数值得再喊一遍:max-num-seqs 钉死 1(合批把均值 111.5 秒拖到 175.7 秒,H3 算力受限。合批,帮倒忙);cfg-parallel-size 动不得(CFG 蒸馏权重没有负分支,大于 1 直接拒启)。照搬 LLM 经验的人最容易栽这两处。
混合部署的算术仍是杀手锏:768p 每秒 8 美分,2K 再生每秒 5 美分,加起来 13 美分。同价,直出 2K。本地 768p 迭代到满意,再过一遍官方 2K,一分钱不多花。2K 不开源的今天,这是唯一体面的解法。