MiniMax H3 私有化部署方案

MiniMax H3 私有化部署方案 — 深度研究 :root { --text: #241b16; --bg...

MiniMax H3 私有化部署方案 — 深度研究 :root { –text: #241b16; –bg: #faf7f4; –accent: #ff6c37; –accent-deep: #d94f1e; –code-bg: #f4efe9; –border: #e7ddd2; –muted: #8a7a6d; –width: 820px; –card: #ffffff; } * { box-sizing: border-box; margin: 0; padding: 0; } html { scroll-behavior: smooth; } body { font-family: -apple-system, BlinkMacSystemFont, ‘Segoe UI’, ‘Noto Sans SC’, ‘Microsoft YaHei’, sans-serif; line-height: 1.8; color: var(–text); background: var(–bg); padding: 0 1rem 3rem; } article { max-width: var(–width); margin: 0 auto; } /* —- hero —- */ header.hero { margin: 0 -1rem 2rem; padding: 3rem 1.5rem 2.25rem; background: radial-gradient(1100px 420px at 85% -10%, rgba(255,108,55,.32), transparent 60%), radial-gradient(700px 380px at -5% 110%, rgba(255,108,55,.14), transparent 55%), #1d1208; color: #fdf6ee; border-radius: 0 0 22px 22px; } .hero .kicker { display: inline-block; font-size: .78rem; letter-spacing: .18em; color: #ffc9ab; border: 1px solid rgba(255,201,171,.45); border-radius: 999px; padding: .18rem .8rem; margin-bottom: 1rem; } .hero h1 { font-size: 2.1rem; line-height: 1.3; letter-spacing: .01em; margin-bottom: .9rem; } .hero h1 .hl { color: #ff8a54; } .hero .meta { color: #d9c4b4; font-size: .9rem; } .hero .badges { margin-top: 1.1rem; display: flex; flex-wrap: wrap; gap: .5rem; } .hero .badge { font-size: .8rem; padding: .28rem .75rem; border-radius: 999px; background: rgba(255,255,255,.08); border: 1px solid rgba(255,255,255,.16); color: #f3e3d5; } .hero .badge b { color: #ffb98f; font-weight: 600; } /* —- toc —- */ nav.toc { background: var(–card); border: 1px solid var(–border); padding: 1.1rem 1.4rem; border-radius: 14px; margin-bottom: 2.25rem; box-shadow: 0 1px 3px rgba(60,30,10,.05); } nav.toc h2 { margin-top: 0; font-size: 1rem; color: var(–muted); letter-spacing: .12em; } nav.toc ol { list-style: none; padding-left: 0; columns: 2; column-gap: 2rem; } nav.toc li { break-inside: avoid; margin: .3rem 0; } nav.toc a { border-bottom: none; color: var(–text); font-size: .92rem; } nav.toc a:hover { color: var(–accent-deep); } /* —- content —- */ h1 { font-size: 1.9rem; margin: 2.2rem 0 1rem; } h2 { font-size: 1.42rem; margin: 2.4rem 0 .9rem; padding-bottom: .45rem; border-bottom: 2px solid var(–accent); position: relative; } h3 { font-size: 1.15rem; margin: 1.5rem 0 .6rem; color: var(–accent-deep); } p { margin: .8rem 0; } a { color: var(–accent-deep); text-decoration: none; border-bottom: 1px solid rgba(217,79,30,.3); overflow-wrap: anywhere; } a:hover { border-bottom-color: var(–accent-deep); } code { background: var(–code-bg); padding: .14em .42em; border-radius: 5px; font-size: .88em; color: #a03a12; overflow-wrap: anywhere; } pre { background: #221710; color: #f0e4d8; padding: 1.05rem 1.2rem; border-radius: 12px; overflow-x: auto; margin: 1.1rem 0; font-size: .88rem; line-height: 1.6; } pre code { background: none; padding: 0; color: inherit; } table { width: 100%; border-collapse: separate; border-spacing: 0; margin: 1.2rem 0; font-size: .93rem; background: var(–card); border: 1px solid var(–border); border-radius: 10px; overflow: hidden; } th, td { padding: .55rem .8rem; border-bottom: 1px solid var(–border); text-align: left; vertical-align: top; } thead th { background: linear-gradient(180deg, #fdf0e6, #fbe7d7); font-weight: 600; color: #7c3210; font-size: .9rem; border-bottom: 2px solid #f3cdb2; } tbody tr:last-child td { border-bottom: none; } tbody tr:nth-child(even) { background: #fbf6f0; } blockquote { border-left: 4px solid var(–accent); margin: 1.1rem 0; padding: .6rem 1.1rem; background: #fdeee3; color: #6b4a33; border-radius: 0 10px 10px 0; } blockquote p { margin: .3rem 0; } hr { border: none; height: 1px; background: var(–border); margin: 2.2rem 0; } ul, ol { margin: .6rem 0 .6rem 1.6rem; } li { margin: .3rem 0; } li::marker { color: var(–accent); font-weight: 600; } strong { color: #7c2d0d; } footer { margin-top: 3rem; padding-top: 1.1rem; border-top: 1px solid var(–border); text-align: center; color: var(–muted); font-size: .85rem; } @media (max-width: 800px) { body { padding: 0 .6rem 2rem; } .hero h1 { font-size: 1.5rem; } nav.toc ol { columns: 1; } table { font-size: .84rem; display: block; overflow-x: auto; } } @media print { body { background: white; padding: 0; } header.hero { background: #1d1208 !important; -webkit-print-color-adjust: exact; print-color-adjust: exact; } pre { background: #f5f0ea !important; color: #333; } nav.toc { break-after: page; } table { break-inside: avoid; } } DEEP RESEARCH · 智柴

MiniMax H3 私有化部署方案

深度研究笔记 · 2026-09-07 · 全部关键事实经一手来源核对(许可原文 / HF 模型卡 / SGLang 与 vLLM 官方配方)

开源 2026-07-31 许可 中国大陆可用(排除 EU/UK/韩/美) 商用门槛 年营收 >
*** QuickLaTeX cannot compile formula:
20M 需授权</b></span>
    <span>开源部分 <b>仅 H3-Base 768p</b></span>
    <span>生产首选 <b>SGLang</b></span>
  </div>



  <h2>目录</h2>
  <ol></ol>


<div>
<h1>MiniMax H3 私有化部署方案 — 深度研究</h1>
日期:2026-09-07 | 全部关键事实来自一手来源(许可原文、HF 模型卡、SGLang/vLLM 官方配方,均已抓取原文核对)
<hr>
<h2>0. 一句话结论</h2>
<strong>MiniMax H3 不是文本大模型,而是开源的"视频+原生立体声"生成模型</strong>(2026-07-31 开源)。开源的只有 H3-Base(768p 主干),2K 超分和复杂提示词理解两个模块仍只有官方 API。私有化部署在中国大陆<strong>许可上完全可行</strong>(社区许可排除的只有 EU/UK/韩/美),商用门槛是年营收 >2000 万美元才需书面授权。生产部署首选 SGLang(4×H100/H200 或 8 卡昇腾 NPU 均有官方验证配方),单卡/工作站走 ComfyUI 量化生态(24GB 卡即可起步,12GB 是地板),要 2K 官方画质只能"本地 768p + 官方 API 混合"。
<hr>
<h2>1. H3 是什么:先把对象搞清楚</h2>
<table>
<thead>
<tr>
<th>维度</th>
<th>事实</th>
</tr>
</thead>
<tbody>
<tr>
<td>定位</td>
<td>通用全模态<strong>生成</strong>系统:统一理解文本/图像/视频/音频上下文,生成<strong>带原生立体声的视频</strong></td>
</tr>
<tr>
<td>官宣开源</td>
<td>2026-07-31(Reuters 报道);许可证落款 2026-08-02</td>
</tr>
<tr>
<td>输出规格</td>
<td>4-15 秒、24 FPS、32kHz 立体声、宽高比 21:9~9:16、短边默认 768px(画布 32 的倍数)</td>
</tr>
<tr>
<td>提示词语言</td>
<td>11 种稳定支持(含中英)</td>
</tr>
<tr>
<td>两个开源 checkpoint</td>
<td><strong>FL2VA</strong>(文生视频+首/尾帧控制)、<strong>Ref2VA</strong>(全参考:\le9 图 + \le3 视频 + \le3 音频,共 \le12 文件,纯音频被拒)</td>
</tr>
<tr>
<td>开源边界</td>
<td><strong>只有 H3-Base(768p 生成主干)开源</strong>。H3-Context-IR(多模态提示词理解/改写)和 H3-Regenerate-2K(768p→2K 再生成)<strong>均未开源</strong>,只有官方 API</td>
</tr>
<tr>
<td>精度</td>
<td>BF16,且是 <strong>CFG 蒸馏</strong>后的权重(部署时 <code>cfg-parallel-size</code> 必须为 1,没有负分支)</td>
</tr>
</tbody>
</table>
<h3>架构(决定硬件需求的三件事)</h3>
<ol>
<li><strong>H3-Omni-Transformer</strong>:33B dense 单流 Transformer,50 个 block;其中 <strong>~13B 参数在 AdaLN 分支里</strong>——推理时这部分可预计算/跳过(社区 "pruned" 量化版就是砍这个,体积小 ~40%)。视频+音频各一份 52-block DiT,单份 61.73 GiB (BF16)。</li>
<li><strong>H3-Encoder = Qwen3-VL-32B</strong>(取前 50 层隐状态),约 46-51.5 GB BF16,<strong>Apache 2.0</strong> 无附加限制。</li>
<li><strong>双 VAE</strong>:VisualVAE(f16t4d24,patch 后等效 32× 空间/4× 时间压缩,含 ViT 解码器,约 10GB 级)+ AudioVAE(32kHz→40Hz 潜变量,左右声道独立编解码)。</li>
</ol>
训练时用了原生稀疏注意力,但<strong>开源首发只有全注意力推理</strong>,稀疏实现"未来更新"。
<blockquote>
由此总账:一套 FL2VA 分区 ~134 GiB BF16 权重(DiT+编码器+双 VAE),两个任务分区全下 ~270 GiB;HF 官方仓库全量 464.2 GiB(含 diffusers 格式重复份)。存储预算按 \ge 500GB NVMe 规划。
</blockquote>
<hr>
<h2>2. 许可与合规(私有化前必须过的一关)</h2>
来源:许可原文 + 官方 License Q&A(均已核对原文,媒体报道与原文有出入,以本节为准)。
<ul>
<li><strong>许可类型</strong>:MiniMax H3 Community License Agreement(v2026-08-02),授予方为 MiniMax 新加坡主体 <strong>Nanonoble Pte. Ltd.</strong>,管辖法域<strong>香港</strong>。下载/使用即视为接受。</li>
<li><strong>适用地域 = 全球,排除四处:欧盟、英国、韩国、美国</strong>。官方 Q&A 明确这是监管原因(EU AI Act、美方视频生成版权诉讼等),"not yet, not ever";被排除地区可走 <a>申请表</a> 单独拿授权。<strong>中国大陆属于适用地域,社区许可直接覆盖。</strong></li>
<li><strong>商用门槛</strong>:使用 H3 的商业产品/服务<strong>年营收 > 2000 万美元</strong>需事先书面授权(api@minimax.io,主题 "MiniMax H3 licensing - authorization request");低于门槛自由商用。</li>
<li><strong>商用硬义务</strong>:在产品 UI 上<strong>显著标注 "MiniMax H3"</strong>(许可第 IV.2 条,强制);分发需附协议副本和 NOTICE 文件;鼓励 "Powered by MiniMax H3" 和给生成文件加 AI 标识。</li>
<li><strong>使用限制</strong>:不得用 H3 或其输出改进其他 AI 模型;不得军事用途;对外提供服务需自建与 AUP 等强的安全护栏 + 违规举报机制(<strong>本地部署后内容审核责任在自己</strong>,这点对国内企业还叠加《生成式 AI 服务管理暂行办法》/深度合成标识义务)。</li>
<li><strong>编码器豁免</strong>:Qwen3-VL-32B 部分是 Apache 2.0,不受上述约束。</li>
<li><strong>下载渠道</strong>:HF 仓库当前<strong>未设门禁</strong>(2026-09-07 实测 <code>gated:false</code>,匿名可下;vLLM 配方里"需申请访问"的说法已过时);国内走 ModelScope 官方镜像 <code>MiniMax/MiniMax-H3</code>(SGLang 支持 <code>SGLANG_USE_MODELSCOPE=true</code> 直拉)。</li>
</ul>
<hr>
<h2>3. 硬件门槛总账</h2>
<table>
<thead>
<tr>
<th>资源</th>
<th>最低</th>
<th>生产推荐</th>
</tr>
</thead>
<tbody>
<tr>
<td>存储</td>
<td>FL2VA 单分区 ~135 GiB</td>
<td>全仓库 500+ GiB NVMe(权重随机读取,HDD 会拖垮流式加载)</td>
</tr>
<tr>
<td>显存(数据中心)</td>
<td>4×80GB(H100,TP2+Ulysses2,峰值 ~57GB/卡)</td>
<td>4×141GB H200(Ulysses4)或 8×B300 FP8</td>
</tr>
<tr>
<td>显存(单卡)</td>
<td>12GB VRAM + 32GB 内存 + NVMe(SGLang 极简路径,流式)</td>
<td>单卡 96GB 可容纳 FL2VA 分区不卸载(容量检查通过)</td>
</tr>
<tr>
<td>显存(消费级 ComfyUI)</td>
<td>8GB(DiffSynth NF4 重卸载,很慢)</td>
<td>24GB(pruned INT8 19.5GB + TE 量化 14.6GB)</td>
</tr>
<tr>
<td>主机内存</td>
<td>32GB(极简流式路径)</td>
<td>双卡 recipe 需 \ge 200GB,<strong>推荐 384GB</strong>;RTX 2080Ti 22G 老卡也有 W4A8 方案</td>
</tr>
<tr>
<td>特殊平台</td>
<td>Turing sm_75、Apple Silicon(h3.c Metal 原生)、AMD MI300X/MI355X、<strong>华为昇腾 NPU</strong> 均有可跑方案</td>
<td></td>
</tr>
</tbody>
</table>
<strong>H20(96GB)</strong>:未找到任何官方验证配方。按"单卡 96GB 容量检查通过(B300 代理峰值 92.9GB)"推断 FL2VA 分区 BF16 大概率装得下,但 H20 算力弱、去噪是算力受限任务,速度会很差——能买验证过的卡就别赌。
<hr>
<h2>4. 路线 A:SGLang(生产首选,配方最全)</h2>
SGLang Diffusion 有 H3 原生 pipeline,<code>sglang serve</code> 一条命令起服务,官方 cookbook 每条配方都在真机验证过:
<pre><code>sglang serve --model-path MiniMaxAI/MiniMax-H3 
  --num-gpus 4 --ulysses-degree 4 --performance-mode speed 
  --host 0.0.0.0 --port 30010 --model-variant fl2va   # Ref2VA 换 --model-variant ref2va
</code></pre>
<table>
<thead>
<tr>
<th>硬件</th>
<th>配方</th>
<th>实测</th>
</tr>
</thead>
<tbody>
<tr>
<td>4×H100 80GB</td>
<td>TP2+Ulysses2(最快的无损配方)</td>
<td>峰值 ~57GB/卡(比替代拓扑低 30GB)</td>
</tr>
<tr>
<td>4×H200 141GB</td>
<td>Ulysses4 最快;TP2+U2 峰值最低(~64GB)</td>
<td>1344×768/124帧/50步:lossless 中位 <strong>85.5s</strong>;<code>quality=high</code>(Cache-DiT)<strong>63.4s</strong>(1.35×,SSIM 0.9709)</td>
</tr>
<tr>
<td>8×H200</td>
<td>LMSYS 08-27 加速优化</td>
<td>无损 <strong>1.95×</strong>,允许质量损失最高 <strong>6.24×</strong>(SSIM 0.76-0.91)</td>
</tr>
<tr>
<td>B200/B300</td>
<td>在线 FP8 量化(权重盘上仍 BF16,运行时转换)</td>
<td>8×B300 峰值 ~52GB/卡</td>
</tr>
<tr>
<td>2×RTX 5090 32GB</td>
<td>TP2+逐层卸载</td>
<td>峰值 26.3GiB/卡;50 步 5s 768p 全程 559.7s</td>
</tr>
<tr>
<td>单卡 RTX 4090 24GB</td>
<td><code>kitchen_int8</code></td>
<td>峰值 ~18GB;1011×576/4s/50步 130.7s</td>
</tr>
<tr>
<td>AMD MI300X/MI355X</td>
<td>ROCm+AITER,day-0</td>
<td>官方验证</td>
</tr>
<tr>
<td><strong>华为昇腾 NPU</strong></td>
<td>8 卡 TP2+SP4 + Laser Attention + Cache-DiT(另有 4 卡 TP2+SP2)</td>
<td>8 卡比 4 卡 E2E 延迟低 <strong>46.8%</strong>——<strong>国产化路线已验证</strong></td>
</tr>
</tbody>
</table>
关键工程结论(官方审计数据):
- <code>quality=high</code>(Cache-DiT):SSIM 0.931 / PSNR 28.16dB,批量生产场景的性价比开关。
- <strong>AdaLN 预计算缓存</strong>:把 13B AdaLN 分支预计算缓存,推理省显存省算力(固定采样计划下无损)。
- 跨节点:2×8 H200,Ulysses8×Ring2,V2V 去噪 128.6s → 68.2s(<strong>-47%</strong>)。
- V2V(视频改写)是 ref2va 的用例,同一个服务覆盖。
- 同硬件下 SGLang 快于 ComfyUI 前端方案。
<hr>
<h2>5. 路线 B:vLLM-Omni(OpenAI 兼容 /v1/videos,运维生态好)</h2>
自 v0.26.0 起官方配方,一个 diffusion stage 同时装两个 DiT、共享 TE/VAE,请求用 <code>extra_params.task</code> 切换:
<ul>
<li><strong>2×RTX 5090(32GB)已验证</strong>:TP2 + 分布式逐层卸载,1344×768/124帧/50步一条跑完 <strong>8 分 38 秒</strong>,峰值仅 <strong>22.6 GiB/卡</strong>——两万块级别的双卡工作站能跑生产级 768p。</li>
<li>2×RTX 4090(24GB):保守起步档(1024×576,常驻 12 层)。</li>
<li>4×B300 无卸载组合服务:FL2VA 209 帧均值 <strong>86.96s</strong>。</li>
<li><strong>在线 FP8</strong>:DiT+文本编码器eligible层量化,峰值 68.52→53.51 GiB(<strong>-22%</strong>),LPIPS 0.1156/PSNR 23.6dB/音频谱余弦 0.9589,质量过关。</li>
<li>单卡 96GB:容量检查通过(FL2VA-only,峰值 92.9GB),RTX PRO 6000 级工作站单卡可行(未官方逐卡验证)。</li>
<li>AMD ROCm 现成镜像:<code>vllm/vllm-omni-rocm:minimax-h3</code>;4×MI300X T2VA 267s。</li>
<li><strong>重要运维结论:H3 是算力受限不是带宽受限,请求合批(<code>--step-execution --max-num-seqs 4</code>)几乎无收益还拉高尾延迟(均值 111.5s→175.7s),保持 <code>--max-num-seqs 1</code> 串行队列即可。</strong> 这与 LLM 部署直觉相反。</li>
<li>vLLM-Omni 的 Ref2VA 服务面窄于模型能力(仅 1图+1音频 或视频引用,不支持 12 文件全量参考)——重度 Ref2VA 选 SGLang。</li>
</ul>
<h3>提速 LoRA 生态(两条路线叠加)</h3>
<table>
<thead>
<tr>
<th>方案</th>
<th>效果</th>
<th>说明</th>
</tr>
</thead>
<tbody>
<tr>
<td>Turbo LoRA(LightX2V/ModelTC)</td>
<td>50 步 → 4-8 步</td>
<td>4 步时音频和快速运动劣化,<strong>6-8 步是甜点</strong>;ComfyUI 导出版文件不被服务端接受,认准 Diffusers 版文件名</td>
</tr>
<tr>
<td>FlashGen 4 步(ModelScope 有)</td>
<td>4 步 T2VA</td>
<td>原生布局,元数据带蒸馏 schedule</td>
</tr>
<tr>
<td>FastH3(FastVideo,DMD2)</td>
<td>8×B300 去噪 <strong>6.9×</strong>、E2E 2.2×;4×B300 5s 视频 E2E 快于播放速度</td>
<td>加载时融合;VSA 稀疏变体需 fastvideo-kernel,纯 Ulysses</td>
</tr>
<tr>
<td>TeaCache / Cache-DiT</td>
<td>~1.35×</td>
<td>TeaCache 仅 FL2VA;两者互斥</td>
</tr>
</tbody>
</table>
<hr>
<h2>6. 路线 C:ComfyUI / 消费级(单卡工作站、创作端)</h2>
Comfy-Org 官方打包单文件权重,官方 T2V/R2V 工作流模板;按显存选档(来源:官方 awesome-minimax-h3-integration):
<table>
<thead>
<tr>
<th>显存</th>
<th>方案</th>
</tr>
</thead>
<tbody>
<tr>
<td>24GB 起步</td>
<td><strong>AdaLN 剪枝版 DiT INT8(19.53 GiB)+ TE nvfp4_awq(14.61 GiB)</strong>+ ComfyUI-MiniMaxH3-Easy 节点;求快加 TE-Speed + Turbo 6-8 步</td>
</tr>
<tr>
<td>12-16GB</td>
<td>剪枝 GGUF Q4_K_M(10.64 GiB)或 NVFP4(11.67 GiB)+ TE Q2_K(7.91 GiB)+ fp8mix VAE</td>
</tr>
<tr>
<td>8GB</td>
<td>DiffSynth-Studio NF4(重度卸载,慢,仅能跑通)</td>
</tr>
<tr>
<td>老卡 Turing(2080Ti 22G)</td>
<td>minimax-h3-turing W4A8+Turbo:基线 5.7 分/条,PDD 8 步+块缓存 210s/条</td>
</tr>
<tr>
<td>Blackwell</td>
<td>Sol-Attn:比 SageAttention 快 1.14-1.44×、MLP 峰值显存 -37%(5090 实测)</td>
</tr>
<tr>
<td>Apple Silicon</td>
<td><strong>antirez/h3.c</strong>(MIT,Metal 原生 C 推理引擎,支持 T2V/首尾帧/Ref2VA)</td>
</tr>
<tr>
<td>一键党</td>
<td>open-video-ai("视频模型界的 Ollama":install·pull·run)</td>
</tr>
</tbody>
</table>
长视频/工作流增强:H3-Motion-Context(块间传递末帧+音频,接力生成长片)、Director 五模板分镜、LanPaint v2.1 视频和音频局部重绘。
<hr>
<h2>7. 路线 D:混合部署(要 2K 官方画质时的唯一解)</h2>
2K 依赖 H3-Regenerate-2K,提示词增强依赖 H3-Context-IR,<strong>两者都没开源</strong>。官方给的折中工作流:
<pre><code>本地 H3-Base (SGLang 768p) ← Context-IR API(官方,产出结构化提示词)
                            ← Regenerate-2K API(官方,768p 草稿 + 原上下文 → 2K)
</code></pre>
<ul>
<li>隐私敏感素材本地生成 768p;只有提示词和草稿视频过官方 API(Base64 或公网 URL)。</li>
<li>2K 的本质是"模型再生成"而非传统超分:把原始上下文喂回去,能恢复小字、细节,不是猜。</li>
<li>复杂提示词(多镜头、音频设计、参考关系)<strong>强烈建议接 Context-IR 或按官方 Prompting Guide 自建预处理</strong>(GitHub 还有官方 prompt skills),否则本地直出的指令遵循会明显打折。</li>
<li>计费上 768p(

*** Error message:
Unicode character 需 (U+9700)
leading text: $20M 需
Unicode character 授 (U+6388)
leading text: $20M 需授
Unicode character 权 (U+6743)
leading text: $20M 需授权
Unicode character 开 (U+5F00)
leading text:     <span>开
Unicode character 源 (U+6E90)
leading text:     <span>开源
Unicode character 部 (U+90E8)
leading text:     <span>开源部
Unicode character 分 (U+5206)
leading text:     <span>开源部分
Unicode character 仅 (U+4EC5)
leading text:     <span>开源部分 <b>仅
Unicode character 生 (U+751F)
leading text:     <span>生
Unicode character 产 (U+4EA7)
leading text:     <span>生产
Unicode character 首 (U+9996)
leading text:     <span>生产首
Unicode character 选 (U+9009)
leading text:     <span>生产首选

0.08/s)+2K 再生(0.05/s) =0.13/s,与直接 2K 同价——先 768p 迭代再一次性 2K 不多花钱。

8. 天花板参考:NVIDIA Sol-Engine “H3 Super Acceleration”

  • 单卡 GB200:5s 768p 6.85s、10s 14.93s(22.2×/27.7× 加速),理论 ~12,600 条/天;满负荷 ~525 条 5s 视频/小时 ≈ 210/小时等值产出。</li> <li>前作 Sol-Engine:8×GB200 E2E 3.95× 近无损。</li> <li>这类是 NVIDIA 深度内核工程(Sol-Attn/SAGE/Skip-Softmax 同族),普通企业短期够不着,但说明 H3 推理成本仍在快速下降通道。</li> </ul> <hr> <h2>9. 自建 vs API 账(粗算)</h2> 官方 API:768p <strong>0.08/s,2K 0.13/s</strong>(10s 视频0.80/1.30)。 <ul> <li>4×H200 + SGLang lossless:85.5s 出 5.2s 成品 → 每卡时约产出 ~55s 成品视频 ≈ <strong>17.4/小时 等值,约等于 4×H200 云租价——裸算打平;开 quality=high 或 Turbo/FastH3 后自建胜出 1.5–4×。
  • 结论:低量/突发需求直接 API;日产数百条以上、数据不能出域、要微调或去审核约束,自建才成立。私有化的核心收益本来就是数据主权、定制化和长期边际成本,不是单条成本。

10. 选型决策树

  1. 只是想用 → 官方 API(CN: platform.minimaxi.com)。
  2. 数据不出域、生产吞吐、有 4 卡预算 → SGLang 4×H100/H200(或 8 卡昇腾)quality=high + Turbo 6–8 步。
  3. 预算有限/实验室 → vLLM-Omni 2×5090 或 SGLang 单卡 4090 INT8。
  4. 创作工作站/单卡 → ComfyUI pruned INT8(24GB)/GGUF(12GB)/NF4(8GB)。
  5. 必须 2K 官方画质 → 混合:本地 768p + 官方 Context-IR/Regenerate-2K API。
  6. 极致吞吐 → 关注 NVIDIA Sol-Engine 路线或等官方稀疏注意力开源。

11. 坑清单

  • 2K 和 Context-IR 不开源,短期不会(README 说 Regenerate-2K “ready 后发布”);2K 私有化无解。
  • 稀疏注意力开源版暂无 → 长序列(15s/高分辨率)显存和速度吃亏,等官方更新。
  • CFG 蒸馏权重:cfg-parallel-size>1 直接被拒;别按通用 DiT 经验配。
  • 合批无收益(算力受限),别拿 LLM 运维直觉来调。
  • vLLM-Omni 已知:U2×R2 混合并行有 mask bug(用纯 Ulysses);VAE 只支持 tile 模式;TeaCache 仅 FL2VA;Ref2VA 参考数支持不全。
  • Turbo LoRA 认文件名(服务端按名校验,改名拒收);ComfyUI 导出版不支持;4 步档音频明显劣化。
  • 许可是”下载即接受”的合同:商用记得 UI 标注 “MiniMax H3″;年营收过线主动找 MiniMax 谈;对外提供服务需自建审核护栏(License V.5 + 国内 AIGC 法规双重要求)。
  • 许可地域范围可能变动(官方承诺”明示变更”),欧盟/英美主体注意当前被排除。

12. 主要来源

生成时间: 2026-09-07 21:37 · 源文件 SHA256: 9ccdb97100a67678 · 由 markdown 渲染为独立 HTML (function () { var toc = document.getElementById(‘toc’); var headings = document.querySelectorAll(‘#content h2, #content h3’); headings.forEach(function (h, i) { var id = ‘sec-‘ + i; h.id = id; var li = document.createElement(‘li’); if (h.tagName === ‘H3’) li.style.paddingLeft = ‘1.2rem’; var a = document.createElement(‘a’); a.href = ‘#’ + id; a.textContent = h.textContent; li.appendChild(a); toc.appendChild(li); }); })();

一条评论

  1. 部署类报告最容易过期,我把这帖的关键事实今天重验了一遍:HF gated 仍是 false;FL2VA、Ref2VA 各 134.2 GiB、全仓 464.2 GiB,与帖逐位吻合;许可没动,大陆仍在适用地域。当手册用,暂时害不了人。

    但发帖前一天(09-06)落了两件事,正好把它点名的两个坑填了,帖里来不及写。

    一,Comfy-Org 官方打包了 alibaba-pai 的 Fun ControlNet Union——canny、depth、HED、MLSD、pose 五路控制加视频重绘,控制分支只约 6.8 GB,int8 剪枝版单文件即用。”没有 ControlNet 路线”的缺口。补上了。

    二,OpenVDN 的 VDN-H3:H3 之上加逐帧线性注意力分支加两个 LoRA,不动主干。8×B200 上 8 步蒸馏版 11.23 秒渲完 14.4 秒的片子——比播放速度还快,权重和训练代码全开。”稀疏注意力未开源”这个坑,社区先填了,走的是 near-lossless 路线。

    两条反 LLM 直觉的参数值得再喊一遍:max-num-seqs 钉死 1(合批把均值 111.5 秒拖到 175.7 秒,H3 算力受限。合批,帮倒忙);cfg-parallel-size 动不得(CFG 蒸馏权重没有负分支,大于 1 直接拒启)。照搬 LLM 经验的人最容易栽这两处。

    混合部署的算术仍是杀手锏:768p 每秒 8 美分,2K 再生每秒 5 美分,加起来 13 美分。同价,直出 2K。本地 768p 迭代到满意,再过一遍官方 2K,一分钱不多花。2K 不开源的今天,这是唯一体面的解法。

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1