Bencom MKT 2026-08-07 09:54:26
8月3日,MiniMax正式开源新一代全模态生成模型H3。文本、图像、视频、音频统一理解,输出最高2K分辨率、最长15秒、原生立体声视频。权重已上传Hugging Face,开源当天即支持SGLang、vLLM、diffusers、ComfyUI部署,昇腾、AMD、NVIDIA等芯片同步完成Day 0适配。

这条新闻对企业的真正意义不在模型本身,而在一个选择:当开源多模态生成模型的能力已经够用,企业要不要把它搬进自己的机房。
本文要点
模型侧:H3是通用全模态生成系统,支持2K分辨率直出、最长15秒音画内容、原生立体声;开源当天即支持SGLang、vLLM、diffusers、ComfyUI多框架部署,昇腾/AMD/NVIDIA同步完成Day 0适配。
成本侧:云端API按条计费,一条15秒2K视频约10-12元,日均150次交互年支出超62万;本地部署一次性投入50-80万,之后边际成本只剩电费,两三年内回本。
硬件侧:浪潮元脑NF5468M7(4U 8卡GPU服务器)搭配8张RTX 6000D(单卡84GB GDDR7 ECC,8卡总显存672GB),大VRAM+多卡并行,满足多模型驻留与高并发推理。
服务侧:商红科技作为浪潮信息授权分销商,提供从售前架构设计到部署交付再到7×24售后的一站式交钥匙服务。
H3和之前特化任务型的视频生成模型不同,它被定位为"通用全模态智能"——在多模态上下文中统一理解创作意图,完成更自然、连贯的生成与表达。这意味着一个模型就能覆盖文本、图像、视频、音频多种输出,企业不需要为每种内容类型分别采购和部署不同的模型。
更关键的是开源生态的同步就绪。H3权重上传Hugging Face的同时,SGLang、vLLM、diffusers、ComfyUI四个主流推理框架已经在开源当天完成适配,昇腾、AMD、NVIDIA三类芯片同步完成Day 0支持。换句话说,模型和数据不用绑在云厂商手里——企业拿到权重,在自己的硬件上就能跑。
这是过去很多企业想做本地部署却不敢做的原因:模型一发布,硬件适配常常滞后数周甚至数月,等适配做完,模型已经迭代了。H3这次把模型开源和框架适配几乎做到了同步,本地部署的技术门槛被实质性拉低。
视频生成吃显存,也吃预算。许多企业的日常场景是:每周几十条短视频、产品演示、培训课件,AI漫剧公司的制作量就更大了。
云端API的计费模式是按条付费,量越大越贵。以H3生成一条15秒2K视频为例,云端API单条约10-12元;如果日均150次交互,一年就要开支62万以上。这还不包括高峰期排队等待、接口限流对业务节奏的影响。
本地部署的逻辑完全不同。一次性投入50-80万购买硬件,之后随便用——边际成本只剩电费。涉及未发布产品、客户资料的素材全程内网隔离,对很多企业这是刚需,不是加分项。
| 维度 | 云端API | 本地部署 |
|---|---|---|
| 计费方式 | 按条付费,量越大越贵 | 一次性投入,之后边际成本仅电费 |
| 15秒2K视频单条成本 | 约10-12元 | 固定成本摊薄,趋近于零 |
| 日均150次年支出 | 约62万+ | 一次性50-80万,两三年回本 |
| 数据安全 | 素材出域,合规风险不可控 | 全程内网隔离,数据自主 |
| 模型定制 | 无法微调,规则平台统一定义 | 可用私有数据微调,审查标准可定制 |
| 扩容方式 | 按量加费,线性增长 | 按阶段加卡,硬件资产可复用 |
一次性50-80万听着肉疼?对照云端30-80万/年的持续支出,两三年甚至一年就回本,之后全是净省。更关键的是,本地部署后企业可以用私有数据微调模型,形成自己的内容生产能力——这是云端API给不了的差异化。
视频生成对硬件的要求可以浓缩成一句话:大VRAM加多卡并行。模型权重加载、KV Cache占用、高并发推理,每一项都在吃显存。方案核心就是在这个基础上把配置拉满。
NF5468M7是浪潮元脑系列的4U机架式AI服务器,专为多卡GPU并行设计。核心配置如下:
| 维度 | NF5468M7规格 | 对AI视频生成的意义 |
|---|---|---|
| 机型 | 4U机架式 | 标准机柜部署,不挑机房 |
| GPU槽位 | 8个全高全长双宽GPU槽位 | 一台机器插满8卡,满足多模型驻留与高并发推理 |
| GPU互联 | GPU与CPU直连,延迟更低 | 视频生成推理时跨卡通信频繁,低延迟直接提升生成效率 |
| 处理器 | 双路Intel Xeon Gold 6530 | 数据预处理、推理调度由双路CPU承接,不拖GPU后腿 |
| 内存 | 768GB DDR5 | 大参数多模态模型加载与KV Cache占用,内存是基本盘 |
| 系统盘 | 2×960GB SSD | 操作系统与推理框架镜像,双盘冗余 |
| 数据盘 | 2×3.84TB SSD | 模型权重和成片全程本地存储,不依赖外挂NAS |
| 电源 | 4×3000W,2+2冗余 | 满载跑8卡时供电冗余是底线,一路故障另一路接管 |
显卡选择8张RTX 6000D。这台配置的关键参数:
| 维度 | RTX 6000D规格(单卡) | 8卡总规格 |
|---|---|---|
| 显存 | 84GB GDDR7 ECC | 672GB总显存 |
| 显存位宽 | 448-bit | — |
| CUDA核心 | 19968个 | 8卡合计约16万CUDA核心 |
| 优势 | 大显存+高带宽,多模型同时驻留 | 高并发推理不带喘的 |
8卡总显存672GB意味着什么?几个模型同时驻留、高并发推理都不带喘的。工作链路不复杂:加载模型权重到显存 → 推理生成 → 成片存入本地数据盘。全程数据不出机器,不经过任何第三方。

不是所有企业都需要本地部署,但以下几类场景值得认真评估:
内容与营销团队:每周稳定产出几十条短视频、产品演示、培训课件,云端API按条计费的成本已经开始肉疼。本地部署后边际成本只剩电费,还能用私有数据微调出专属的内容风格。
AI漫剧与视频制作公司:制作量远超普通企业,云端API的年支出可能已经超过一台8卡服务器的价格。数据安全同样是刚需——未发布的剧情素材、角色设计全程内网隔离。
政企与信创场景:涉及客户资料、未发布产品信息的素材不能出域,本地部署是合规底线而非加分项。NF5468M7的国产服务器身份也契合信创采购要求。
判断标准很简单:如果云端API的年支出已经接近或超过50万,或者数据合规要求不允许素材出域,现在就是评估本地部署的时机。
模型开源、硬件方案明确了,企业真正要面对的下一个问题是:谁来把服务器、显卡、推理框架、模型权重一次性调通,谁来对生产负载负责。
商红科技是浪潮信息授权的亿元级钻石分销商,团队规模近400人,服务过30000+企事业单位。作为浪潮、VMware、深信服、华为、联想、阿里云等厂家的高级合作伙伴,商红科技的角色不只是供硬件,而是提供从售前架构设计到部署交付再到7×24售后的真正一站式交钥匙服务。
| 服务阶段 | 商红科技提供的能力 | 对企业的价值 |
|---|---|---|
| 售前 | 需求调研、架构设计、方案制定 | 不盲目采购,先搞清楚需要多少算力 |
| 售中 | 硬件部署、框架调通、模型加载、POC验证 | 拿到手的是能跑的整机,不是裸机 |
| 售后 | 7×24快速响应、持续运维支撑 | 生产级负载出了问题有人兜底 |
商红科技自建数据实验室,能提供从适配、测试到调优的全流程支撑——这对没有GPU运维经验的企业来说,是降低落地门槛的关键。把专业的事交给把浪潮摸透的人,省下的不止时间,更是真金白银。
可以。H3开源当天即支持SGLang、vLLM、diffusers、ComfyUI部署,NVIDIA芯片完成Day 0适配。但"能跑"和"达到生产级吞吐"之间还隔着一轮POC。建议至少跑三个指标:模型加载时间、首帧延迟、稳定并发下的P95吞吐,三个都达标再谈上线。
两者是不同代际。NF5468M6是前代4U多卡GPU服务器,商红科技已有成熟交付案例(如搭配A800的配置)。NF5468M7在GPU槽位扩展性、CPU与GPU直连拓扑、电源冗余等方面做了升级,具体规格差异建议在选型阶段与方案团队确认。选型时不要按旧款参数评估新款的推理能力。
取决于日均生成量。如果日均150次交互,云端API年支出约62万+;本地部署一次性50-80万,对照云端30-80万/年的持续支出,两三年甚至一年就回本。如果日均生成量更高(如AI漫剧公司),回本周期更短。建议先盘点过去3个月的实际生成量和类型,再算这笔账。
三件事优先:供电、散热、机柜空间。NF5468M7配备4×3000W电源,满载功耗不低,需提前确认机柜电力容量与PDU规格;4U机架式部署需确认机柜U位;8卡GPU满载时散热要求高于普通服务器,机房需具备相应散热条件。这些物理层条件应该在选型阶段就和方案团队确认,而不是设备到货后再补救。
不一定。如果只是验证H3的生成效果与业务可行性,可以先从较少卡数起步做POC,用真实负载数据反推最小可行配置,再按阶段扩容。NF5468M7的8个GPU槽位是扩容空间,不是要求一次性插满。建议先通过 联系我们 提交业务场景和并发目标,由方案团队帮你做初筛。
多模态生成模型的开源节奏会越来越快,但企业能真正用上的前提,是硬件底座能不能跟上"发布即支持"的速度。H3这次把模型开源和框架适配做到了同步,本地部署的技术门槛已经被实质性拉低。剩下的问题只有一个:谁来把这台机器装好、调通、兜底。
如果正在评估MiniMax H3或多模态视频生成的本地部署,可以先通过 联系我们 提交目标业务场景、日均生成量、数据部署位置与机房条件,商红科技方案团队会同步梳理POC验证项与交付时间表。
? 点击浏览 商红科技官方网站
获取MiniMax H3本地部署方案
提交以下信息即可获得初筛建议:目标业务场景、MiniMax H3预期使用方式(视频生成/多模态输入等)、日均生成量与峰值并发、数据部署位置、机房条件与信创要求。
咨询热线:400-0755-816 | 在线提交需求
2025-12-10
2025-11-07
2025-12-05
2025-11-24
2025-12-09
2026-04-24
2026-05-09
2026-06-04
2026-08-07
扫码关注