EN

96G显存能跑多大模型?先分清是哪一种 96GB,再算性能悬崖在哪

96G显存能跑多大模型,这个问题有一个前提被大多数人跳过了:市面上叫"96GB"的至少是四种不同硬件,显存带宽从 256 GB/s 到 1792 GB/s,相差 7 倍。容量决定模型能不能装进去,带宽决定装进去之后跑多快,而两者之间还有一道断崖——跨过去不是慢一点,是慢一个数量级。

所以本文不先给数字,先给判断顺序。

先确认你说的 96GB 是哪一种

搜"96GB显存",排在前面的内容里混着几类完全不同的机器。它们的共同点只是数字看起来一样。

那个"96GB"出现在哪它实际是什么官方显存带宽能不能当独立显存用
RTX PRO 6000 Blackwell 96GB96GB GDDR7 独立显存1792 GB/s
Atlas 300I Duo 96G 国产推理卡96GB LPDDR4X 独立显存408 GB/s
Ryzen AI Max+ 395 一类统一内存机型从系统内存里划出来,最大可分配 96GB256 GB/s能当显存用,但和内存共享同一条总线
96GB 内存条系统内存,不是显存与显卡无关不能

最后一类不是玩笑。搜索建议里确实有人把"96G内存"和"96G显存"当同一件事问。

前三类都真能跑大模型,但带宽差了 7 倍(1792 ÷ 256)。同样标 96GB,一个能把 70B 级模型跑成可用的服务,另一个可能连流畅对话都吃力。所以"96G显存能跑多大模型"这句话,第一句该反问的是:你说的是哪一种 96GB。

顺带一个定义上的提醒:统一内存机型的 96GB 是从系统内存划的,划走之后留给操作系统的就变少了。 它不是"白送一张 96GB 显卡",是用内存带宽换来的容量。

容量给的是上限,带宽才是每天的体感

先算容量上限。这一步是纯算术,不含任何经验系数:FP16/BF16 每个参数占 2 字节,FP8/INT8 约 1 字节,INT4 约 0.5 字节。

于是 96GB 只装权重的理论上限大致是:

权重精度每参数字节96GB 的理论权重上限
FP16 / BF162约 48B
FP8 / INT81约 96B
INT4约 0.5约 192B

但这个表不能当答案用。 它假设显存里只放权重,不放别的。实际可用显存要先扣掉运行时开销、KV Cache 和安全余量——这也是为什么有人按"96GB 能装 96B INT8 模型"去配机器,结果 70B 就吃紧。

再看带宽这一步。逐 token 解码时,每生成一个 token 都要把参与计算的权重读一遍,所以解码速度主要由权重体积 ÷ 显存带宽决定,而不是由算力决定。

把带宽阶梯并排看,结论就很直接:

载体带宽相对 RTX PRO 6000(96GB GDDR7)
RTX PRO 6000 Blackwell 96GB1792 GB/s基准
Atlas 300I Duo 96G408 GB/s约 1/4.4
Ryzen AI Max+ 395 统一内存 96GB256 GB/s约 1/7
(对照)被卸载到系统内存时走 PCIe 5.0 ×1664 GB/s约 1/28

所以同样叫 96GB,"能跑多大"的容量答案一样,"跑起来什么感觉"的答案差 7 倍。 这就是为什么"96GB 共享显存跑 70B"这类配置会让人失望——不是装不下,是带宽不够。


性能悬崖是三条线,不是一条

把"显存不够"当成一个状态,就会得出"96GB 很安全"的错觉。实际上有三条线,触发条件和表现都不同。

线什么时候触发触发现象处置方向
权重线权重体积超过可用显存直接报 OOM,或被迫降到位宽更低的量化降量化位宽、减少并发、换更大显存
KV 线权重装得下,但上下文长度 × 并发数一涨,KV Cache 超过剩余显存上下文被截断、并发掉到很低、请求被抢占排队限上下文、限并发、量化 KV Cache
带宽线容量都够,但带宽不够没有报错,就是 token/s 上不去换高带宽载体,或减小每 token 要读的权重

判断顺序是从上线往下:先看权重线(过不去就换方案),再看 KV 线(决定你能开多长上下文、多少并发),最后才看带宽线(决定体感)。

第三行是最容易被忽略的一条:带宽线不报错。 一个项目卡在带宽线上,表现是"能用但慢",很容易被误判成模型或框架的问题,然后花时间在调参上,而真正的原因在硬件选型阶段就定下来了。

跨过容量线之后,为什么是断崖

权重线一旦被跨过,框架的常规处置是把一部分层留在系统内存里,每次前向计算再通过 PCIe 搬进搬出。于是瓶颈从显卡内部换成了卡外总线。

PCI-SIG 对 PCIe 5.0 的官方说明是:32 条通道提供每条方向 128 GB/s 的有效原始带宽。折算到常见的 ×16 插槽,就是 64 GB/s

对比一下:1792 ÷ 64 = 28 倍

这就是"性能悬崖"之所以是悬崖的原因——跨过容量线之后,搬运同样多的数据要花约 28 倍的时间。 它不是一个平缓的斜坡,因为瓶颈换了一个数量级的量级。

这条算术也解释了另一个现象:从 8GB 到 32GB 每加一档提升都不大,真正拉开差距是在更高档位。因为决定速度的不是"显存有多大",而是"还有多少层留在内存里"——只要还剩几层在外面,那 64 GB/s 就一直卡在路径上。

需要说清楚的是:28 倍是带宽之比,不是速度之比,也不是承诺值。 实际吞吐还受模型结构、量化方式、批大小和框架实现影响。这里给的是一条可自行复核的量级判断,不是一个性能预测。

把显存账算成三个数,答案就出来了

回到正题。一张 96GB 卡(GDDR7,1792 GB/s)能跑多大,取决于三笔账。

第一笔是权重:参数量 × 每参数字节。上面那张表已经算过。标"约"是因为实际占用总比理论高——嵌入层和归一化层通常保留更高精度,量化分组还要带元数据。

第二笔是 KV Cache,最容易被漏掉的一笔。 它随上下文长度和并发数线性增长,长上下文下可能比权重还大。模型官方 config 里的四个数就能算:

KV 每 token 字节 = 2 × 层数 × KV 头数 × 头维度 × 每元素字节

模型(官方 config 取值)层数KV 头头维度KV / token(FP16)单路 128K
Llama 3.3 70B808128320 KB40.00 GiB
Qwen3 32B648128256 KB32.00 GiB
GLM-4.5-Air(106B MoE)468128184 KB23.00 GiB

注意 KV 头是 8 而不是 64。这是 GQA 的效果——KV 头数远少于注意力头数,KV Cache 因此小了一个量级。没有用 GQA 的模型,这张表要重算。

第三笔是两笔相加,再看余量:

配置权重128K 单路 KV合计96GB 够不够
70B INT8 + 32K 上下文约 70GB10 GiB约 80GB够,余量约 16GB
70B INT8 + 128K 上下文约 70GB40 GiB约 110GB装不下
70B INT4 + 128K 上下文约 40GB40 GiB约 80GB
32B INT8 + 128K 上下文约 32GB32 GiB约 64GB够,余量充足
32B FP16 + 128K 上下文约 64GB32 GiB约 96GB刚好卡满,不能这么配

三笔账放在一起,"96G显存能跑多大模型"就有可复核的答案了:70B 在 32K 上下文可以用 INT8,要开到 128K 就得降到 INT4;而 32B 开到 128K 仍有充足余量。 换个问法结论就变——上下文砍到 8K,70B INT8 的 KV 只要 2.5 GiB,余量一下子宽出来。

最后两条别省。别把 96GB 全部排进预算:长连接、显存碎片和峰值波动都要占地方,留一部分不排进去,是避免"跑一天崩一次"的常规做法。以及两张 48GB 不等于一张 96GB——多卡要额外承担并行切分、卡间通信缓冲和负载不均衡,有效容量与效率都略低于同容量的单卡。

MoE 让计算变便宜,但没让权重变小

现在很多大模型是 MoE 结构。以官方口径为例,智谱的 GLM-4.5-Air 是 106B 总参数、12B 激活参数;GLM-4.5 是 355B 总参数、32B 激活。

这里的常见误读是:既然每 token 只激活 12B,显存是不是也只按 12B 算?

不是。被激活的参数决定的是计算量,不是权重体积。 权重仍然要全部驻留显存,因为每一层路由到哪些专家是运行时才知道的,框架不能提前把没激活的专家从显存里删掉。

所以 MoE 对两件事的影响完全不同:

  • 容量:帮助有限,还得按总参数算;

  • 速度和成本:帮助很大,每 token 只算激活的那部分,同样的 96GB 能换来更高的吞吐。

这也解释了一个易被误判的现象:有些 MoE 模型参数看着吓人,却在单张 96GB 卡上跑得比稠密小模型还快。不是因为它小,是它每次只算一小部分。

MIG 会让你的 96GB 变成 24GB

前一篇讲双卡部署时提过 MIG,这里要补一个容量视角的提醒。

RTX PRO 6000 96GB 可以切成 MIG 1g.24gb 实例,每个实例拿显存的 1/4 和 SM 的 1/4,单卡最多 4 个实例。做多模型隔离时这很有用——每个实例显存、缓存、引擎都独立,隔离是硬件级的。

但换来的代价正好和本文主题冲突:一旦切片,单模型能用的显存就只剩 24GB。 按上面的表,24GB 在长上下文下大概只够 14B 级稠密模型。

所以有一个取舍必须提前想清楚:

"用 MIG 做多模型隔离"和"用 96GB 装大模型"在同一张卡上是互斥的。 想要隔离就接受单模型预算收缩到 24GB;想要装大模型就整卡跑一个实例。

另外三条硬约束仍然成立:MIG 只支持 CUDA 支持的 Linux 发行版;NCCL 目前不与 MIG 兼容;跨 GPU 的 MIG 实例之间不支持 P2P。Windows 环境下这条路直接不存在。

国产 96GB 推理卡是另一条路——下面这台把 4 张 Atlas 300I Duo 96G 装进塔式整机、配一体式液冷套件,常见于对信创和本地液冷有要求的场景:

搭载鲲鹏920S模组与四张 Atlas 300I Duo 96G 推理卡的塔式液冷整机,正面为蜂窝散热网孔
4 × 96G 的国产推理方案:容量叠加不等于带宽叠加,单个模型的解码速度仍受单卡带宽约束

有一点要提醒:4 张 96G 加起来 384GB,但带宽不叠加。 单个模型仍主要受单卡 408 GB/s 约束,只有做跨卡并行时才能用上多卡带宽,而跨卡并行要求模型能切开、卡间通信跟得上。

600W 和 300W:Max-Q 砍掉的不是带宽

选 96GB 卡时会遇到一个功耗分叉。官方规格表里,RTX PRO 6000 Blackwell 的 600W 版本和 Max-Q 300W 版本,内存规格完全相同:都是 96GB GDDR7,都是 1792 GB/s,核心数也一致。差别在功耗与频率。

因为逐 token 解码是带宽受限的,这个事实带来一个容易被忽略的选型结论:

  • 长文本生成这类带宽受限的负载,Max-Q 掉的主要是算力相关的那份,带宽那一份没掉,速度损失远小于功耗比看起来的幅度;

  • 长 prompt 预填充、大批量并发这类算力受限的负载,Max-Q 的差距才会明显。

所以判断标准不是"300W 是不是阉割版",而是你的主力负载落在带宽侧还是算力侧。机柜供电或散热受限、以长文本生成为主,Max-Q 的代价比想象中小;以大批量预填充为主,就要慎重。

三档配置

档位适用情形方案不适用
入门先把模型稳定跑起来单张 96GB 卡 + INT8/INT4 量化,短上下文需要长上下文或高并发
进阶 ⭐企业本地知识库、推理服务96GB GDDR7 单卡(1792 GB/s)+ 量化 + 反向代理统一入口单模型权重超过 96GB
旗舰多模型隔离,或要更高总吞吐多卡,或 MIG 切片(须 Linux)Windows 环境;单模型要靠切片装下

结论速览:四段可引用段

一、同一个"96GB"是四种硬件。 96GB GDDR7 独立显存(1792 GB/s)、96GB LPDDR4X 国产推理卡(408 GB/s)、从系统内存划出的 96GB 统一内存(256 GB/s)、以及根本不是显存的 96GB 内存条。容量相同,带宽相差 7 倍。

二、容量决定能不能跑,带宽决定跑多快,但交接处是断崖。 逐 token 解码受显存带宽约束;一旦权重装不下、被迫卸载到系统内存,路径带宽从 1792 GB/s 掉到 PCIe 5.0 ×16 的 64 GB/s,差约 28 倍。所以跨过容量线不是变慢一点。

三、"能跑多大"由上下文决定。 70B INT8 在 32K 上下文合计约 80GB、能装下;同样这 70B 开到 128K,加上 40 GiB 的 KV 就超过 96GB。只报一个数字的答案必然误导。

四、MoE 省的是计算,不是容量。 权重必须全部驻留显存,激活参数只减少每 token 的计算量。所以在 96GB 上 MoE 的真实优势是速度和成本,不是能装更大的模型。

常见问题

96GB 显存能不能跑 671B 的模型? 按权重算术,FP16 需要约 1342GB、INT8 约 671GB、即使 INT4 也约 336GB,都远超 96GB。不靠多卡或更低比特,单张 96GB 装不下这个量级。

统一内存的 96GB 和独显的 96GB 差在哪? 差在带宽。统一内存机型是从系统内存划出容量,与内存共享同一条总线(AMD 官方规格为 256 GB/s);GDDR7 独显是 1792 GB/s。容量够不代表速度够。

为什么我的卡显存够,模型还是慢? 大概率在带宽线上。不报错,只是 token/s 上不去。先确认载体带宽,再确认有没有层被卸载到系统内存——只要有层在外面,64 GB/s 那条路就一直卡着。

下一步

如果还在选型阶段,把四个数写下来就能定:模型参数量与量化位宽、目标上下文长度、期望并发、业务能接受的 token/s。前两项定容量、后两项定带宽。

商红科技是浪潮元脑生态伙伴与联想政企增值代理商,做服务器与工作站的选型落地和交付。选型问题可以直接说需求,我们把配置和边界一起讲清楚:全国服务热线 400-0755-816,也可以在联系我们提交需求。

延伸阅读:双卡双模型怎么设置专业卡与消费卡的分工显存之外的资源约束低价方案的能力边界深圳/惠州/广东本地交付

站内可参考的 96GB 实例:搭载四张 Atlas 300I Duo 96G 的塔式液冷整机


邮箱:IT@bencom.cn

地址: 广东省惠州市惠城区天安数码城二期14栋10层

社交媒体:

二维码

扫码关注

针对您的问题

针对您的问题立即来一次讨论?

获得BENCOM技术专家的免费咨询,挖掘企业的技术潜力。

在线咨询 获取方案