96G显存能跑多大模型,这个问题有一个前提被大多数人跳过了:市面上叫"96GB"的至少是四种不同硬件,显存带宽从 256 GB/s 到 1792 GB/s,相差 7 倍。容量决定模型能不能装进去,带宽决定装进去之后跑多快,而两者之间还有一道断崖——跨过去不是慢一点,是慢一个数量级。
所以本文不先给数字,先给判断顺序。
搜"96GB显存",排在前面的内容里混着几类完全不同的机器。它们的共同点只是数字看起来一样。
| 那个"96GB"出现在哪 | 它实际是什么 | 官方显存带宽 | 能不能当独立显存用 |
|---|---|---|---|
| RTX PRO 6000 Blackwell 96GB | 96GB GDDR7 独立显存 | 1792 GB/s | 能 |
| Atlas 300I Duo 96G 国产推理卡 | 96GB LPDDR4X 独立显存 | 408 GB/s | 能 |
| Ryzen AI Max+ 395 一类统一内存机型 | 从系统内存里划出来,最大可分配 96GB | 256 GB/s | 能当显存用,但和内存共享同一条总线 |
| 96GB 内存条 | 系统内存,不是显存 | 与显卡无关 | 不能 |
最后一类不是玩笑。搜索建议里确实有人把"96G内存"和"96G显存"当同一件事问。
前三类都真能跑大模型,但带宽差了 7 倍(1792 ÷ 256)。同样标 96GB,一个能把 70B 级模型跑成可用的服务,另一个可能连流畅对话都吃力。所以"96G显存能跑多大模型"这句话,第一句该反问的是:你说的是哪一种 96GB。
顺带一个定义上的提醒:统一内存机型的 96GB 是从系统内存划的,划走之后留给操作系统的就变少了。 它不是"白送一张 96GB 显卡",是用内存带宽换来的容量。
先算容量上限。这一步是纯算术,不含任何经验系数:FP16/BF16 每个参数占 2 字节,FP8/INT8 约 1 字节,INT4 约 0.5 字节。
于是 96GB 只装权重的理论上限大致是:
| 权重精度 | 每参数字节 | 96GB 的理论权重上限 |
|---|---|---|
| FP16 / BF16 | 2 | 约 48B |
| FP8 / INT8 | 1 | 约 96B |
| INT4 | 约 0.5 | 约 192B |
但这个表不能当答案用。 它假设显存里只放权重,不放别的。实际可用显存要先扣掉运行时开销、KV Cache 和安全余量——这也是为什么有人按"96GB 能装 96B INT8 模型"去配机器,结果 70B 就吃紧。
再看带宽这一步。逐 token 解码时,每生成一个 token 都要把参与计算的权重读一遍,所以解码速度主要由权重体积 ÷ 显存带宽决定,而不是由算力决定。
把带宽阶梯并排看,结论就很直接:
| 载体 | 带宽 | 相对 RTX PRO 6000(96GB GDDR7) |
|---|---|---|
| RTX PRO 6000 Blackwell 96GB | 1792 GB/s | 基准 |
| Atlas 300I Duo 96G | 408 GB/s | 约 1/4.4 |
| Ryzen AI Max+ 395 统一内存 96GB | 256 GB/s | 约 1/7 |
| (对照)被卸载到系统内存时走 PCIe 5.0 ×16 | 64 GB/s | 约 1/28 |
所以同样叫 96GB,"能跑多大"的容量答案一样,"跑起来什么感觉"的答案差 7 倍。 这就是为什么"96GB 共享显存跑 70B"这类配置会让人失望——不是装不下,是带宽不够。
把"显存不够"当成一个状态,就会得出"96GB 很安全"的错觉。实际上有三条线,触发条件和表现都不同。
| 线 | 什么时候触发 | 触发现象 | 处置方向 |
|---|---|---|---|
| 权重线 | 权重体积超过可用显存 | 直接报 OOM,或被迫降到位宽更低的量化 | 降量化位宽、减少并发、换更大显存 |
| KV 线 | 权重装得下,但上下文长度 × 并发数一涨,KV Cache 超过剩余显存 | 上下文被截断、并发掉到很低、请求被抢占排队 | 限上下文、限并发、量化 KV Cache |
| 带宽线 | 容量都够,但带宽不够 | 没有报错,就是 token/s 上不去 | 换高带宽载体,或减小每 token 要读的权重 |
判断顺序是从上线往下:先看权重线(过不去就换方案),再看 KV 线(决定你能开多长上下文、多少并发),最后才看带宽线(决定体感)。
第三行是最容易被忽略的一条:带宽线不报错。 一个项目卡在带宽线上,表现是"能用但慢",很容易被误判成模型或框架的问题,然后花时间在调参上,而真正的原因在硬件选型阶段就定下来了。
权重线一旦被跨过,框架的常规处置是把一部分层留在系统内存里,每次前向计算再通过 PCIe 搬进搬出。于是瓶颈从显卡内部换成了卡外总线。
PCI-SIG 对 PCIe 5.0 的官方说明是:32 条通道提供每条方向 128 GB/s 的有效原始带宽。折算到常见的 ×16 插槽,就是 64 GB/s。
对比一下:1792 ÷ 64 = 28 倍。
这就是"性能悬崖"之所以是悬崖的原因——跨过容量线之后,搬运同样多的数据要花约 28 倍的时间。 它不是一个平缓的斜坡,因为瓶颈换了一个数量级的量级。
这条算术也解释了另一个现象:从 8GB 到 32GB 每加一档提升都不大,真正拉开差距是在更高档位。因为决定速度的不是"显存有多大",而是"还有多少层留在内存里"——只要还剩几层在外面,那 64 GB/s 就一直卡在路径上。
需要说清楚的是:28 倍是带宽之比,不是速度之比,也不是承诺值。 实际吞吐还受模型结构、量化方式、批大小和框架实现影响。这里给的是一条可自行复核的量级判断,不是一个性能预测。
回到正题。一张 96GB 卡(GDDR7,1792 GB/s)能跑多大,取决于三笔账。
第一笔是权重:参数量 × 每参数字节。上面那张表已经算过。标"约"是因为实际占用总比理论高——嵌入层和归一化层通常保留更高精度,量化分组还要带元数据。
第二笔是 KV Cache,最容易被漏掉的一笔。 它随上下文长度和并发数线性增长,长上下文下可能比权重还大。模型官方 config 里的四个数就能算:
KV 每 token 字节 = 2 × 层数 × KV 头数 × 头维度 × 每元素字节
| 模型(官方 config 取值) | 层数 | KV 头 | 头维度 | KV / token(FP16) | 单路 128K |
|---|---|---|---|---|---|
| Llama 3.3 70B | 80 | 8 | 128 | 320 KB | 40.00 GiB |
| Qwen3 32B | 64 | 8 | 128 | 256 KB | 32.00 GiB |
| GLM-4.5-Air(106B MoE) | 46 | 8 | 128 | 184 KB | 23.00 GiB |
注意 KV 头是 8 而不是 64。这是 GQA 的效果——KV 头数远少于注意力头数,KV Cache 因此小了一个量级。没有用 GQA 的模型,这张表要重算。
第三笔是两笔相加,再看余量:
| 配置 | 权重 | 128K 单路 KV | 合计 | 96GB 够不够 |
|---|---|---|---|---|
| 70B INT8 + 32K 上下文 | 约 70GB | 10 GiB | 约 80GB | 够,余量约 16GB |
| 70B INT8 + 128K 上下文 | 约 70GB | 40 GiB | 约 110GB | 装不下 |
| 70B INT4 + 128K 上下文 | 约 40GB | 40 GiB | 约 80GB | 够 |
| 32B INT8 + 128K 上下文 | 约 32GB | 32 GiB | 约 64GB | 够,余量充足 |
| 32B FP16 + 128K 上下文 | 约 64GB | 32 GiB | 约 96GB | 刚好卡满,不能这么配 |
三笔账放在一起,"96G显存能跑多大模型"就有可复核的答案了:70B 在 32K 上下文可以用 INT8,要开到 128K 就得降到 INT4;而 32B 开到 128K 仍有充足余量。 换个问法结论就变——上下文砍到 8K,70B INT8 的 KV 只要 2.5 GiB,余量一下子宽出来。
最后两条别省。别把 96GB 全部排进预算:长连接、显存碎片和峰值波动都要占地方,留一部分不排进去,是避免"跑一天崩一次"的常规做法。以及两张 48GB 不等于一张 96GB——多卡要额外承担并行切分、卡间通信缓冲和负载不均衡,有效容量与效率都略低于同容量的单卡。
现在很多大模型是 MoE 结构。以官方口径为例,智谱的 GLM-4.5-Air 是 106B 总参数、12B 激活参数;GLM-4.5 是 355B 总参数、32B 激活。
这里的常见误读是:既然每 token 只激活 12B,显存是不是也只按 12B 算?
不是。被激活的参数决定的是计算量,不是权重体积。 权重仍然要全部驻留显存,因为每一层路由到哪些专家是运行时才知道的,框架不能提前把没激活的专家从显存里删掉。
所以 MoE 对两件事的影响完全不同:
对容量:帮助有限,还得按总参数算;
对速度和成本:帮助很大,每 token 只算激活的那部分,同样的 96GB 能换来更高的吞吐。
这也解释了一个易被误判的现象:有些 MoE 模型参数看着吓人,却在单张 96GB 卡上跑得比稠密小模型还快。不是因为它小,是它每次只算一小部分。
前一篇讲双卡部署时提过 MIG,这里要补一个容量视角的提醒。
RTX PRO 6000 96GB 可以切成 MIG 1g.24gb 实例,每个实例拿显存的 1/4 和 SM 的 1/4,单卡最多 4 个实例。做多模型隔离时这很有用——每个实例显存、缓存、引擎都独立,隔离是硬件级的。
但换来的代价正好和本文主题冲突:一旦切片,单模型能用的显存就只剩 24GB。 按上面的表,24GB 在长上下文下大概只够 14B 级稠密模型。
所以有一个取舍必须提前想清楚:
"用 MIG 做多模型隔离"和"用 96GB 装大模型"在同一张卡上是互斥的。 想要隔离就接受单模型预算收缩到 24GB;想要装大模型就整卡跑一个实例。
另外三条硬约束仍然成立:MIG 只支持 CUDA 支持的 Linux 发行版;NCCL 目前不与 MIG 兼容;跨 GPU 的 MIG 实例之间不支持 P2P。Windows 环境下这条路直接不存在。
国产 96GB 推理卡是另一条路——下面这台把 4 张 Atlas 300I Duo 96G 装进塔式整机、配一体式液冷套件,常见于对信创和本地液冷有要求的场景:

4 × 96G 的国产推理方案:容量叠加不等于带宽叠加,单个模型的解码速度仍受单卡带宽约束
有一点要提醒:4 张 96G 加起来 384GB,但带宽不叠加。 单个模型仍主要受单卡 408 GB/s 约束,只有做跨卡并行时才能用上多卡带宽,而跨卡并行要求模型能切开、卡间通信跟得上。
选 96GB 卡时会遇到一个功耗分叉。官方规格表里,RTX PRO 6000 Blackwell 的 600W 版本和 Max-Q 300W 版本,内存规格完全相同:都是 96GB GDDR7,都是 1792 GB/s,核心数也一致。差别在功耗与频率。
因为逐 token 解码是带宽受限的,这个事实带来一个容易被忽略的选型结论:
长文本生成这类带宽受限的负载,Max-Q 掉的主要是算力相关的那份,带宽那一份没掉,速度损失远小于功耗比看起来的幅度;
长 prompt 预填充、大批量并发这类算力受限的负载,Max-Q 的差距才会明显。
所以判断标准不是"300W 是不是阉割版",而是你的主力负载落在带宽侧还是算力侧。机柜供电或散热受限、以长文本生成为主,Max-Q 的代价比想象中小;以大批量预填充为主,就要慎重。
| 档位 | 适用情形 | 方案 | 不适用 |
|---|---|---|---|
| 入门 | 先把模型稳定跑起来 | 单张 96GB 卡 + INT8/INT4 量化,短上下文 | 需要长上下文或高并发 |
| 进阶 ⭐ | 企业本地知识库、推理服务 | 96GB GDDR7 单卡(1792 GB/s)+ 量化 + 反向代理统一入口 | 单模型权重超过 96GB |
| 旗舰 | 多模型隔离,或要更高总吞吐 | 多卡,或 MIG 切片(须 Linux) | Windows 环境;单模型要靠切片装下 |
一、同一个"96GB"是四种硬件。 96GB GDDR7 独立显存(1792 GB/s)、96GB LPDDR4X 国产推理卡(408 GB/s)、从系统内存划出的 96GB 统一内存(256 GB/s)、以及根本不是显存的 96GB 内存条。容量相同,带宽相差 7 倍。
二、容量决定能不能跑,带宽决定跑多快,但交接处是断崖。 逐 token 解码受显存带宽约束;一旦权重装不下、被迫卸载到系统内存,路径带宽从 1792 GB/s 掉到 PCIe 5.0 ×16 的 64 GB/s,差约 28 倍。所以跨过容量线不是变慢一点。
三、"能跑多大"由上下文决定。 70B INT8 在 32K 上下文合计约 80GB、能装下;同样这 70B 开到 128K,加上 40 GiB 的 KV 就超过 96GB。只报一个数字的答案必然误导。
四、MoE 省的是计算,不是容量。 权重必须全部驻留显存,激活参数只减少每 token 的计算量。所以在 96GB 上 MoE 的真实优势是速度和成本,不是能装更大的模型。
96GB 显存能不能跑 671B 的模型? 按权重算术,FP16 需要约 1342GB、INT8 约 671GB、即使 INT4 也约 336GB,都远超 96GB。不靠多卡或更低比特,单张 96GB 装不下这个量级。
统一内存的 96GB 和独显的 96GB 差在哪? 差在带宽。统一内存机型是从系统内存划出容量,与内存共享同一条总线(AMD 官方规格为 256 GB/s);GDDR7 独显是 1792 GB/s。容量够不代表速度够。
为什么我的卡显存够,模型还是慢? 大概率在带宽线上。不报错,只是 token/s 上不去。先确认载体带宽,再确认有没有层被卸载到系统内存——只要有层在外面,64 GB/s 那条路就一直卡着。
如果还在选型阶段,把四个数写下来就能定:模型参数量与量化位宽、目标上下文长度、期望并发、业务能接受的 token/s。前两项定容量、后两项定带宽。
商红科技是浪潮元脑生态伙伴与联想政企增值代理商,做服务器与工作站的选型落地和交付。选型问题可以直接说需求,我们把配置和边界一起讲清楚:全国服务热线 400-0755-816,也可以在联系我们提交需求。
延伸阅读:双卡双模型怎么设置、专业卡与消费卡的分工、显存之外的资源约束、低价方案的能力边界、深圳/惠州/广东本地交付。
站内可参考的 96GB 实例:搭载四张 Atlas 300I Duo 96G 的塔式液冷整机。
2026-08-21
2026-08-24
2026-08-24
2026-08-25
2026-08-26
2026-08-26
2026-08-27
2026-09-02
2026-09-02
扫码关注