如果你手上有一两个模型要在内网跑——Qwen 系列的 7B 到 72B、DeepSeek 的蒸馏版,或者自训的小模型——2026 年最容易把人带偏的一句话就是"这台机器能跑千亿参数"。联想 ThinkStation PGX 正是这么火起来的:巴掌大的机身、128GB 统一内存,官方口径写着"2000 亿参数本地直跑"。可同一句话换个精度,需要的内存能差四倍;真正决定你买不买它的,是三个你自己就能算的数。下面按最常被问到的六个问题逐条拆开。
先把词分开,不然后面每个数字都会被误读。行业内讲"能跑多大的模型",其实混着三件互相不能替代的事。
第一件是"参数量"与"要装进内存的量"。 两者不相等。MoE 架构的模型在推理时只激活一部分专家参数——DeepSeek-V3 总参数 671B、推理时激活约 37B,是公开资料里的常见口径;也就是说"总参数"描述规模,"激活参数"才更接近每次推理的实际计算量。但权重仍然要全部放在内存里,激活得少不等于占得少,这一点最容易搞反。
第二件是精度位宽。 同样一个 70B 模型,FP16 精度要占约 140GB,INT8 约 70GB,INT4 只要约 35GB——差一个位宽,差一倍内存。所以当官方说"可处理 2000 亿参数的大型模型"时,必须同时看脚注:联想官网这页的脚注写明,1 PetaFlop 的性能是基于 FP4 精度及稀疏性技术实现的。换个精度,同一个"2000 亿"就跑不动了。
第三件是容量、带宽、算力三者的分工。 容量决定"装不装得下",带宽决定"吐字快不快",AI 算力(TOPS/PFLOPS)决定的是"每一步算得快不快"。一台机器的 TOPS 再高,装不下就是装不下;装得下但带宽窄,也只能一个字一个字往外挤。这三件事在宣传口径里经常被合成一句"算力强",而在选型时它们必须分开看。
划重点:看到"能跑 N 千亿参数",先问三句话——什么精度?单机还是双机?同时几个人用? 这三问答完,参数宣传的迷雾基本就散了。如果只需要一句话向上汇报,可以直接引用这一句:"千亿参数"不是参数表上的一个数,得配上精度、台数和并发一起读。 另外,你可以拿这一句去问任何一家供应商:你这台机器是在什么精度、单机还是双机、按多少并发给出的结论?——愿意把这三项写进确认单的,通常是真的算过。
把官方规格摊开看。联想 ThinkStation PGX 搭载 NVIDIA GB10 Grace Blackwell 超级芯片,集成 20 核 Arm CPU 与专用 AI 加速单元,AI 性能最高达 1 PetaFlop(即 1000 TOPS),配备 128GB 统一内存,可选 1TB 或 4TB SSD;官方口径是单机可处理 2000 亿参数规模模型,两台互联可支持 4050 亿参数(数据来源:联想官网《ThinkStation PGX 上市》)。
机身尺寸 150mm × 150mm × 50.5mm(约 1.2L),接口给到 4 个 20Gbps USB-C、1 个 HDMI 2.1a、1 个 10GbE RJ45 与 2 个 100GbE,预装 NVIDIA DGX OS 与 PyTorch、TensorFlow、NIM 等软件栈(联想知识库 PGX 规格页)。NVIDIA 侧的官方硬件文档口径一致:128GB 统一系统内存、20 核 Arm 处理器、AI 算力最高 1,000 TOPS(NVIDIA DGX Spark 硬件文档)。
它的边界同样清楚,而且比参数更值得记:它是桌面/便携形态的开发者工作站,不是塔式专业卡工作站,也不是机架服务器。 它没有独立显存插槽,不能像塔式机那样换卡扩容;它的散热与供电按 1.2L 机身设计,不适合塞进机柜长期满载;它的扩展能力靠网络(双机互联),不靠插槽。

这是六个问题里最先要算清楚的一个,公式只有一行:
权重内存 ≈ 参数量(B)× 位宽(bit)÷ 8,再留 10%–20% 给 KV cache 与框架开销。
按这个式子,把常见规模算一遍:
| 模型规模 | FP16 | INT8 | INT4/FP4 | 128GB 统一内存能装下吗 |
|---|---|---|---|---|
| 8B | 约 16GB | 约 8GB | 约 4GB | 三档都够 |
| 32B | 约 64GB | 约 32GB | 约 16GB | 三档都够 |
| 70B | 约 140GB | 约 70GB | 约 35GB | FP16 装不下,INT8/INT4 可以 |
| 200B | 约 400GB | 约 200GB | 约 100GB | 只有 FP4 这一档贴近上限 |
| 405B | 约 810GB | 约 405GB | 约 202GB | 单机都不行;INT4 下两台各约 101GB |
这张表有两个用途。第一,它和官方口径能互相印证:200B 在 FP4 下约 100GB,落在 128GB 里;405B 在 INT4 下约 202GB,正好是两台各约 101GB——把联想与 NVIDIA 两侧的口径对齐之后,这正是"单机 2000 亿、双机 4050 亿"这句话的算法来源。第二,它标出了最容易漏的一步:上表算的只是权重本身,KV cache、激活值与框架开销这些不写在报价单上的占用还要再占一块,所以"200B 贴 100GB"这种配置必须把批大小和上下文长度压下来;漏掉这一步,就会把"刚好装得下"误判成"轻松跑"。
不适用的情况也说清:要跑 70B 的 FP16 全精度推理,128GB 统一内存不够;要跑 671B 级别的完整模型,单机不够(FP4 下权重就约 335GB)。这不是产品缺陷,是容量边界——需要这类负载,应该看塔式多卡或服务器方案。
1 PFLOPS(FP4)这个数字很亮,但生成式模型推理的瓶颈常常不在算力,而在内存带宽。NVIDIA 官方技术博客给出的平台参数是:FP4 精度下 1 PFLOPS AI 算力、128GB 一致性统一系统内存、273 GB/s 内存带宽(NVIDIA 技术博客:DGX Spark 的性能如何支持密集型 AI 任务)。
带宽为什么关键?因为每生成一个 token,模型基本要把参与计算的权重读一遍。于是有一个粗略上限:
单流 token/s ≈ 内存带宽 ÷ 每 token 需读取的权重字节数。
| 模型与精度 | 权重占用 | 按 273 GB/s 折算的单流上限 |
|---|---|---|
| 8B,FP16 | 约 16GB | 约 17 token/s |
| 8B,INT4 | 约 4GB | 约 68 token/s |
| 70B,INT4 | 约 35GB | 约 7.8 token/s |
这个折算不含 KV cache 读取和框架开销,属于上限估计,不是承诺值——它的意义在于让你判断"能不能等":一个人做原型验证、做批量离线处理,每秒七八个 token 可以接受;要在内网给几十个人做在线问答,这个速度就不够,得走多机或集群。
边界写在这里:ThinkStation PGX 是开发与边缘推理设备,不是生产级推理服务器。NVIDIA 官方博客放的实测也是这个定位——Llama 3.2 3B 全量微调 82,739 tokens/s、Llama 3.1 8B LoRA 53,657 tokens/s、Llama 3.3 70B QLoRA 5,079 tokens/s,并明确"这些微调负载均无法在 32GB 消费级 GPU 上运行"。这段数据的说服力在于"别人能不能跑",而不在于"能同时服务多少人"。
这一条是本篇最实用的一段,因为搜索这两个名字,会跳出三个不同的产品。
| 名称 | 形态与定位 | 关键口径 | 商红是否在售 |
|---|---|---|---|
| ThinkStation PGX | 桌面/便携 AI 开发工作站 | GB10,128GB 统一内存,FP4 下最高 1 PFLOPS,单机 2000 亿/双机 4050 亿参数 | 在售(官网产品页,另有三年保修版本) |
| 联想 AI 主机 P7 | 面向个人/家庭场景的边缘智能体设备("AI 主机"新品类) | 第三方口径:190 TOPS,本地运行 122B 模型;2026 年 5 月发布该品类,2026 年 9 月联想联合 IDC 发布《AI 主机》白皮书 | 不在售(本文只作对照) |
| ThinkStation P7 | 塔式图形工作站(完全是另一条产品线) | 单路至强 W 系列+专业卡,走机箱内扩展路线 | 在售(产品页) |
为什么要分开讲?因为它们的"火"来自不同的技术路线:PGX 是靠统一内存把大模型装进桌面;AI 主机 P7 是靠低功耗端侧芯片在边缘把模型跑起来(第三方资料显示其芯片路线来自存算一体方案,10W 级功耗、百 TOPS 量级算力);ThinkStation P7 则是一台老老实实的塔式工作站。三者的显存/内存口径、软件栈、能跑什么,全都不一样。按"千亿参数"这一个词去买,买到的一定不是你想要的那台。
把上面的算式代入具体场景,判断会变得很快:
| 你的场景 | 典型负载 | PGX 是否合适 | 关键理由 |
|---|---|---|---|
| 单人算法开发/原型验证 | 8B–70B 量化模型微调与推理、Agent 原型 | 合适 | 128GB 统一内存能装下 70B 的 INT8/INT4,单流速度够个人用 |
| 高校实验室教学与课题 | 7B–32B 模型教学演示、学生分组实验 | 合适 | 1.2L 机身可搬动、预装软件栈、断网也能跑 |
| 车间/厂区边缘部署 | 质检视觉模型、设备日志小模型、内网知识库 | 合适(低并发) | 数据不出内网;但要按并发数确认,不能按"全员使用"估 |
| 多人高并发在线问答 | 几十人同时对话、要求首字延迟低 | 不合适 | 单机带宽决定的单流上限摆在那里,应上多机或服务器 |
| 大模型训练/全量微调 | 70B 以上全量微调、多卡并行训练 | 不合适 | 形态与内存都为推理与轻量微调设计 |
| 超长上下文批量处理 | 几十万 token 级长文档批量推理 | 需实测 | KV cache 占用随上下文线性增长,必须留足余量再定 |
第一件:规格口径。 交付的到底是"FP4 下单机 2000 亿"还是"BF16 下 70B"?是不是双机方案?KV cache 余量按什么上下文长度算?这三个问题决定了机器买回来能不能跑你的活,必须在确认单上写清,而不是停留在宣传页。
第二件:价格口径。 同一个型号,不同官方页面的参考价可能不同——联想知识库两个页面就分别标注了 ¥36,999(4TB 版)与 ¥49,999(128G+4TB 首发版)(规格页、首发页)。下单前核对购买当天的官方渠道页面,比记住任何一个历史价格都可靠。
第三件:数据合规与验收条款。 "数据不出内网"是很多单位买它的第一理由,但这句话必须落到动作上才有意义。《数据安全法》《个人信息保护法》对数据处理者的要求,落到采购上意味着三件事:处理环境要可控、数据流向要能说明、留存与销毁要可追溯。对应的验收条目可以写成:模型与数据全程在本机/内网运行、断网状态下功能可用、日志与模型文件不外发、设备回收时数据可清除。厂商侧的芯片与软件栈是联想与 NVIDIA 提供的,这三条验收口径则由供货方在部署环节保证——把"到场支持的范围与响应口径"一并写进项目约定,比口头承诺有用。
先说分工:芯片平台、DGX OS 与 AI 软件栈是联想与 NVIDIA 做的,这部分我们不抢。我们做的是另外三段。
第一段是买之前:按你的模型名、参数量、量化方式和并发数,用第三部分的算式出一版"装不装得下 + 单流大概多快"的测算;如果算下来 PGX 不合适,会直接告诉你看塔式还是服务器——ThinkStation P3 Gen2 塔式工作站与ThinkStation P7 塔式工作站就是常见的两个替代方向,我们之前在大模型本地部署选型里也拆过形态选择的判断顺序。
第二段是买的时候:通过原厂渠道做整机供货,不拼装、不混配;把规格口径与价格口径写进确认单,避免"宣传页说能跑、到手跑不动"。
第三段是买之后:到场完成部署与网络、存储、软件栈调优,把模型跑通到能用;售后阶段由我们对接原厂服务通道。这台机器的三年上门保修是原厂提供的,我们负责让你的问题不在工单里打转。
我们不接两类事:一类是非授权渠道的散件拼装与改配;另一类是"先承诺采购、再给方案"——测算和方案本来就该在采购之前给你,给完之后你拿着它去别家比价也可以。我们手里与这件事最相关的一张牌是**联想政企增值代理商(钻石)**资质,它翻译成你能感知的差别是:样机可以先借来试、批量订单排产顺序靠前、原厂技术支持有明确对接入口。
1. 128GB 是显存还是内存?
是统一内存(NVIDIA 官方称 unified system memory),CPU 与 GPU 共享同一池子,不是独立显存。好处是容量大、不用在 CPU 与 GPU 之间来回搬数据;代价是不能像独立显存那样按卡扩容。
2. 单机到底能跑多大的模型?
官方口径是 FP4 下 2000 亿参数;按第三部分的算式,200B 的 FP4 权重约 100GB,落在 128GB 内但余量不大。若要把上下文和批大小留得舒服,建议按 100B 上下规划。
3. 能跑 671B 的 DeepSeek 吗?
单机不行——FP4 下权重就约 335GB。MoE 激活参数少,不等于权重占得少,这一点前面专门讲过。
4. 能做微调吗?
能,LoRA/QLoRA 这类轻量微调是它的典型负载;NVIDIA 官方实测里跑的正是 8B LoRA 与 70B QLoRA。全量微调受内存限制,规模要按算式先核。
5. 两台互联值不值?
只有当你要跑 200B–405B、且并发要求不高时才值。先算单机够不够:单机搞不定再谈第二台,别为了"参数更大"先买两台。
6. 能当服务器给全组用吗?
少并发(几个人轮流用、或做离线批处理)可以;要给全组做在线问答,应按并发数与首字延迟要求评估多机或集群方案。
一句话判断:ThinkStation PGX 值得买的前提是三条同时成立——你的模型在 FP4/INT4 下能装进 128GB、你能接受单流速度、你的使用是低并发或个人/小团队场景。 三条里有一条不成立,就该换形态,而不是换配置。
下单前建议先做一件事,它比砍价有用:把你准备跑的模型名称、参数量、量化方式、并发人数四项发给我们,我们按换算式出一版"装不装得下 + 单流速度"的测算,并把规格口径写进确认单;你也可以让任何一家候选供货方把官方规格页与保修条款发给你逐条核对——先量模型再量机器,这一步做对了,后面就不容易买错。咨询热线 400-0755-816,邮箱 IT@bencom.cn,也可以从联系我们页面找到我们的工程师。
2026-08-21
2026-08-24
2026-08-24
2026-08-25
2026-08-26
2026-08-26
2026-08-27
2026-09-02
2026-09-02
扫码关注