EN

导航

> 新闻中心> 行业资讯>

ThinkStation P4性能拆解:Zen5+Blackwell双芯协同,本地AI推理能扛多大的活?

联想商用事业部 2026-08-13 11:45:17

分享:

AI推理从云端走向本地,企业最纠结的问题不是"买什么卡",而是"买完之后谁来装、谁来调、坏了谁修"。

联想ThinkStation P4给了硬件层面的答案——AMD锐龙PRO 9965X3D搭配RTX PRO 6000 Blackwell,Zen5与Blackwell双芯协同。这台机器到底能扛多大的活?我们从CPU、GPU、互连通路和散热四个维度拆开来看。

1.png

CPU侧:3D V-Cache不是噱头,是AI推理的数据供给优化

锐龙PRO 9965X3D是全球首款搭载3D V-Cache的商用工作站处理器。16核32线程,加速频率5.5GHz,TDP 170W。第二代3D V-Cache在原有L3基础上额外堆叠64MB,使L3总量达到96MB+32MB,带宽升至2.5TB/s。

对AI推理的实际意义在哪?小batch对话场景下,CPU侧需要频繁读取权重数据和KV Cache元信息。更大的L3缓存意味着更高的命中率,喂给GPU的数据流更连续,端到端延迟有体感改善。这不是"跑分好看",而是在真实推理服务中减少CPU-GPU之间的等待间隙。

CPU参数锐龙PRO 9965X3D规格对AI推理的意义
架构Zen 5单核IPC提升,数据预处理更快
核心/线程16核/32线程推理调度、数据预处理、API并发不卡脖
加速频率5.5GHz小batch低延迟场景响应更快
L3缓存96MB+32MB(含64MB 3D V-Cache)权重命中率更高,CPU到GPU数据流更连续
缓存带宽2.5TB/s大批量数据搬运不堵在CPU侧
TDP170W与GPU合计770W,液冷可压制

GPU侧:96GB显存能装下什么模型

RTX PRO 6000 Blackwell采用满血GB202核心,24,064个CUDA核心加752个Tensor Core,96GB GDDR7 ECC显存,带宽1,792GB/s,FP8算力2,000 TOPS。

96GB是这台机器最关键的数字。它意味着什么?

单卡可以跑70B量化模型推理,32B及以下模型完全富余。如果跑Stable Diffusion类的图像生成,96GB显存可以同时加载基础模型加多个LoRA加ControlNet,不需要频繁换卡。ECC显存在7x24小时推理服务中保障数据完整性,对于企业级部署不是可选项,是必选项。

GPU参数RTX PRO 6000 Blackwell规格对AI推理的意义
核心GB202(满血)同代旗舰硅片,算力无阉割
CUDA核心24,064高吞吐并行计算
Tensor Core752FP8/FP16混合精度加速
显存96GB GDDR7 ECC单卡跑70B量化模型,32B完全富余
显存带宽1,792GB/s大模型权重加载和KV Cache读写不堵
FP8算力2,000 TOPS推理吞吐量天花板高
TDP600W与CPU合计770W,液冷压制

双芯协同靠的是通路:PCIe 5.0构建数据闭环

CPU和GPU各自强还不够,中间的通路决定协同效率。ThinkStation P4通过PCIe 5.0 x16连接CPU与GPU,双向带宽128GB/s,构建"CPU内存到PCIe总线到GPU显存"的数据闭环。

3D V-Cache优化的是CPU侧的数据供给——让权重和元信息命中缓存而非反复访问内存。752个Tensor Core在GPU侧并行执行推理计算。瓶颈不在单芯片算力,在中间环节的连贯性。PCIe 5.0的128GB/s双向带宽,确保CPU到GPU的数据灌入不会成为拖累推理速度的短板。

打个比方:CPU是仓库管理员,GPU是加工车间。3D V-Cache让管理员手边的货架更大,拿货更快;PCIe 5.0是仓库到车间的传送带,带宽够宽,货不会堵在传送带上;GPU车间里有752个工人同时干活。三个环节缺一不可。

散热:770W双芯必须液冷

双芯合计770W TDP(CPU 170W + GPU 600W),30升机箱风冷散不掉。这不是理论推算,是物理事实。

ThinkStation P4采用液冷方案压制双芯热量。实际效果有三层意义:

第一,GPU温度稳定不降频。显卡在85度以上会自动降频保护,满载算力打六折。液冷将GPU温度控制在安全区间,持续满载推理不掉速。

第二,噪音50dB以下,可以放在办公室旁边。风冷多卡方案满载噪音通常65-75dB,开放式办公环境不可接受。液冷水泵噪音控制在50dB以下,不影响工位旁的日常工作。

第三,通过ISV认证。专业软件厂商的硬件兼容性认证要求设备在持续满载下不因散热问题崩溃,液冷是达到这一标准的硬件基础。

买完之后才是真正的开始

硬件到货只是第一步。接下来要做的事,很多企业没有预估到:

  • GPU驱动调试:不同CUDA版本与推理框架的兼容性需要逐项验证

  • 框架部署:vLLM、TensorRT-LLM、Ollama等推理框架的选型和配置

  • 模型加载测试:70B量化模型能否在96GB显存中稳定运行,需要实测验证

  • 性能调优:batch size、并发数、KV Cache配置的参数调优

  • 7x24稳定性压测:连续满载运行下的温度、功耗、延迟是否稳定

如果不确定自己的模型该选什么配置,先把模型大小、并发量、部署环境整理清楚,找商红科技售前做一轮评估。这一步免费,但能帮你避开"买回来跑不动"的坑。

作为联想核心合作伙伴,商红科技专注于为企业提供定制化AI设计算力解决方案,支持出厂预装专业计算驱动,完成全维度兼容性调试,规避兼容故障与算力损耗。商红科技一站式整机质保与技术运维服务,适配高校科研、企业工程仿真、AI推理部署等各类场景。

如需个性化算力配置与专属报价,可咨询商红科技技术团队,获取一对一免费定制方案。

ThinkStation P4核心规格速查

维度规格
CPUAMD锐龙PRO 9965X3D(Zen 5,16核/32线程,5.5GHz,170W)
CPU缓存96MB+32MB L3(含64MB 3D V-Cache),2.5TB/s带宽
GPUNVIDIA RTX PRO 6000 Blackwell(GB202,24,064 CUDA,752 Tensor Core)
显存96GB GDDR7 ECC,1,792GB/s带宽
GPU算力FP8 2,000 TOPS
互连PCIe 5.0 x16,双向128GB/s
散热液冷(双芯770W TDP),噪音<50dB
ISV认证通过
整机服务出厂预装驱动+兼容性调试+整机质保+技术运维

常见问题

ThinkStation P4能跑多大的大模型?

单卡96GB显存可以跑70B量化模型推理(如Qwen2.5-72B INT4、Llama 3.1-70B INT4)。32B及以下模型(如Qwen2.5-32B、DeepSeek-R1-Distill-32B)完全富余,可同时加载多个LoRA。FP8精度下吞吐量进一步提升。

这台机器适合放在哪里?

液冷噪音50dB以下,可以直接放在办公室或实验室工位旁,不需要独立机房。但需要确认供电——770W双芯满载加上其他组件,建议供电回路不低于1500W容量。

买完ThinkStation P4后,部署需要多久?

取决于模型和框架的复杂度。如果由商红科技深度学习AI解决方案团队交付,出厂前完成驱动预装和兼容性调试,到货后模型加载和性能调优通常1-3个工作日可完成。自行部署的话,CUDA版本匹配和框架调试可能需要更长时间。

商红科技是联想的什么级别的合作伙伴?

商红科技是联想最高级别核心合作伙伴,长期稳居联想工作站销量全国前列,多次获得联想政企业务奖项。具备联想原厂级技术服务资质,可提供出厂预装、兼容性调试、整机质保和本地化运维全流程服务。

ThinkStation P4和之前ThinkStation P3/P7有什么区别?

P3定位入门到中端,P7定位高端双路至强工作站,P4定位AI推理专用,核心差异在于CPU-GPU组合:P4首次将AMD Zen 5 3D V-Cache处理器与RTX PRO 6000 Blackwell组合在同一台工作站中,面向本地AI推理场景优化。P7更偏传统工程仿真和渲染,P4更偏AI推理部署。

获取ThinkStation P4定制方案

提交以下信息即可获得初步方案建议:目标业务场景(AI推理/模型训练/工程仿真)、模型大小与并发量、部署环境(办公室/机房/实验室)、预算范围。

咨询热线:133-1635-1745 | 在线提交需求

邮箱:IT@bencom.cn

地址: 广东省惠州市惠城区天安数码城二期14栋10层

社交媒体:

扫码关注

针对您的问题

针对您的问题立即来一次讨论?

获得BENCOM技术专家的免费咨询,挖掘企业的技术潜力。

My title page contents