EN

数据标注公司算力配置:钱该花在标注终端,还是预标注服务器

一家标注公司最容易犯的错,是照着"深度学习工作站"的清单去买机器——二十台带独显的机器发给标注员,用了两个月才发现,标注员真正在用的只是拉框和改标签,一台五千块的办公机就够;而真正吃算力的那一步跑在服务器上,跟桌上这台机器基本没关系。做数据标注公司算力配置,核心是先分清五个层级的算力需求,再决定钱花在哪一级。这篇写给标注公司的技术负责人和创始人,也写给要替客户出算力方案的系统集成商。

商红科技做服务器和工作站分销,给标注、AI 训练类的公司配过不少机器。下面把我们判断"钱该花在哪一级"的方法写出来——五个层级、三档预算,以及最容易踩的三个坑。

先分清:标注公司的算力需求不是一条线,是五级台阶

行业里讲"数据标注算力",往往笼统说一句"要配 GPU"。但标注是一条流水线,不同工序对硬件的要求差着数量级。按工序拆,大概是这五级:

层级工序真正的硬件瓶颈单工位/单节点参考
① 分类与 2D 框选图片打标签、拉框几乎没有,屏幕和键鼠更重要办公级主机 + 双屏
② 语义分割 / 精细标注像素级勾边、多边形显存(图层与画布)、显示精度入门独显 8~12GB
③ 3D 点云 / 视频标注激光雷达点云、逐帧追踪显存 + 视频解码能力 + 存储读取中端独显 16~24GB
预标注推理服务模型先跑一遍生成初稿GPU 算力 + 显存 + 存储吞吐推理服务器 1~8 卡
⑤ 自有模型训练 / 微调用客户数据训练垂直模型GPU 显存 + 卡间互联 + 网络带宽单机多卡 → 多节点集群

划重点:真正决定一家标注公司产能和毛利的,是第 ④ 级,不是第 ①②③ 级。 因为预标注的准确率直接决定人工返工量——预标注能到 70% 准确率,人工就只改 30%;只能到 40%,人工等于重做一遍。

而这一级,恰恰是很多公司在建厂初期完全没算进去的。

第 ④ 级展开:预标注为什么是算力黑洞

预标注的逻辑是:拿一个已经训练好的通用模型(或客户提供的模型),先对所有待标注数据跑一次推理,输出候选框、候选掩码、候选标签,人工在此基础上修正。

它的负载特征和训练完全不同:

  • 是推理,不是训练,所以更吃显存带宽和并发吞吐,而不是纯算力峰值

  • 数据量巨大:一批自动驾驶点云可能几十 TB,模型要逐帧过一遍

  • 要求低延迟持续输出:标注员在等着,服务不能断

这就带来两个常被忽略的约束。

第一个约束:存储。 公开技术资料里有一个很好用的参照——百度智能云开发者文章《AI 算力引擎构建指南》(https://cloud.baidu.com/article/4738591 )给出的数据是:以 ResNet-50 训练为例,单轮迭代需读取约 250MB 数据;若使用机械硬盘(约 150 IOPS),GPU 利用率会掉到 35%

这个数字很说明问题。花几万块买的卡,因为一块机械盘,三分之二的算力在空转。

预标注场景比这个还严重,因为它要连续读取海量图片、点云、视频帧。判断标准很简单:如果 GPU 利用率长期低于 60%,先去查存储,别急着加卡。

第二个约束:并发。 二十个标注员同时请求预标注,服务和单机跑批完全是两回事。这里需要的不是更快的单卡,而是能同时扛住多路请求的显存容量。16GB 显存能常驻一个小模型但并发路数有限;48GB 以上才能支撑多路并行。

第 ⑤ 级:什么情况下才需要自己训练

不是所有标注公司都需要训练模型。但如果你在做这几件事,就需要:

  • 给客户做垂直领域微调(医疗、工业质检、特定语种)

  • 主动学习——用模型挑出"最值得人工标注的样本",减少无效标注量

  • 承接客户的数据闭环需求(标注 → 训练 → 再标注)

单机多卡可以覆盖大部分微调场景。真正上集群的触发条件通常有两个:

  1. 模型规模超过单机显存:需要模型并行,卡间互联质量直接决定成败

  2. 训练周期不可接受:需要数据并行加速

集群化的代价比多数人预估的高。同一篇百度智能云技术文章(https://cloud.baidu.com/article/4738591 )给出的数据是:4 节点集群若使用 10Gbps 网络,参数同步时间会占到训练周期的 37%。也就是说,三分之一的机器时间在等网络。

而换成 InfiniBand HDR 的 8 节点集群,训练 GPT-3 175B 时梯度聚合时间从 12 分钟降到 18 秒——同一个集群,换张网,差 40 倍。

你品,你细品——很多人算 GPU 预算算得很细,算网络预算就拍脑袋。而网络是集群效率的分母。

所以一个务实的判断顺序是:先问要不要上集群;如果不上,把单机的存储和显存配足;如果要上,把网络预算按 GPU 预算的 15%~25% 预留。

存储怎么配:看三个数就够了

不用翻参数表,看三个数:

指标底线建议说明
顺序读带宽2 GB/s6 GB/s 以上决定加载数据快不快
随机 IOPS50K300K 以上决定小文件、随机采样快不快
容量与分层活跃数据全闪活跃 NVMe + 归档 HDD正在标的数据和归档数据分开存

第三条特别重要。标注公司的数据增长很快,如果全部放 NVMe,成本会失控。合理的做法是热数据(本周在处理)放 NVMe,温数据放 SATA SSD,冷数据(已交付)放大容量 HDD 或归档存储。 这套分层做下来,同样的预算能多装几倍数据。

质检环节对硬件也有要求

数据标注的交付质量靠三级质检撑:初级标注(通常要求准确率 85% 以上)→ 交叉验证(用 Kappa 系数评估标注一致性,行业里常见目标值 0.7)→ 专家复核(抽检约 10% 的样本)。这组口径引自百度智能云开发者文章《DeepSeek 本地化部署全攻略》(https://cloud.baidu.com/article/4458542 )。

这套流程本身不吃算力,但它决定了你需要多少存储和多少账号体系

  • 同一批数据要有多个版本(初标、复核后、交付版),存储需求至少翻三倍

  • 每个标注员的产出要留痕可追溯,需要日志存储

  • 客户验收时要能回溯到具体样本,需要索引

这些不是选配,是能不能接大客户单子的门槛。 很多标注公司第一次被客户砍价,砍的就是"你们的过程数据留不全"。

三档预算方案

按公司规模给三档参考。价格为量级参考,实际取决于品牌、卡型和交付内容。

入门档(10~20 人,做 2D 框选和分类为主)

  • 标注终端 10~20 台:办公级主机 + 双屏,不需要独显

  • 预标注:1 台单卡推理服务器(入门专业卡 24GB 级)

  • 存储:20~40TB,热数据 NVMe

  • 重点:把网络和存储做好,别在终端上花钱

进阶档(20~50 人,做分割、3D 点云、视频)

  • 标注终端 20~50 台:分割岗配入门独显,点云岗配中端独显

  • 预标注:1 台 4 卡推理服务器(48GB 级专业卡 ×4)

  • 存储:80~200TB,分三层

  • 可选:1 台单机 8 卡训练服务器做垂直微调

  • 重点:并发能力 + 存储 IOPS

规模档(50 人以上,或承接数据闭环项目)

  • 预标注与训练分离:推理服务器 + 训练集群

  • 训练集群:多节点,配 InfiniBand 或 RoCE(网络预算按 GPU 的 15%~25% 预留)

  • 存储:300TB 以上,NVMe-oF 或分布式存储

  • 重点:集群效率、任务调度、多租户隔离

再说句实话:如果团队不到 10 个人,或者在做的都是简单的框选分类,那自建推理服务器不适用,租云跑预标注、按量付费更划算,等业务量稳定了再说。自建的价值在"长期高负载且数据敏感"——数据不能出客户指定的环境,或者量大到租云比自建贵。这两条都不占,就别急着买机器。

三个最容易踩的坑

坑一:按"深度学习工作站"清单买终端

标注员的活是"看图、拉框、改标签",不是训练。独显对这类工作是浪费,而屏幕大小、分辨率、键鼠手感对产能的影响反而更大。同样的钱,买两块好屏幕比买一张好显卡更值。

坑二:只算 GPU 预算,不算存储和网络

前面那两个数字已经说明问题——150 IOPS 的机械盘能让 GPU 利用率掉到 35%,10Gbps 网络能让 37% 的训练时间耗在参数同步上。GPU 预算之外,存储建议按 GPU 预算的 10%~20%、网络按 15%~25% 预留。

坑三:没有为"数据增长"留余量

标注公司的数据只会越来越多,而且客户往往要求交付后保留一段时间。买存储时按"当前数据量 × 3"估算不夸张——热数据、备份、交付副本,一套下来就是三份。

商红能做什么、不能做什么

商红科技在深圳、惠州、广州都有办公室,是浪潮服务器和联想工作站的渠道商,同时也有数聚红芯这个自有品牌线。在数据标注这个场景里,我们做的是配置推导 + 供货 + 部署 + 三年服务这一段。

能做的

  • 按你的标注工序倒推配置——你告诉我标什么类型的数据、多少人同时用、预标注模型多大,我给你出配置单和预算区间

  • 存储分层方案:热/温/冷怎么分、各买多少、怎么配 RAID

  • 网络方案:什么时候千兆够、什么时候必须上 25G/100G

  • 现场实施与部署,交付时给验收资料

  • 三年维保与 7×24 响应(售后专线 400-0755-816)

不能做的,也说清楚:我们不做标注平台软件,也不做标注服务。如果你需要的是 SaaS 化的标注工具或外包产能,应该去找标注平台厂商,我们补的是硬件和工程这一段。

还有一个不适用的场景:如果你只要几台机器、不需要部署和运维,找我们未必比找电商平台划算——服务成本摆在那。但如果你要建的是"一批机器 + 一套能长期跑起来的环境",那是我们的活。

常见问题

预标注到底能省多少人工?

取决于模型和场景,波动很大。影响最大的不是模型多强,而是你的数据分布和通用模型的差距——差得远,预标注准确率就低,人工返工多。建议先拿 500~1000 条真实数据做一次预标注测试,看准确率再决定要不要投推理服务器。

一张 48GB 的卡,能同时服务多少个标注员?

要看你跑什么模型。小模型(如检测类)可以多路并发,大模型(如分割类大模型)并发路数会明显下降。没有通用公式,建议实测。大致判断方法是:模型显存占用 × 并发路数 + 中间缓存,不超过卡容量的 80%。

可以用消费级显卡做预标注吗?

可以用,但看两个条件:显存够不够(预标注吃显存),以及要不要 7×24 连续跑。消费卡在长时间高负载下的稳定性和驱动支持,跟专业卡有差距。如果只是白天跑、坏了能停,消费卡没问题;如果要连续生产,建议专业卡。

国产卡能做预标注吗?

很多场景可以,尤其是推理类任务。但要先确认你的模型和推理框架在国产卡上的适配情况——这是决定能不能用的关键,不是算力参数。建议拿实际模型做一轮适配验证再定。

服务器放办公室行不行?

一台 4 卡推理服务器的噪音和散热都不适合办公环境,通常需要独立机房或专门隔间。如果没条件,考虑塔式工作站或液冷机型,噪音表现会好很多。

最后

标注公司的算力账,核心就一句:钱花在能提升产能的地方——预标注推理、存储 IOPS、网络带宽;别花在提升不了产能的地方——标注终端的显卡。

如果你想让人帮你把配置算一遍,把这几样发给我们:标注的数据类型、团队人数、预标注模型规格、现有存储和网络条件。我们会给你一份配置单和预算区间,也会告诉你哪些部分不用花钱。

全国统一服务热线:400-0755-816 把你的负载场景发给我们,获取算力配置建议

延伸阅读:


邮箱:IT@bencom.cn

地址: 广东省惠州市惠城区天安数码城二期14栋10层

社交媒体:

二维码

扫码关注

针对您的问题

针对您的问题立即来一次讨论?

获得BENCOM技术专家的免费咨询,挖掘企业的技术潜力。

在线咨询 获取方案