最近跟几家数据标注公司的老板聊天,
大家说得最多的一句话是:
现在项目不是没有,但越来越难赚钱。
客户询价的时候,一看项目总金额,好像还有十几个点的利润;
等项目真正做完,工资发了、社保交了、返工结束了、回款到账了,才发现:
忙了几个月,最后只赚了一个流水。
甚至还有些项目,产值越大,亏得越多。
这几年,数据标注行业规模确实还在增长。
截至2025年3月,全国7个数据标注基地已经形成335个高质量数据集,带动相关产值超过83亿元,从业人员达到5.8万人。
但行业规模增长,并不代表每一家数据标注公司的利润都在增长。
因为今天的数据标注公司,正在同时被三种成本吃掉。
第一种成本:你以为是工资,其实是人力全成本
很多数据标注公司报价,仍然在使用一个非常简单的公式:
客户单价减去员工工资,剩下的就是利润。
比如客户给到200元一个人天,一个月按照21.75天计算,
一个人可以产生4350元收入,员工工资3000元。
老板一看,还有1350元空间,项目应该能做。
但问题是,3000元只是工资,不是人力成本。
一个标注员真正产生的成本至少包括:
工资、企业承担的社保、招聘费用、培训期间工资、培训师成本、离职补充成本、主管和组长分摊、场地、电脑、水电、网络以及行政费用。
假设一个项目含税结算价是200元一个人天,一个人每月收入4350元。
粗略扣除税费后,实际可支配收入可能只有4100元左右。
这里暂不考虑不同企业的进项抵扣差异。
再减去:
-
基本工资3000元;
-
社保及相关福利800元;
-
招聘、培训和人员流失摊销250元;
-
场地、设备和管理费用450元。
一个人的综合成本已经达到4500元。
也就是说,这个看起来还有1350元空间的项目,实际上每安排一个人,可能就亏损几百元。
近年来,多地最低工资标准持续调整,用工合规程度也在提高。
2025年已有18个地区调整了最低工资标准。
所以,数据标注公司最大的误区,就是仍然用十年前的“工资差价逻辑”,经营今天的合规化项目。
未来的报价不能只看员工到手工资,必须看单个人员的全生命周期成本。
第二种成本:报价按产量,结算却按质量
第二种成本更加隐蔽,就是质量成本。
过去很多数据标注项目,交付逻辑比较简单:
标了多少帧、多少张图片、多少条文本,就结算多少钱。
但是现在,客户真正关心的已经不是“做了多少”,而是:
准确率是多少?一致性怎么样?能不能直接进入模型训练?出现问题能不能追溯?模型效果有没有提升?
国家数据局在2026年发布的行业高质量数据集建设实施方案中,
明确提出发展“模型预标注+人工校准”“人工标注+模型检验”等智能化标注模式,并推动行业专家深度参与专业知识标注。
这意味着,数据标注正在从简单劳动,
变成一套包括规则设计、模型预标、人工校准、质量检验、专家审核和结果评测的生产系统。
成本自然也发生了变化。
假设一个100人的项目,报价时按照100人的产能计算。
项目上线以后,因为规则理解偏差,出现8%的返工率。
表面上只是返工8%的数据,实际上产生了至少四笔成本:
-
第一笔,是重新标注的人工成本。
-
第二笔,是QA、组长和项目经理重新审核的管理成本。
-
第三笔,是员工返工期间无法生产新数据的机会成本。
-
第四笔,是验收推迟带来的回款成本。
很多项目原本只有10%的利润,一次8%的批量返工,基本就能把利润全部吃掉。

更麻烦的是,数据标注项目的质量问题往往不是某个人标错了,而是规则本身存在歧义。
客户说“按照标准执行”,标注员说“标准没有写清楚”,项目经理只能一边生产、一边补充规则。
最后企业承担了规则试错成本,客户却只按照合格数据量结算。
国家数据局对高质量数据集建设的解读也指出,
高质量数据集不是简单打标签,而是把知识、经验和判断注入训练数据,
数据标注人才体系需要从劳动密集型向专家型体系升级。
所以今天的数据标注项目,真正应该核算的不是“单条标注成本”,而是:
单条验收合格数据的生产成本。
标得快但返工多,不叫高效率。
只有一次做对、稳定验收,才是真正的效率。
第三种成本:人员已到位,产能却没有变成收入
第三种成本,是很多公司最容易忽略的产能错配成本。
数据标注公司的经营有一个天然矛盾:
客户希望你随时可以扩充人员,但又不会为你提前储备的人员付费。
客户要求两周准备100人,公司就必须提前招聘、培训、采购电脑、准备场地。
但是项目实际起量时,可能只开放了60人的任务量。
剩下40个人虽然没有产值,工资、场地和管理成本却一天都不会停止。
这就是数据标注行业最典型的状态:
满编,但不满产。
还有一些项目,试标一个月,爬坡一个月,稳定生产两个月,之后突然缩量。
公司前期承担了招聘、培训和磨合成本,刚刚进入盈利阶段,项目就结束了。
更现实的问题是,工资每个月必须发,客户却往往需要经过数据提交、抽检、验收、开票和付款流程之后才会回款。
企业赚的是账面利润,承担的却是现金流压力。
与此同时,自动化标注工具正在快速进入生产流程。
政策层面也在持续推动大模型标注、多模态标注、自动化审查和质量评估工具的研发应用。
这会带来一个新的成本:
没有工具的公司,人工效率越来越低;
准备开发工具的公司,又要承担研发、部署和试错成本。
最后就出现一种非常尴尬的局面:
客户按照自动化之后的效率压低价格,公司却还在用纯人工方式完成交付。
利润自然越来越薄。

数据标注公司的利润,到底应该怎么算?
今天一个数据标注项目的真实利润,不能再用“收入减工资”计算。
更合理的公式应该是:
项目真实利润=项目净收入-人力全成本-质量损耗-产能空转-资金与技术成本。
按照这个公式重新核算,很多看起来有15%利润的项目,真实利润可能不足5%。
有些项目甚至从报价第一天起,就已经注定亏损。
所以,数据标注公司接下来必须完成三个转变:
从计算员工工资,转向计算单人全成本
报价前必须把社保、招聘、培训、管理、场地和离职率全部算进去。
从管理标注产量,转向管理验收合格产量
把规则澄清、试标验证、错误分类和质量校准放在大规模生产之前,而不是等返工发生以后再补救。
从追求人员规模,转向追求有效产能
没有稳定任务,不盲目招人;没有明确起量计划,不提前重资产投入;能够通过模型预标、自动质检和流程工具解决的问题,不再单纯依赖增加人头。
数据标注行业并没有消失。
相反,随着高质量数据集、具身智能、自动驾驶和行业大模型的发展,真正专业的数据服务需求还会继续增加。
但是,属于“招一批人、租一层楼、赚一点工资差”的时代,正在结束。
未来数据标注公司真正竞争的,不是谁的人最多,
而是谁能够把每一个项目的成本算清楚,把每一份产能变成可以验收、可以复用、可以持续盈利的数据资产。
项目不是做出来就能赚钱。
只有把成本算明白,项目才有资格开始。

2万+

被折叠的 条评论
为什么被折叠?



