8月25日,Figure 发布 Index,说了一句让很多数据公司心里一沉的话。
“我们以前试过买数据,但第三方供应商在吞吐量、多样性和质量上,都达不到 Helix 的要求。”
翻译一下:外面买的数据,不好用。所以我们不买了,自己建。
这句话听起来是 Figure 的一个商业决策。但如果你是一家做机器人数据的第三方公司,这句话就是一颗雷。
因为 Figure 不是只有一个这么想的。OpenAI 在组建 Robotics Data Acquisition 团队,Physical Intelligence 在走学术合作加开源数据的路线。头部公司都在做同一件事:把数据握在自己手里。
问题来了:当客户都开始自己采数据了,第三方数据公司怎么办?
数据外包的黄金时代
要理解现在的冲击,得先看看过去几年这个生意是怎么做的。
模式很简单:数据公司找场景、采数据、做加工,然后把成品数据卖给机器人公司。一份数据可以卖给 A,卖给 B,卖给 C。边际成本几乎为零,利润率看起来不错。
这个模式在行业早期跑得通。因为那时候所有机器人公司面临的是同一个问题:没有数据。通用数据再差,也比没有强。需求是普遍的,供给是稀缺的,数据公司只要能采到一批还算能用的数据,就不愁卖。
那是数据外包的黄金时代。采集团队扩张,标注基地扩建,融资消息不断。所有人都觉得,机器人数据会是一个越来越大的市场。
但黄金时代的前提是:所有客户的需求是一样的。
这个前提,正在失效。
为什么”卖数据”这个模式走不通了
问题出在一个根本的错配上:模型公司的数据需求是动态的、具体的,而第三方数据是静态的、通用的。
目前 Figure 的 Helix 模型对透明物体操作不行,它需要的是一批专门针对透明物体的交互数据。等第三方数据公司按这个需求采完、加工好、交付过来,可能已经是三个月以后了。这时候 Helix 的下一个版本可能已经变了。现在缺的是软物体操控,或者失败恢复,或者长序列任务。
数据需求的迭代速度,比第三方的响应速度快。这不是第三方不努力,是这个生意的底层逻辑决定的。
更要命的是”一份数据卖十家”这个模式。当每个客户的模型需要的数据都不一样的时候,一份通用数据谁都满足不了。A 客户需要透明物体,B 客户需要软物体,C 客户需要双手协作。你采了一批通用抓取数据,三家都觉得”能用但不够用”,然后三家都在想:我是不是该自己采?
Figure 已经想明白了。它的判断是:第三方数据不是质量不好,而是从生产方式上就不可能跟上模型的迭代速度。按通用标准生产的数据,永远追不上按特定模型需求定制的数据。
这个判断一旦成立,”卖数据”这个生意的根基就动摇了。
哪些公司会先出问题
不是所有第三方数据公司都会死。但有几类公司,会先感受到寒意。
头类是”数据倒爷”。自己不采集,从上游拿数据,做一层简单加工,然后加价卖出去。没有采集能力,没有质量控制,没有客户粘性,纯靠信息差赚钱。这类公司在任何行业的洗牌期都是出局的。
第二类是”通用数据集生产商”。建一个标准数据集,然后试图卖给所有客户。当每个客户的需求都不一样的时候,一个标准数据集谁都满足不了。这类公司的问题不是数据质量差,而是产品形态和客户需求错配了。
第三类是”纯标注外包”。只做标注,不碰采集,不碰质量标准,不碰数据管线。标注是数据生产里劳动密集、容易被替代的一环。当客户开始自建管线,标注要么被内化,要么被压到低价。纯标注公司的利润空间会被持续挤压。
这三类公司有一个共同特征:它们的价值主张是”我有数据”或者”我能做数据加工”。但当客户开始自己采数据的时候,”我有数据”就不再是卖点了、客户自己也会有。
真正的危险信号是:如果你的core竞争力是数据本身,而不是生产数据的能力,那你就在危险区里。

哪些公司能活下来
活下来的公司,会是另外几类。
一类是”全链路服务商”。不只是采数据,而是能帮客户运营整条数据管线:从任务定义、场景搭建、采集执行、质量控制,到数据处理、交付、迭代。客户说”我需要一批透明物体的数据”,服务商不是说”我有一批你看看”,而是说”好,我们按你的标准采,两周后交付,然后根据你的模型反馈调整下一批”。这类公司卖的不是数据,是能力。
第二类是”垂直领域专家”。不做通用数据,只做一个极难的细分领域。比如高难度接触丰富的操作数据、稀有物体场景采集、失败案例专门收集、特定工业场景的数据生产。专业化创造壁垒——客户自己采不了这个领域的数据,因为太专业、太贵、太花时间。这类公司的护城河是专业深度,不是数据规模。
第三类是”基础设施提供商”。不碰数据所有权,只做数据生产的工具和系统。采集设备、数据处理引擎、质量监控系统、标注平台、数据管线管理软件。客户用这些工具自己采数据,基础设施提供商卖工具和服务。这类公司的定位是”卖铲子”,而不是”挖金子”。
这三类活下来的公司有一个共同点:它们不拥有客户的数据。它们拥有的是生产数据的能力、工具或者专业知识。数据主要权利在客户手里,它们做的是帮客户把数据生产出来。
从卖货到卖服务
从”卖数据”到”卖能力”,不是换个说法那么简单。这是整个商业模式的重构。
定价方式变了。卖数据是按份收费,一次交易,一锤子买卖。卖能力是按项目或者按月收费,长期合作,持续交付。前者的收入是脉冲式的,后者的收入是持续的。
客户关系变了。卖数据是交易型关系:你买我卖,货讫两清。卖能力是嵌入型关系,服务商的团队和客户的数据团队深度协作,服务商了解客户的模型需求、质量标准、迭代节奏,客户依赖服务商的执行能力和专业知识。前者可以随时替换,后者替换成本很高。
价值主张变了。卖数据的价值主张是”我有你需要的数据”。卖能力的价值主张是”我能按你的标准、在你需要的时候,把你需要的数据生产出来”。前者是产品思维,后者是服务思维。
这个转变不容易。它需要不同的技能(项目管理、客户成功、持续运营,而不只是采集和标注)、不同的定价体系(从按份到按项目/按月)、不同的销售方式(从卖产品到卖解决方案)。很多公司转不过来,不是因为不想转,是因为组织能力和基因不匹配。
但转不过来的代价,就是被市场淘汰。
数据主要权利的时代
这场变化的底层逻辑,是数据主要权利的回归。
在行业早期,数据是一个可以外包的环节。因为所有模型公司的需求差不多,第三方可以规模化生产、标准化交付。但当模型能力开始分化,每个公司的模型需要的数据都不一样了,数据就从”通用商品”变成了”core资产”。
core资产是不能外包的。你可以外包采集的人力、外包现场的运营、外包标注的执行,但你不能外包”什么数据值得采”的判断权、不能外包原始数据的所有权、不能外包”这批数据有没有让模型变好”的反馈权。
这三样东西握在自己手里,数据core就在自己手里。这三样东西交出去,你交出去的就不是一个采购环节,而是模型core的学习闭环。
Figure 看明白了这一点,所以它自建 Index。OpenAI 看明白了这一点,所以它组建 Robotics Data Acquisition。头部公司都在往回收数据主要权利。
这个趋势一旦开始,就不会回头。因为数据主要权利一旦收回来,就没有理由再放出去。
AperData的选择
在这个大背景下,AperData 的选择是:不做数据的所有者,做数据基础设施的提供者。
从任务下发、多设备采集、现场质量检查,到数据处理、开放接口和私有化部署,AperData 帮客户把自己的数据标准稳定地执行下去,再根据模型反馈持续迭代。软硬一体解决的是”数据能不能稳定采集、处理和使用”的问题,中立开放解决的是”客户敢不敢长期接入、数据是否可控、未来能不能自由迁移”的问题。
core逻辑很简单:数据主要权利在客户手里,基础设施交给专业的人。客户决定采什么数据、用什么标准、怎么反馈。AperData 确保客户能把这些决定高效、稳定、低成本地执行下去。
这不是一个退而求其次的定位。这是数据主要权利时代里,第三方公司合理的定位——不跟客户抢数据所有权,而是帮客户把数据生产的能力建起来。
“我采数据,然后卖给你” 这个模式,正在成为过去式。
Figure 没有发明这个趋势,它只是把这个趋势摆到了台面上,让所有人都无法忽视。当一家头部公司公开说”第三方数据达不到要求”,然后砸10亿美元自建的时候,整个行业都得重新想想自己的生意该怎么做。
第三方数据公司不会消失。数据生产的规模只会越来越大,需要的人、设备、场景、运营只会越来越多。但”卖数据”的公司会越来越少,”卖能力”的公司会越来越多。
因为在数据主要权力的时代,没有人愿意把自己的core资产从别人手里买。他们想自己拥有。他们只是需要有人帮他们把它生产出来。
能帮他们生产出来的,活下来。还在想着把数据卖给他们的,会越来越难。
免责声明: 本文为广告商业稿件,内容仅供参考,并不代表本网站赞同其观点。其原创性以及文中陈述文字和内容未经本网站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本网站不承担此类作品侵权行为的直接责任及连带责任。如若本网站有任何内容侵犯您的权益,请及时联系我们。
