数据很多,不等于数据能用——谁来给物理世界“炼油”?
下一代 AI 的互联网,可能不在互联网里
具身智能系列 · 第 03 篇
互联网早期有一种很朴素的想象:网页既然已经在那里,搜索应该不是太难。
后来才发现,网页越多,问题反而越复杂。真正值钱的并不是“世界上有很多网页”,而是谁能把它们抓下来、去重、索引、排序、过滤垃圾,再在用户真正需要的时候,从几十亿个页面里找到最有价值的十个。
物理世界的数据可能正走到类似的阶段。
摄像头很多,视频很多,机器人日志越来越多,汽车也每天产生巨量传感器记录。可这些东西躺在硬盘里,并不会自动变成 Intelligence。
从现实发生,到模型真正学会,中间还缺一条完整的工业链。
我越来越愿意把它叫作:
Physical Data Refinery——现实世界的数据炼油厂。
一、一万小时录像,首先不是一万小时知识
假设一个摄像头对着仓库拍一天,绝大多数时间可能什么值得注意的事情都没有发生。墙没有动,货架没有动,箱子也没有动。
真正有信息量的可能只有几十个瞬间:有人移动托盘,推车和人互相避让,一个箱子掉下来,有人第一次抓取失败以后重新调整,一条通道突然被堵住。
所以真正的数据加工,第一步甚至不是标注,而是:
决定哪一分钟现实值得被记住。
这就是 Event Mining。
传统监控希望最好什么事情都没有发生,AI 数据系统却需要从“几乎什么都没有发生”的漫长时间里,把真正的状态变化捞出来。
因此现实视频最重要的第一轮压缩,不一定是把 10GB 压成 5GB,而是把二十四小时现实压缩成几十分钟真正有训练价值的变化。
二、“只保存有用的东西”又是一句危险的话
因为谁知道什么有用?
今天的模型可能认为一个人抓杯子时小拇指滑了一下毫无价值,五年后的灵巧手系统却可能发现,这正是抓取失稳最重要的前兆之一。
如果今天为了省硬盘把原始录像彻底删除,未来再强的模型也无法穿越时间,把没有留下来的信息重新拍一遍。
所以物理数据最终一定会面对一个现实矛盾:全部保存太贵,只保留今天认为有用的东西又太短视。
真正合理的方式大概不是二选一,而是分层记忆。
大量普通原始数据只短期保存,稀有事件和高价值交互保留更久,真正昂贵的多模态同步数据尽可能完整留下,同时再长期保存轨迹、事件和各种成本更低的机器表示。
未来的数据系统真正不断回答的问题,不再是“删还是不删”,而是:
这一段现实,值得以什么精度保存多久?
三、原始记录是证据,标签只是某一代模型的解释
这一点尤其重要。
假设有一段 2020 年的工厂录像,2026 年的模型看它,也许只能说:“一个人拿起了箱子。”
到了 2030 年,更强的模型重新处理同一段录像,可能会发现第一次抓握位置不稳定,箱体发生轻微旋转,随后右手重新调整接触点。再过几年,也许还能恢复更细的三维状态和动作细节。
所以“标注完成”这件事,未来可能会变得越来越模糊。
原始视频没有改变。
改变的是我们解释它的能力。
因此未来最有价值的数据资产,未必是一批已经标完的数据,而是一批可以不断被更强模型重新理解的原始证据。
原始记录是证据,标签只是某一代模型对证据的解释。
传统数据集像一本已经写好的教科书,现实世界原始数据更像考古遗址,工具越好,同一块地里还能继续挖出新的东西。
四、标注也会从“人给模型打工”变成“模型给模型打工”
视频如果全部靠人工标注,很快就会崩掉。
一分钟视频有几千帧,不仅要知道里面有什么,还要知道这个人是不是上一帧那个人,这个杯子去了哪里,交互什么时候开始、什么时候结束,动作到底成功还是失败。
如果全部依赖人工逐帧解释,本质上又回到了:
雇人重新解释整个现实世界。
真正可扩展的方法一定是让模型先处理绝大多数简单情况。
自动检测、分割、跟踪、姿态估计、轨迹抽取、事件分类,再由更强的模型生成初步解释,不同模型之间互相校验。高置信度数据自动进入训练池,真正需要人看的,是那些模型分歧最大、最稀有、最有价值的部分。
人工标注会从“流水线工人”变成“质量控制”。
人真正值得花时间处理的,是:
模型不知道自己知不知道的地方。
五、最难标注的,从来不是“发生了什么”
一个人走到门口,停下来,转身,离开。
这些都很好标。
可他为什么离开?
可能外面下雨,可能忘了手机,可能有人叫他,也可能根本没准备出门。
视频通常留下行为,却没有留下原因。
这也是为什么未来最危险的自动标注错误,未必是模型说得不流畅,恰恰可能是它说得太流畅。一句“这个人发现外面下雨,所以转身回去”,如果镜头里没有任何证据支持,只是一个听起来很合理的故事。
真正好的数据系统,不只是负责生成更多标签。
它还要明确区分:
我看见了什么。
我推断了什么。
我不知道什么。
六、大量数据可以脏,必须有少量数据特别真
因此未来的数据体系不应该追求“把所有东西都精标”。
更现实的结构是一座金字塔。
底部是海量无标签现实数据,中间是模型自己生产的大量伪标签,再往上是少量多模态 Grounding 数据,最顶部则是极少量真正昂贵、真正精确的 Gold Data。
这批 Gold Data 可能同时拥有视频、深度、机器人动作、关节状态、触觉、力觉、环境信息和专家解释。
它不需要像互联网一样巨大。
它更像测量体系里的标准尺。
海量廉价数据负责规模。
少量高质量数据负责告诉整个体系:
到底偏了多少。
七、真正值钱的公司,未必拥有最多视频
未来最有价值的数据公司,甚至可能一台摄像头都不生产。
它真正掌握的是另一套能力:知道什么值得留,什么应该删;知道怎样匿名化,怎样从千万小时视频里挖出真正的事件;知道怎样对齐不同传感器,怎样判断伪标签靠不靠谱,什么时候模型已经不确定到必须让人介入。
它最终能把一千万小时没人看得完的现实记录,变成一亿条真正可以用于训练的物理经验。
这种公司看起来也许不性感,甚至有点像搜索引擎、数据库和炼油厂的混合物。
但技术革命经常如此。
上层 Demo 最容易吸引注意力,真正决定规模的,却往往是下面那些没人愿意拍发布会的基础设施。
思考与探讨
你认为下一代像 Scale AI 那样百亿估值的数据标注公司,会是一家软件公司,还是一家充满机械与传感器的物理重工业公司?欢迎在评论区分享你的观点。
本文收录于《具身智能:物理世界的下一代互联网》系列专栏(第 3 篇 / 共 6 篇)。






