下一代 AI 的互联网,可能不在互联网里
具身智能系列 · 第 04 篇

今天谈 World Model,我们有一个非常自然的习惯。

输入摄像头,输入视频,让模型学习物体、空间和运动,然后我们说:模型正在理解世界。

这句话自然得几乎不会有人怀疑。

可如果稍微停一下,会发现里面藏着一个很奇怪的问题:

为什么摄像头看到的东西,就等于世界?

摄像头首先看到的只是可见光,而且还只是经过镜头、曝光、分辨率、帧率和视角裁剪以后的一小部分可见光。我们之所以很少觉得这里有什么问题,只是因为人本来就是一种高度依赖视觉的动物。

于是人类看见的世界,不知不觉被我们当成了:

世界本身。

一、语言可以天然以人为中心,世界不行

这是 Language Model 和 World Model 一个非常重要的区别。

大语言模型学习的是人类语言。中文是人说的,英语是人说的,论文、代码、小说和论坛也都是人留下来的。

所以 LLM 以人为中心,没有任何问题。

它本来就在学习:

人类怎样描述世界。

可物理世界不是人造出来的。

重力在人出现以前就在。

红外辐射不会因为人的眼睛看不见,就失去存在资格。

磁场不会因为我们走在街上感觉不到,就变成一种次要现实。

空气中的化学信息,也不会因为人类鼻子远不如狗灵敏,就不属于世界。

所以:

语言天然属于人类,世界却不属于人类。

如果所谓 World Model 最终只是越来越精确地复制人类视觉所能获得的现实,那它当然很有价值,只是更准确的名字也许应该叫:

Human-Visual World Model。

二、没有视觉,不等于没有世界

动物早就给了我们非常直观的证据。

一些长期生活在洞穴中的鱼类视觉高度退化,却依然能够导航、觅食和避障,因为它们会依赖水流、压力、化学和触觉等其他信号。

对人来说,一块石头首先意味着形状、颜色、纹理和轮廓;对一条高度依赖水流感知的鱼来说,同一块石头可能首先意味着:

附近的水流发生了这种变化。

石头没有变。

变的是读取石头的身体。

弱电鱼更有意思。它们会主动产生微弱电场,再感知周围物体如何扰动这个电场。

人进入房间,会说:

“我看见了房间。”

弱电鱼的经验却更接近:

我感受到自己产生的场,被周围世界怎样扭曲。

它不需要先生成一张 RGB 图,也依然可以知道前面有东西。

这时候再回头看今天所谓的 World Model,问题就变得很有意思:

我们究竟是在训练机器理解世界,

还是在训练机器拥有一双越来越像人的眼睛?

三、世界模型可能不是世界的副本,而是身体对现实的压缩

我们很容易想象,大脑或者模型内部有一个缩小版的现实世界,物体、位置和状态都被忠实地复制进去。

可一个生物根本没有必要恢复宇宙里的全部变量。

它真正需要知道的是:

什么信息和自己的行动有关。

这也是为什么“椅子”这个看似非常客观的概念,仔细看其实已经偷偷放进了人的身体。

为什么这堆木头叫椅子?

因为人可以坐。

对于猫,同样的东西还可以跳上去、躲到下面、磨爪,或者作为跳向柜子的中间平台;对于一个很小的昆虫,完整的“椅子”甚至可能根本不是一个有意义的整体,它面对的是若干表面、边缘和可攀爬路线;对于一台轮式机器人,它首先可能只是一个障碍物和绕行边界。

于是我们以为自己在描述一个客观世界,仔细一看:

里面到处藏着人的身体。

所以 World Model 也许从来都不是关于“世界是什么”,而是关于:

对于这副身体,世界意味着什么。

四、那为什么机器人还要做人形?

因为这是另一个完全不同的问题。

人形机器人之所以有意义,并不是因为人的身体是宇宙里最完美的机械结构,而是因为我们过去几千年已经围绕人的身体建成了一整套文明。

门把手有人的高度。

楼梯按照人的腿设计。

剪刀、螺丝刀、电钻、方向盘和键盘都默认使用者拥有人的手。

厨房、仓库、办公桌和工厂工位同样如此。

如果未来机器人想直接进入现有家庭、办公室和工厂,做人形有一个极其现实的优势:

不需要把整个人类文明重新装修一遍。

所以人形,本质上更像一种 Physical API。

它是为了兼容人类世界现有的工具接口。

五、人的形状,是接口,不是认知边界

这件事特别重要。

机器人拥有人的手,是因为要拿人的工具;拥有两条腿,是因为楼梯和建筑按照人的身体设计;身高接近人,也是因为桌面、门和货架都有人的尺度。

可从这里完全推不出:

机器人应该只有人的感官。

更推不出:

它应该像人一样理解世界。

我甚至觉得未来最合理的人形机器人恰恰应该是:

人的形状,非人的感知。

它的身体和人类文明兼容,内部世界却完全不必受人的生理结构限制。

六、真正的 Super Man,不是力气比人大一点

想象一台人形机器人。

它和人差不多高,有两只手,可以打开我们的门,使用我们的电钻,坐进我们的车辆,拿起我们已经存在的工具。

但它同时拥有 RGB、红外、深度、毫米波雷达、超声、触觉、力觉、气体传感、温度和振动,甚至以后还有今天人类尚未发明的新型传感器。

这才是真正有意思的“super man”。

不是一个铁做的人。

而是:

它拥有人类的工具接口,却不必只有人类的感官带宽。

人的手让它进入人类社会。

非人的感知让它超出人的世界。

一句话:

人形是为了兼容人类文明,不是为了把机器锁在人类感官里。

七、机器甚至可能拥有我们无法直觉理解的世界

未来机器人长期运行以后,完全可能形成一些人类没有自然语言名字的内部概念。

例如它同时融合地面纹理、湿度、材料温度、脚底振动和负载状态,最终形成一种非常稳定的“危险地面状态”。

人类要解释这个状态,也许得写一整段文字。

机器内部根本不需要。

一个 latent 就够了。

我们不会要求弱电鱼先把自己的电感知翻译成 JPEG,才承认它理解了环境。那为什么要求机器内部的现实,必须先翻译成人类可以直觉理解的东西,才有资格叫 World Model?

未来真正强大的机器人,可能既会说中文,也会理解“杯子”和“椅子”,因为它需要和我们沟通;同时,它内部又拥有大量我们完全没有对应感官的状态。

人类语言可以是 UI。

人的形状也可以是 UI。

真正的机器内部,并不需要像人。

八、动物真正给机器的启示,是别把人类感官当成世界的 API

从这个角度看,动物真正有价值的地方也发生了变化。

问题不再只是:

动物数据能不能帮助机器人训练?

更大的问题是:

为什么不同物种生活在同一个物理世界里,却可以依靠完全不同的感知方式完成复杂行为?

狗依赖气味。

蝙蝠利用回声。

弱电鱼利用电场。

不同动物对热、紫外和磁场的感知也与人不同。

机器当然不需要复制这些动物的器官。飞机也没有羽毛。

真正值得复制的是:

能力背后的信息结构。

于是动物甚至可以成为一种 Sensor Discovery System。几十亿年的进化,已经替我们跑过很多“这个世界到底还有什么值得测量”的实验。

我们未必要抄自然的答案。

但至少可以看看它选了哪些题。

九、真正通用的机器人,可能长得像人,却绝不是另一个人

这也是人形机器人最容易被误解的地方。

它长成人形,并不是为了复制人。

人形只是兼容层。

它让机器人能够继承人类几千年积累下来的工具世界,而不是要求机器拥有一个缩小版的人类心智。

真正有意思的未来也许恰恰相反:

机器可以使用人的世界,却不必被人的世界限制。

人的形状让它继承我们的文明。

机器自己的感官,让它看到那些我们从来没有能力看到的东西。

所以我们过去总问:

机器什么时候能像人一样理解世界?

也许问题本身就问错了。

真正通用的具身智能,不应该拥有一个缩小版的人类世界,而应该形成一个真正属于自己的现实。

大语言模型学习的是:

人类怎样描述世界。

具身智能真正要学习的是:

世界怎样作用于一个身体。

语言天然属于人类。

世界从来没有属于人类。


思考与探讨
如果未来的机器人看到的世界全是一串串高维电磁波与触觉力场,我们人类真的有必要强迫它渲染成人类看得懂的彩色 RGB 画面吗?欢迎在评论区分享你的观点。

本文收录于《具身智能:物理世界的下一代互联网》系列专栏(第 4 篇 / 共 6 篇)。