世界模型,为什么一定要是人类眼中的世界?
下一代 AI 的互联网,可能不在互联网里
具身智能系列 · 第 04 篇
今天谈 World Model,我们有一个非常自然的习惯。
输入摄像头,输入视频,让模型学习物体、空间和运动,然后我们说:模型正在理解世界。
这句话自然得几乎不会有人怀疑。
可如果稍微停一下,会发现里面藏着一个很奇怪的问题:
为什么摄像头看到的东西,就等于世界?
摄像头首先看到的只是可见光,而且还只是经过镜头、曝光、分辨率、帧率和视角裁剪以后的一小部分可见光。我们之所以很少觉得这里有什么问题,只是因为人本来就是一种高度依赖视觉的动物。
于是人类看见的世界,不知不觉被我们当成了:
世界本身。
一、语言可以天然以人为中心,世界不行
这是 Language Model 和 World Model 一个非常重要的区别。
大语言模型学习的是人类语言。中文是人说的,英语是人说的,论文、代码、小说和论坛也都是人留下来的。
所以 LLM 以人为中心,没有任何问题。
它本来就在学习:
人类怎样描述世界。
可物理世界不是人造出来的。
重力在人出现以前就在。
红外辐射不会因为人的眼睛看不见,就失去存在资格。
磁场不会因为我们走在街上感觉不到,就变成一种次要现实。
空气中的化学信息,也不会因为人类鼻子远不如狗灵敏,就不属于世界。
所以:
语言天然属于人类,世界却不属于人类。
如果所谓 World Model 最终只是越来越精确地复制人类视觉所能获得的现实,那它当然很有价值,只是更准确的名字也许应该叫:
Human-Visual World Model。
二、没有视觉,不等于没有世界
动物早就给了我们非常直观的证据。
一些长期生活在洞穴中的鱼类视觉高度退化,却依然能够导航、觅食和避障,因为它们会依赖水流、压力、化学和触觉等其他信号。
对人来说,一块石头首先意味着形状、颜色、纹理和轮廓;对一条高度依赖水流感知的鱼来说,同一块石头可能首先意味着:
附近的水流发生了这种变化。
石头没有变。
变的是读取石头的身体。
弱电鱼更有意思。它们会主动产生微弱电场,再感知周围物体如何扰动这个电场。
人进入房间,会说:
“我看见了房间。”
弱电鱼的经验却更接近:
我感受到自己产生的场,被周围世界怎样扭曲。
它不需要先生成一张 RGB 图,也依然可以知道前面有东西。
这时候再回头看今天所谓的 World Model,问题就变得很有意思:
我们究竟是在训练机器理解世界,
还是在训练机器拥有一双越来越像人的眼睛?
三、世界模型可能不是世界的副本,而是身体对现实的压缩
我们很容易想象,大脑或者模型内部有一个缩小版的现实世界,物体、位置和状态都被忠实地复制进去。
可一个生物根本没有必要恢复宇宙里的全部变量。
它真正需要知道的是:
什么信息和自己的行动有关。
这也是为什么“椅子”这个看似非常客观的概念,仔细看其实已经偷偷放进了人的身体。
为什么这堆木头叫椅子?
因为人可以坐。
对于猫,同样的东西还可以跳上去、躲到下面、磨爪,或者作为跳向柜子的中间平台;对于一个很小的昆虫,完整的“椅子”甚至可能根本不是一个有意义的整体,它面对的是若干表面、边缘和可攀爬路线;对于一台轮式机器人,它首先可能只是一个障碍物和绕行边界。
于是我们以为自己在描述一个客观世界,仔细一看:
里面到处藏着人的身体。
所以 World Model 也许从来都不是关于“世界是什么”,而是关于:
对于这副身体,世界意味着什么。
四、那为什么机器人还要做人形?
因为这是另一个完全不同的问题。
人形机器人之所以有意义,并不是因为人的身体是宇宙里最完美的机械结构,而是因为我们过去几千年已经围绕人的身体建成了一整套文明。
门把手有人的高度。
楼梯按照人的腿设计。
剪刀、螺丝刀、电钻、方向盘和键盘都默认使用者拥有人的手。
厨房、仓库、办公桌和工厂工位同样如此。
如果未来机器人想直接进入现有家庭、办公室和工厂,做人形有一个极其现实的优势:
不需要把整个人类文明重新装修一遍。
所以人形,本质上更像一种 Physical API。
它是为了兼容人类世界现有的工具接口。
五、人的形状,是接口,不是认知边界
这件事特别重要。
机器人拥有人的手,是因为要拿人的工具;拥有两条腿,是因为楼梯和建筑按照人的身体设计;身高接近人,也是因为桌面、门和货架都有人的尺度。
可从这里完全推不出:
机器人应该只有人的感官。
更推不出:
它应该像人一样理解世界。
我甚至觉得未来最合理的人形机器人恰恰应该是:
人的形状,非人的感知。
它的身体和人类文明兼容,内部世界却完全不必受人的生理结构限制。
六、真正的 Super Man,不是力气比人大一点
想象一台人形机器人。
它和人差不多高,有两只手,可以打开我们的门,使用我们的电钻,坐进我们的车辆,拿起我们已经存在的工具。
但它同时拥有 RGB、红外、深度、毫米波雷达、超声、触觉、力觉、气体传感、温度和振动,甚至以后还有今天人类尚未发明的新型传感器。
这才是真正有意思的“super man”。
不是一个铁做的人。
而是:
它拥有人类的工具接口,却不必只有人类的感官带宽。
人的手让它进入人类社会。
非人的感知让它超出人的世界。
一句话:
人形是为了兼容人类文明,不是为了把机器锁在人类感官里。
七、机器甚至可能拥有我们无法直觉理解的世界
未来机器人长期运行以后,完全可能形成一些人类没有自然语言名字的内部概念。
例如它同时融合地面纹理、湿度、材料温度、脚底振动和负载状态,最终形成一种非常稳定的“危险地面状态”。
人类要解释这个状态,也许得写一整段文字。
机器内部根本不需要。
一个 latent 就够了。
我们不会要求弱电鱼先把自己的电感知翻译成 JPEG,才承认它理解了环境。那为什么要求机器内部的现实,必须先翻译成人类可以直觉理解的东西,才有资格叫 World Model?
未来真正强大的机器人,可能既会说中文,也会理解“杯子”和“椅子”,因为它需要和我们沟通;同时,它内部又拥有大量我们完全没有对应感官的状态。
人类语言可以是 UI。
人的形状也可以是 UI。
真正的机器内部,并不需要像人。
八、动物真正给机器的启示,是别把人类感官当成世界的 API
从这个角度看,动物真正有价值的地方也发生了变化。
问题不再只是:
动物数据能不能帮助机器人训练?
更大的问题是:
为什么不同物种生活在同一个物理世界里,却可以依靠完全不同的感知方式完成复杂行为?
狗依赖气味。
蝙蝠利用回声。
弱电鱼利用电场。
不同动物对热、紫外和磁场的感知也与人不同。
机器当然不需要复制这些动物的器官。飞机也没有羽毛。
真正值得复制的是:
能力背后的信息结构。
于是动物甚至可以成为一种 Sensor Discovery System。几十亿年的进化,已经替我们跑过很多“这个世界到底还有什么值得测量”的实验。
我们未必要抄自然的答案。
但至少可以看看它选了哪些题。
九、真正通用的机器人,可能长得像人,却绝不是另一个人
这也是人形机器人最容易被误解的地方。
它长成人形,并不是为了复制人。
人形只是兼容层。
它让机器人能够继承人类几千年积累下来的工具世界,而不是要求机器拥有一个缩小版的人类心智。
真正有意思的未来也许恰恰相反:
机器可以使用人的世界,却不必被人的世界限制。
人的形状让它继承我们的文明。
机器自己的感官,让它看到那些我们从来没有能力看到的东西。
所以我们过去总问:
机器什么时候能像人一样理解世界?
也许问题本身就问错了。
真正通用的具身智能,不应该拥有一个缩小版的人类世界,而应该形成一个真正属于自己的现实。
大语言模型学习的是:
人类怎样描述世界。
具身智能真正要学习的是:
世界怎样作用于一个身体。
语言天然属于人类。
世界从来没有属于人类。
思考与探讨
如果未来的机器人看到的世界全是一串串高维电磁波与触觉力场,我们人类真的有必要强迫它渲染成人类看得懂的彩色 RGB 画面吗?欢迎在评论区分享你的观点。
本文收录于《具身智能:物理世界的下一代互联网》系列专栏(第 4 篇 / 共 6 篇)。






