
“自动驾驶汽车在上路前,会在虚拟空间中进行大量的行驶测试”,你是否听说过这样的说法?
雨天、夜间、前车急刹车、突然有人横穿马路……这些现实中危险难以测试的场景,都可以在虚拟空间中重现,用来训练AI。
基于这种技术,近年来备受关注的“世界基盘模型(World Foundation Model)”应运而生,尤其在机器人和自动驾驶领域表现突出。
在之前的连载【第17回】中,我们介绍了能够在现实世界中行动的AI——“物理AI”。世界基盘模型则被期待作为这类AI预测“在某种情况下采取某种动作后,接下来会发生什么”的关键技术。
“世界模型”与“世界基盘模型”的区别
“世界模型(World Model)”是一个较为宽泛的概念,指AI对周围环境状态及其变化进行建模,并预测“采取某个行为后会发生什么”的机制,这在强化学习等领域已有较长时间的研究。
而“世界基盘模型”则结合了近年来兴起的“基盘模型”理念,通过大量视频、3D数据等,学习可应用于多种场景的世界表达和变化,是一种大规模模型。
预测的不是“语言的延续”,而是“世界的延续”
在连载【第4回】中介绍的LLM(大规模语言模型)通过学习大量文本,预测输入文本后续的词语,从而生成文章。
相比之下,世界基盘模型预测的是“世界的延续”。
例如,当汽车以某速度行驶并转动方向盘时会发生什么,机器人推动箱子后如何移动,物体从手中释放后会怎样变化……它基于视频和传感器信息,预测随时间推移世界的变化。
这类似于人类在实际操作前,脑中想象“如果放开这个杯子,它会掉下来”。
不过,这并非AI掌握了物理定律的数学公式,而是通过大量数据学习现实世界变化的模式。
在“脑内小世界”中训练机器人
这项技术在机器人和自动驾驶领域尤为重要。
昂贵的机器人无法在现实中反复摔倒测试,自动驾驶汽车也难以多次模拟危险临界事故场景。
因此,构建接近现实的虚拟世界,让AI反复试错成为关键。
“这样迈步会摔倒。”
“用这种力量抓取物体会滑落。”
“在这种情况下应该踩刹车。”

通过在模拟环境中积累经验后,AI才能更安全地应用于现实。
此外,还能模拟现实中罕见的危险场景,比如“黄昏暴雨中突然冲出的自行车”,用于训练AI应对极端情况。
从“屏幕内的AI”走向现实世界
目前,以NVIDIA为代表的企业在自动驾驶和机器人领域积极开展世界模型与世界基盘模型的研发。
生成AI生成文本或图像时,出现错误可以重新生成;但机器人或汽车的AI一旦失误,可能导致事故。
因此,在现实行动前,能在“脑内小世界”反复测试至关重要。
如果说【第17回】介绍的物理AI是拥有现实行动“身体”的AI,那么世界基盘模型就是帮助该AI预测“未来世界如何变化”的脑内练习场,这样理解会更清晰。


