利用物理环境数据训练人工智能世界模型,能够提升其在机器人等技术领域的现实应用能力。
人工智能领域的一种持续性趋势可能会对该技术在科学研究中的应用方式产生深远的影响。
诸如大语言模型等机器学习系统能够将提示词转化为文本、图像和视频,这些系统正变得日益复杂,并在包括科学在内的各个领域持续取得令人瞩目的进展。然而,此类“生成式人工智能”工具也存在局限性。这种方法并非总能对物理世界做出准确的预测。例如,在模拟汽车冲出悬崖边缘的后果时,它可能无法正确建模。这将对开发高效且安全的人工智能驱动型机器人以及自动驾驶汽车产生重要的影响。
部分研究人员已将注意力转向一种不同类型的人工智能工具,开发名为“世界模型”的系统,这些系统基于现实世界数据进行训练,能够体现交互式的三维虚拟环境。这些研究人员里还包括创立了巴黎先进机器智能实验室(AMI Labs)的计算机科学家兼人工智能先驱杨立昆。
该方法正在吸引巨额投资和商业兴趣。AMI Labs在世界模型领域采取激进路线,已募集到超过10亿美元的资金,创下了欧洲公司初次注资的历史纪录。谷歌和英伟达等科技巨头以及其他数家初创公司也在着手开发世界模型。
世界模型是什么?
世界模型存在数种定义。从最广泛的意义上讲,任何基于现实世界(甚至某个平行宇宙)数据训练的神经网络,其内部都嵌入了某种形式的世界模型。但在过去约两年的时间里,许多研究人员开始使用此术语描述一种能够生成可探索且通常可互动的模拟世界的人工智能,这种世界会让人联想到第一人称视角电子游戏。世界模型必须对物理学有足够的“认知”,以理解这样的事:如果用户将一个物体推下桌子,该物体就会下落。
与通过文本提示词生成图像或视频素材相比,世界模型还能为用户提供更具交互性的体验。例如,谷歌DeepMind公司于2025年8月发布的世界模型“精灵”三代(Genie 3),能够利用简单的文本描述生成可以实时探索的照片级逼真环境。
世界模型用什么样的数据进行训练?
构建生成式人工智能系统的公司往往对其“独家秘方”秘而不宣。目前已知的是,交互式世界模型的部分训练数据包括数千小时的现实世界视频,以及经过编程以遵循物理定律的物理环境精确模拟结果。
世界模型能够释放出人工智能的哪些能力?
加拿大不列颠哥伦比亚大学的计算机科学家杰夫 · 克鲁恩(Jeff Clune)表示:“世界模型更令人兴奋的版本是你可以在其中采取行动的那种。”计算机科学家阿纳斯塔西斯 · 格尔马尼迪斯(Anastasis Germanidis)称,此类环境可以作为一个安全的场所,用于训练控制机器人的人工智能系统,并且,与让机器人通过与物理对象交互来学习相比,此类环境能够提供快得多的训练方式。格尔马尼迪斯是位于美国纽约市的初创公司览蔚(Runway)的联合创始人,该初创公司于2025年12月发布了“通用世界模型”一代(GWM-1)。
世界模型将如何为研究人员带来助益?
克鲁恩表示,像Genie 3这样的世界模型可以提供海量的方法训练驱动机器人或自动驾驶汽车的软件。克鲁恩在与DeepMind签约期间参与了Genie 3模型的开发工作。
在科学研究中,诸如自主化学实验室(机器人化学家)等工具,在被部署到真实的实验室之前,可以在世界模型中快速积累数千小时的训练经验。
AMI Labs的方法与其他公司有何不同?
杨立昆的公司正在基于他的联合嵌入预测架构(JEPA)开发世界模型,该架构旨在对世界进行“更高层次”的内部表征。传统的生成式人工智能设计旨在逐像素预测图像帧的外观,而联合嵌入预测架构则会产生更具概念性的预测,例如预测物体的运动如何遵循物理定律,这可以通过少数变量(如物体在空间中的位置和朝向等)来简明地描述物体的运动。
2025年底,杨立昆在美国马萨诸塞州坎布里奇的哈佛大学演讲时表示,与逐像素模型相比,联合嵌入预测架构可以基于更少的变量准确预测行星的运动。
杨立昆表示:“要预测木星在100年后的位置,你不需要知道所有的细节……你只需要6个数字。”
AMI Labs这种更高层次方法的一个潜在优势在于,与典型的高耗能生成式人工智能相比,其运行所需要的计算资源可能更少。克鲁恩补充道:“看到杨立昆正在探索这一方向,我感到很兴奋,因为这是一个非常美妙的想法。”
然而,也有人表示,世界模型体现的大部分进步都可以通过现有的生成式人工智能技术实现,只需通过增加训练量、提升计算能力或两者兼施扩展其规模即可。格尔马尼迪斯表示:“在人工智能的发展史上,一个经久不变的主题是,简单的方法往往更容易扩展规模。”
资料来源Nature
