AI科普:AI教母李飞飞推出的世界模型Atlas有何独特之处?
一句话概括:Atlas并非“更聪慧的语言模型”,而是一款力图借助像素与三维坐标来认知世界的“空间大脑”,它意味着AI从“理解符号”迈向“理解物理世界”的范式跃迁。
你可以设想两种截然不同的天才:
传统大语言模型(例如GPT-4、Gemini),犹如一位饱读诗书、知识渊博的“语言大师”。他能领会你用文字描绘的巍峨城堡,并凭借自身学识,创作出一篇有关城堡的华美散文。但他从未目睹过真实的城堡,也不清楚石头应当怎样堆砌。
Atlas,则好似一位与生俱来的“空间营造师”。你递给他几张不同视角的城堡照片,他就能在脑海里搭建起整座城堡的3D模型。他不仅能描述城堡的样貌,还能引领你“踏入”城堡,从任意你指定的角度去端详它。
两者的本质差异在于:前者处理的是符号(文字),习得的是文本的统计规律;而后者处理的是像素与体素(三维空间的基础单元),习得的是物理世界的时空法则。
Atlas之所以能够实现这些,归因于它在底层架构上就与传统模型大相径庭。
它的核心科技是“多模态自回归扩散Transformer”。你可以将其视作一个汇聚了三大能力的“超级引擎”:
多模态 (Multimodal) 的“原生空间感知”:传统模型解析图片,是将图片“转译”成文字再加以理解。而Atlas原生处理文本、图像、视频、相机位姿(Camera Pose)与3D深度图(Depth Map)。它直接将每张图片定位在一张三维地图上,这代表着它天生就知晓“这张照片是从哪个方位、哪个视角拍摄的”。这是达成精准视角调控的根基。
自回归 (Autoregressive) 的“序列产出”:如同GPT预测下一个词汇一般,Atlas预测的是下一个“空间元素”。该元素可以是下一个像素、下一帧画面,甚至是一个3D坐标。这让它能够依据既有的“空间上下文”(比如一张图片及其位置),逐步构建出完整的3D世界。
扩散 (Diffusion) 的“高维创作”:这是当下生成高清图片与视频的顶尖方法之一。Atlas借助逐步“去噪”的手段,从一片朦胧中“显影”出精细的、高分辨率的(1440p)图像与视频。
这三者融合,使Atlas能够“正反”双向认知世界:赋予它一个3D位置,它能产出该位置的画面;给予它几张不同视角的照片,它又能反向推演出背后的3D结构。
简而言之:多模态大模型是把“图像”转译成“文字”来理解;而Atlas是把“图像”置于“三维空间”里来理解。视频生成模型是“产出画面”,而Atlas是“构建一个可进入、可操控的世界”。
Atlas的亮相,昭示着“世界模型”已成为AI巨头们的新战场。各家都在以自身的路径押注这个方向:
AI的“牛顿时代”正徐徐开启:Atlas彰显了AI从研习“语言统计学”到研习“物理学”的转变。它使AI开始领悟物体如何存在、空间如何构筑,这是迈向通用人工智能(AGI)的关键一步。
产业化的“奇点”迫近:Atlas最大的价值并非生成酷炫视频,而在于其工业级应用潜能。它有望成为机器人仿真、影视制作、游戏开发与建筑设计等产业的新一代基础设施。
差距在“拉开”,而非“拉大”:于“理解语言”这条路径上,各家差距在收窄。但在“理解物理世界”这条新赛道上,World Labs凭借先发优势与理论高度,已构筑起了显著的领先位置。
对于各异的人群,Atlas的价值各有不同:
Atlas当下仍处于初始阶段,但它无疑开启了一扇通往未来的大门。