人工智能先驱李飞飞联合创立的 World Labs 今日正式发布了代号为“Atlas”的 AI 系统,该模型被宣称为世界上首个真正意义上的多模态世界模型。Atlas 与当前主流的视频生成模型存在本质区别:它不再将视频视为一串连续的像素点,而是将其视为一个真实存在的 3D 空间。该模型在底层设计上原生支持文本、图像、视频、相机位姿以及 3D 深度信息的综合处理。这种技术路径赋予了模型构建具备几何一致性场景的能力,使其能够生成符合物理规律的 3D 画面,而不仅仅是插值生成的 2D 纹理。这一发布标志着生成式 AI 领域从单纯的内容生成向物理世界模拟迈出了关键一步,对于推动具身智能、机器人视觉以及下一代虚拟现实技术的发展具有里程碑意义。
事件分析
此次发布的 Atlas 核心技术看点在于将 2D 视频流升维至 3D 几何空间,通过引入相机位姿和深度信息,解决了当前视频生成模型普遍存在的物理不一致性问题,如物体穿模或透视错误。产业层面上,真正的“世界模型”是实现具身智能的必要基础设施,Atlas 的出现为机器人在真实环境中的感知与规划提供了训练底座,有望加速自动驾驶和高级人形机器人的研发进程。这标志着 AI 竞争已从语言理解和大参数量比拼,转向对物理世界动态、高精度的模拟能力。
核心观点:生成式AI从“画图”进化到“造世界”,Atlas为具身智能补全了物理感知拼图。
原文链接:Linux.do