【李飞飞World Labs发新作:Atlas到底有多厉害?】(2—2)
三、它的边界在哪:别神话
Atlas很强,但远不是成熟的通用世界模拟器。
1. "看得越多,想象越少":
单张照片能生成航拍视角,但画面里大部分内容是模型靠先验知识"想象"出来的。World Labs的案例显示:只给一张花园照片,生成的航拍视角里花园还原准确,周边房屋全是编的;加到第三张图,整个场景才对上
2. 物理模拟能力待验证:
擅长构建几何连贯的静态空间,但对物体碰撞、复杂动力学的通用物理模拟能力仍待验证3. 长路径可能漂移:随着生成路径变长,可能出现局部几何漂移或纹理闪烁
4. 未公开关键数据:
World Labs尚未公布参数量、训练数据规模、scaling曲线,也没有推理成本和延迟数据
5. 暂未开源:
Atlas目前仅向少数合作伙伴开放早期访问申请,后续将驱动Marble及World Labs的其他产品
四、为什么是李飞飞:空间智能这步棋
World Labs 2024年以2.3亿美元融资走出隐身模式,2026年2月又完成10亿美元新融资,Autodesk投资2亿美元,AMD、英伟达、Fidelity等参与。
李飞飞的判断很明确:
语言模型让机器学会了处理"文字",下一步要让AI真正理解"空间"。没有空间智能,就无法谈AGI。
Atlas的意义,英伟达机器人主管Jim Fan的评价是:
机器人领域"Real-to-Sim的一大步"。李飞飞本人则称其为"迄今为止最优秀的相机控制世界模型,为从视觉特效到机器人等众多应用场景打开了大门"。
落到具体场景:
- 影视/VFX:几张照片还原3D空间,创作者像导演一样精准控制每一个镜头
- 机器人:解决真实数据匮乏难题,仿真训练后迁移到现实世界
- 游戏/AR/VR:以往需要昂贵设备扫描的场景,未来仅凭几张随手拍的照片就能在电脑里重建
五、写在最后
Atlas不是又一个Sora,它想做的是AI理解三维世界的"地基"。
它把文本、图像、视频、3D、相机位姿、深度图统一进同一个空间上下文,用一个模型同时承担渲染器和模拟器的部分工作。
这一步如果走通,影响的不只是内容创作,而是整个物理AI和具身智能的底座。
但也要冷静:
Atlas目前仍是早期访问状态,参数量、训练规模、推理成本都未公开,通用物理模拟能力待验证,长路径生成的稳定性也有疑问。
💡 更准确的描述是:
Atlas是空间智能这条路上一块重要的里程碑,而不是终点。它证明了"统一世界模型"的方向可行,但离李飞飞设想中的完整空间智能,还有距离。
接下来值得盯的不是"Atlas能不能生成更炫的视频",而是:
它驱动的Marble产品什么时候向大众开放,以及机器人仿真这条线能不能跑出真实世界的成功案例。
(收藏订阅:第四纪冰川时代 AI)智联此刻 ► 预见未来 ► 伴你摘星
百鲜惠客生态链原生态食材提供者© xianxianV1 版权所有 · 保留所有权利CC BY-NC-ND 4.0
