a16z 播客访谈围绕 World Labs(由李飞飞、Justin Johnson、Ben Mildenhall 等人创立)最新发布的前沿世界模型 Atlas 展开。对深入探讨了空间智能(Spatial Intelligence)、世界模型的本质革新,以及其对 3D 创意产业和机器人领域的颠覆性意义。
一、核心突破:Atlas 与“新视角预测”(New View Prediction)
-从 Next-Token 到 New-View:大语言模型(LLM)基于“下一个词预测”(Next Token Prediction),传统视频生成模型基于“下一帧预测”(Next Frame Prediction)。而 Atlas 提出了一个全新的基础图元(Primitive)——新视角预测(New View Prediction)。
-空间语境(Spatial Context)与真三维接地(Grounded 3D):不同于传统视频生成靠“猜”连贯性(类似拉霸抽奖),Atlas 输入的每张图像都带有精确的 3D 相机位姿(Camera Pose)。模型隐式构建起三维空间语境,用户可以把虚拟相机放置在任意时空坐标点,精确生成该视角下的真实画面。
-生成与重建的统一:历史上计算机视觉将“3D 重建”与“AI 生成”视作两个不同子领域。Atlas 首次将两者统一在同一个模型架构中,既能做到毫米级精准的真实场景复原,又能在此基础上进行外推与创意生成。
二、实用场景与大幅降本(50~100 倍效率提升)
-极稀疏视角重建(Sparse Reconstruction):
以往要对房间做高保真 3D 重建(如 NeRF 或高斯泼溅),需要拍摄上百甚至几百张稠密照片。Atlas 能在输入极少数视角(甚至仅需 3 到 4 张多角度照片)的情况下完成完整房间的精准重建,效率提升 50~100 倍。
-日常设备实现电影级“子弹时间”(Bullet Time):
经典电影《黑客帝国》的子弹时间需要在绿幕摄影棚中架设上百台精密校准的摄像机。而 Atlas 只需 3 台普通 iPhone 架在三脚架上同时拍摄(如投篮或草莓掉进牛奶的动态瞬间),即可通过新视角插值自由冻结时间、任意穿梭运镜。
-摆脱单一表征瓶颈:
团队的第一代产品 Marble 主要依赖 3D 高斯泼溅(Gaussian Splats)。Atlas 进行了底层架构重构,将“新视角预测”作
 
 
Back to Top