World Labs正式发布Atlas,这是一个旨在实现“空间智能”的下一代全能世界模型。Atlas采用多模态自回归扩散Transformer架构,能够原生处理文本、图像、视频及3D数据。其核心突破在于将所有输入锚定在3D空间上下文中,从而实现了像素级精度的摄像机控制生成(最高1440p分辨率1分钟视频)、从单张或少量图像进行高保真3D场景重建,以及面向机器人的时空物理模拟。基准测试表明,在相机控制生成和3D重建任务上,Atlas的表现优于现有的Gemini、FLUX等专用模型。该模型的发布标志着通用人工智能向理解和模拟物理三维世界迈出了重要一步,将广泛应用于影视特效、游戏开发及机器人仿真训练等领域。
事件分析
核心观点:Atlas通过原生3D空间上下文技术,实现了AI从“平面内容生成”向“物理世界模拟”的本质跨越。
原文链接:Hacker News

评论前必须登录!
立即登录 注册