爱科技、爱创意、爱折腾、爱极致,我们都是技术控
您需要 登录 才可以下载或查看,没有账号?立即注册
x
“AI 教母”李飞飞的创企 World Labs 今日发布了“全球首个多模态世界模型”—— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。 World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。 通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧。 Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。 Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。 具体来看,Atlas 能够执行涵盖世界生成、重建和模拟的广泛任务: - 相机控制生成:Atlas 通过像素精确的相机控制从一张或多张图像生成图像和视频,输出最长 1 分钟的 1440p 视频。
- 空间重建:Atlas 能够重建从一张到数十张输入图像的真实场景。它既能从新颖视角生成图像帧,也能生成显式三维输出,优于专门用于三维重建的先进模型。
- 时空模拟:Atlas 通过输入视频建模空间和时间,重新构图视频以增强戏剧性视觉效果,并支持机器人的真实到模拟工作流程。
- 图像生成:Atlas 支持从文本生成图像和 360 度全景,它可以跟随复杂的提示,渲染文本,并生成各种视觉风格。
World Labs 官方表示,部分合作伙伴已获得 Atlas 抢先体验资格,将在未来几周内开放早期访问。
|