登录

相机


分类

轨迹

地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。
文章

技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。
文章

模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。
文章

状态

这意味着Puffin-World不仅能够生成质量较高的图像,还能让生成画面准确服从指定的相机状态。
文章

横滚角

模型先从参考图像中精确理解相机的横滚角、俯仰角和视场角,再通过物理传播机制,将参考视角中的重力信息传递至后续视角。
文章

方向

除文字描述外,用户还可以明确指定相机方向和视场角。
文章

当前

模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。
文章

姿态

Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。
文章

相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演WorldActionModel(WAM)角色。
文章

信息

世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。
文章

为统一绝对方向和跨视角运动,Puffin-World提出Omni-Camera相机表示,将重力锚定的绝对相机信息与基于射线的相对几何结合起来。
文章