什么是UniWorld-View
由兔展智能联合北京大学、鹏城实验室推出的 UniWorld-View,是一款开源世界模型,并登上李飞飞团队 WorldScore 世界模型评测榜单首位。它能以单张图片或一段视频为基础,沿指定相机轨迹生成新视角画面,通过统一架构实现单图 3D 生成和视频 4D 生成。目前模型已适配国产昇腾算力,代码与权重全部开源。
![]()
UniWorld-View具备的主要功能
- 合成单图新视角:推、拉、摇、移及360°环绕均受支持;系统依据指定相机路径,把输入的单张图片转为多视角画面。
- 合成动态视频新视角:新视角动态视频在保持时序一致性的同时完成生成,其未拍摄空间由输入的单目视频推断。
- 统一式生成框架:静态图像和动态视频的新视角生成任务,可由同一套模型与代码共同支持。
- 控制相机轨迹:能够精确控制相机位姿,并完成大基线视角切换。
UniWorld-View采用的技术原理
- 感知遮挡的点云渲染:双重投影与法向过滤机制被提出,用于处理背面漏光以及点云渲染时前景背景撕裂的问题。
- Double-Reprojection所指的是双重投影:源画面先被投影到目标视角,再沿原路径回投;不能回返的像素会被判定为遮挡区域,并逐帧累积成遮挡 mask,以免错误纹理干扰生成模型。
- Normal-Filtering所指的是法向过滤:借助法向信息过滤背面点云,避免相机移动至物体背后时,正面像素发生穿透泄漏。
- 融合几何与生成:相机控制精度与画面质量得以兼顾:目标视角条件图由几何模型借助构建的3D点云渲染,再交给视频扩散模型生成。
![]()
微信关注后回复“开源”,即可加入AI开源项目交流群
UniWorld-View如何使用
- 准备环境:Python环境配置及依赖安装完成前,需先把GitHub仓库克隆下来。
- 下载模型:下载开源权重时,来源可选GitHub Release或Hugging Face。
- 输入数据:目标相机轨迹需要定义,源素材则准备为一段视频或单张图片。
- 执行推理:指定视角的新画面或视频会由模型自动生成,触发方式是执行推理脚本。
- 部署昇腾:采用国产算力的情况下,昇腾NPU适配及推理加速需依照官方文档完成。
UniWorld-View项目地址
- GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
- HuggingFace模型库:https://huggingface.co/Drexubery/UniView
同类竞品与UniWorld-View对照
对比维度 | UniWorld-View | WorldScape-0.2(MoE) | WorldScore 总分动态76.23略高,其余维度落后;静态85.53、相机控制97.72、3D一致性91.63则均为第一
技术方案MoE架构生成路线视频扩散模型+遮挡感知点云渲染
开源状态代码和权重全部开源,尚未明确全部开源
国产计算能力已经适配昇腾,未提到相关信息
任务统一程度一个模型涵盖单图 3D 和视频 4D,侧重世界生成
UniWorld-View适用场景
- 影视和广告制作:实拍与三维重建成本可因场景多机位预览的快速生成而降低。
- 虚拟现实和游戏:可交互的360°环绕场景,其生成依据为视频或单张概念图。
- 机器人和自动驾驶仿真:生成真实世界的新视角数据,为视觉感知与路径规划模型提供训练数据。
- 数字化文化遗产:通过单图/单视频方式采集文物或古建筑,再生成环绕视角的数字化展示。
- 电商和房地产:用户沉浸感借助多角度展示内容得到提升,而内容来源是房间视频或单张商品图。