UniWorld-View是什么
UniWorld-View 是兔展智能联合北京大学、鹏城实验室推出的开源世界模型,登顶李飞飞团队 WorldScore 世界模型评测榜单。模型基于单张图片或一段视频,可按指定相机轨迹生成新视角画面,实现单图 3D 生成与视频 4D 生成的统一架构,已完成国产昇腾算力适配,代码与权重均开源。
阅读目录

UniWorld-View的主要功能
-
单图新视角合成:输入单张图片,按指定相机路径生成多视角画面,支持推、拉、摇、移及 360° 环绕。
-
动态视频新视角合成:输入单目视频,推断未拍摄空间并生成新视角动态视频,保持时序一致性。
-
统一生成框架:同一套模型与代码同时支持静态图像与动态视频的新视角生成任务。
-
相机轨迹控制:支持精确的相机位姿控制,实现大基线视角切换。
UniWorld-View的技术原理
-
遮挡感知点云渲染:针对点云渲染中前景背景撕裂与背面漏光问题,提出双重投影与法向过滤机制。
-
双重投影(Double-Reprojection):将源画面投影至目标视角后原路回投,无法回返的像素即为被遮挡区域,逐帧累积为遮挡 mask,避免错误纹理误导生成模型。
-
法向过滤(Normal-Filtering):用法向信息剔除背面点云,防止相机绕至物体背后时正面像素穿透泄漏。
-
几何与生成融合:先用几何模型构建 3D 点云并渲染目标视角条件图,再输入视频扩散模型完成生成,兼顾相机控制精度与画面质量。

微信关注回复“开源”,加入AI开源项目交流群
如何使用UniWorld-View
-
环境准备:克隆 GitHub 仓库,配置 Python 环境并安装依赖。
-
模型下载:从 Hugging Face 或 GitHub Release 下载开源权重。
-
数据输入:准备单张图片或一段视频作为源素材,并定义目标相机轨迹。
-
运行推理:执行推理脚本,模型将自动生成指定视角的新画面或视频。
-
昇腾部署:如需国产算力,按官方文档完成昇腾 NPU 适配与推理加速。
UniWorld-View的项目地址
- GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
- HuggingFace模型库:https://huggingface.co/Drexubery/UniView
UniWorld-View的同类竞品对比
| 维度 | UniWorld-View | WorldScape-0.2(MoE) |
|---|---|---|
| WorldScore 总分 | 多项第一(静态 85.53 / 相机控制 97.72 / 3D 一致性 91.63) | 动态 76.23 略高,其余维度落后 |
| 技术路线 | 遮挡感知点云渲染 + 视频扩散模型 | MoE 架构生成路线 |
| 开源情况 | 代码与权重全开源 | 未明确全开源 |
| 国产算力 | 已适配昇腾 | 未提及 |
| 任务统一性 | 单模型覆盖单图 3D 与视频 4D | 专注世界生成 |
UniWorld-View的应用场景
-
影视与广告制作:快速生成场景的多机位预览,降低实拍与三维重建成本。
-
虚拟现实与游戏:基于单张概念图或视频生成可交互的 360° 环绕场景。
-
机器人与自动驾驶仿真:构建真实世界的新视角数据,用于训练视觉感知与路径规划模型。
-
文化遗产数字化:对文物或古建筑进行单图/单视频采集后,生成环绕视角的数字化展示。
-
电商与房地产:通过单张商品图或房间视频,生成多角度展示内容,提升用户沉浸感。
