国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

给它一张图,还你整个世界

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源 – 量子位

首页

资讯

智能车

智库

活动

MEET大会

AIGC

扫码关注量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源

思邈

2026-07-24

22:19:06

来源:

量子位

给它一张图,还你整个世界

允中 发自 凹非寺

量子位 | 公众号 QbitAI

李飞飞团队的世界模型榜单,刚刚换了新榜首。

△WorldScore榜单

登顶的是

兔展智能

团队联合北大、鹏城实验室研发的

UniWorld-View(模型已适配国产昇腾算力)

你随手拍一段视频,或者干脆只给一张图,它还你一段“相机轨迹任你指定”的新视角视频——

推、拉、摇、移,甚至“绕着场景360°转一圈”都可以,提供“精确听话的相机位姿控制”。

不管是单图3D生成还是视频4D生成,用的是“同一套代码、同一个模型”。

真·Uni(统一)World-View了,本次世界模型的训练数据来自北大系初创企业

元空智能

,代码和权重也已

全部开源

官方地址:PKU-YuanGroup/UniWorld-View: Official implementation of UniWorld-View

只看正脸,画出后脑勺

先说这事儿为什么难。

新视角合成(Novel View Synthesis),本质上是让AI“脑补”没拍到的角度。

而难点全在“大基线(large-baseline)”三个字上——

说白了就是:

只给AI看正脸,让它画出侧脸,甚至后脑勺。

传统路线NeRF、3DGS,走的是“重建”逻辑:看得越多,建得越好。

可随手拍的单目视频,视角覆盖约等于没有。喂给它们,轻则空洞伪影满天飞,重则直接摆烂。

生成式路线倒是敢画。但大多数方法只是把相机位姿当个“口头指令”(一个抽象的条件向量)塞进扩散模型——

没有显式3D建模,走两步就飘,转大角度直接失控。

于是近两年出现了第三条路:

先用几何模型把画面撑成3D点云,再把目标视角的点云渲染图喂给视频扩散模型当条件。

几何归几何,生成归生成,相机控制一下子准了。ViewCrafter、英伟达GEN3C,走的都是这条路。

但在研发过程中,团队发现,这条路上藏着一个大家都踩过、却没人认真填的坑。

点云渲染,会“穿帮”

坑就出在点云渲染这一步。

点云是一堆孤立的点:既不知道谁跟谁相连,也不知道哪面朝外。

视角一转大,渲染图会出现两种经典穿帮:

一是

前景背景撕裂

深度边界处没有连接信息,视角一变,前景纹理就像口香糖一样被扯到背景上,或者背景像素直接糊到前景脸上。

二是

背面漏光

点云没有“面”的概念,不会自动遮挡。相机绕到物体背后,正面的点会直接透过来,相当于隔着后脑勺,看到了一张脸。

小幅度换视角时,这些穿帮不明显,生成模型还能糊弄过去。

可一旦上了大基线,条件图里全是错误几何信号,扩散模型直接被带偏:结构扭曲、伪影乱飞。

UniWorld-View的第一板斧,就砍向这里——“遮挡感知点云渲染”(Occlusion-aware Point Cloud Rendering)。

第一招:

双重投影(Double-Reprojection),专治撕裂。

△遮挡感知点云渲染:解决前景背景撕裂

把源画面投影到目标视角,再原路投影回来。

来回一倒腾,凡是“回不来”的像素,就是会被遮挡的区域。

把这些区域沿相机轨迹逐帧累积成遮挡mask,渲染时直接挖掉——该是洞的地方就老老实实留洞,交给生成模型去补,而不是留一堆错误纹理误导它。

第二招:

法向过滤,专治背面漏光。

△法线过滤点云渲染:解决背面漏光

给每个点估计法向量,和视线方向算个夹角:背对相机的点,直接踢出渲染。

两招下来,条件图里的错误信号清零,剩下的全是可靠几何+明确的待补区域。

双分支架构,一个管构图,一个管上色

几何理顺了,还剩第二个矛盾:

点云渲染图“位置对,但内容缺”;源视频“内容全,但位置不对”。

怎么让生成结果既贴合目标视角,又和原视频长得一模一样?

UniWorld-View的答案是

“双流条件注入”

“几何流”:点云渲染图+mask,编码后加到潜变量上,负责把生成内容死死钉在3D结构上;

“外观流”:源视频走新设计的“Ref-DiT模块”——新视角特征当Query,源视频特征当Key/Value做cross-attention,让模型自己去原视频里”翻素材”,哪儿缺补哪儿,连点云伪影造成的糊纹理都能顺手修掉。

一个管构图,一个管上色,分工明确。

△模型框架图

4D重建

更进一步:既然能任意换机位,那多换几个机位,“单目视频不就变成多视角视频了”?

多视角视频一到手,4D重建(动态3DGS)就从不可能任务变成了常规操作。

这里还有个巧思。常规生成式方法的相机是“边走边拍”,空间变换和时间推进耦合在一起,视角在4D空间里分布极不均匀。

UniWorld-View直接把两者解耦,分两步走:

“先拍定妆照”

:把时间冻结在第一帧,绕场生成一圈静态环绕视图,当整个场景的外观锚点;

“再开机拍动态”

:在固定机位上生成同步多视角视频,每个机位的第一帧用“定妆照”对齐,前景的自遮挡靠迭代生成逐步补全。

生成多视角视频后,喂给4DGS优化,就得到了最终的4D场景。

单目随手拍→可自由视角漫游的4D场景,一条龙打通。

兔展智能由北京大学校友与北京大学视觉领域青年领军人才联合创立,公司专注

视觉AI大模型研发

,拥有世界一流的基于视觉大模型的多模态大模型底层自研技术,是国内视觉AI大模型领域代表企业。

公司自主研发

Open-Sora Plan、UniWorld

等系列视觉AI模型,其中Open-Sora Plan是行业首个开源文生视频模型,2024年代码引用量位居全球第一;UniWorld视觉大模型率先探索理解与生成统一架构。

其中,2025年,兔展智能发布的

UniWorld-V2

理解与生成统一架构的视觉大模型,早于NanoBanana3个月发布,引领理解生成一体化新方向;

2026年4月,兔展智能发布

UniWorld-V2.5

,不仅与GPT-Image-2同周发布,而且在InfoGraph、图文交错、文字密集等场景上也对齐GPT-Image-2的生成能力。

在持续推进视觉AI大模型技术演进的同时,兔展智能正加快推进UniWorld的大模型能力产品化,近期将推出产模一体设计生产工具

RabbitVis

,进一步推动视觉AI进入商业设计工作流。

版权所有,未经授权不得以任何形式转载及使用,违者必究。

世界模型

兔展智能

北大

李飞飞

思邈

合肥又押中AI独角兽:多模态赛道,3个月融了21亿

2026-07-24

上海这场大赛有点“野”:让AI自主科研、控核聚变、认甲骨文

2026-07-23

美图拿出1亿元,面向全行业寻找AI影像Builder

2026-07-23

逛完WAIC 2026我悟了:国产AI芯片的真对手,根本不是英伟达的GPU

2026-07-18

扫码分享至朋友圈

相关阅读

狂揽F轮融资+拿下4100万用户!深圳玩家出手,把企业旧系统变成AI能力库

一个AI统一入口,搞定所有

邓思邈

2026-05-22

Agent中间层

SkillsUI

兔展智能

谷歌邀马斯克联手做AI游戏!DeepMind版Sora是个3D游戏引擎 profile-avatar

这个大佬们都在押注的方向,真的要火了~

梦晨

2024-12-05

世界模型

谢赛宁李飞飞LeCun搞的寒武纪,究竟是个啥?

不造芯片造“超感知”

闻乐

2025-11-24

LeCun

李飞飞

谢赛宁

训练世界模型,开始从人类的肌肉和脑子里偷师了

具身智能数采迎来了新范式

邓思邈

2026-07-02

FaceMind

世界模型

具身智能

脸谱心智

李飞飞最新长文火爆硅谷

从文字到世界:空间智能是AI的下一个前沿

henry

2025-11-14

李飞飞

一个模型通杀8大视觉任务,一句话生成图像、视频、P图、视频处理...都能行

MSRA&北大出品

白交

2021-11-27

北大

多模态预训练模型

微软亚洲研究院

热门文章

妙啊!无人机直连卫星传Token

2026-07-18

看了20万小时「人类干活实录」,机器人悟了

2026-07-19

不同模型厂同一家Agentic Infra,AGI时代的地基终于浮出水面

2026-07-20

WAIC 2026收官|范式大会亮点集锦,见证AI 2.0从技术突破走向产业实践

2026-07-20

当AI进入最依赖“人”的行业:一家四线城市康复机构利润增长40%

2026-07-20

关于量子位

加入我们

寻求报道

商务合作

扫码关注量子位

追踪人工智能新趋势,报道科技行业新突破

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司

京ICP备17005886号-1


本文来源:量子位