首页
产品服务
智能全文检索引擎
数据挖掘引擎
文字识别系统
智能文档审阅系统
语言处理应用技术
解决方案
按行业
按场景
新闻动态
了解
伙伴
关于我们
联系我们
加入

新闻动态

新闻动态
您的当前位置:首页 • 新闻动态
李飞飞发布全新世界模型,可在单张H100GPU上流畅运行
时间:2025-10-17 14:31:08 浏览:303

【导语】10月16日,“AI教母”李飞飞团队World Labs宣布推出全新实时生成世界模型RTFM,该模型能实时生成视频、将单图渲染成3D场景,且以预览版开放体验。其突破传统,具备高效、可扩展等特性,模糊重建与生成界限,还引入“姿态帧”实现“无限持久性”。World Labs成立仅数月便成(chéng)独(dú)角(jiǎo)兽(shòu),获(huò)巨(jù)额融资与众多AI大咖投资。

10月16日,“AI教母”李飞飞宣布对外推出全新模型RTFM(AReal-TimeFrame Model,实时帧模型)。RTFM是一款全新的实时生成世界模型,能够与用户交互时实时生成视频,并遵循三大核心设计原则:效率、可扩展性、持久性。

RTFM可将单张图像渲染成3D场景,一个模型可处理多种场景类型、视觉(jué)风(fēng)格(gé)和(hé)效(xiào)果,包括反射、光泽表面、阴影和镜头光晕。该模型已以预览版形式开放用户体验。

李飞飞发布全新世界模型,可在单张H100GPU上流畅运(yùn)行

使用 RTFM 渲染的布满阳光的游泳池场景

能在单张H100GPU上运行的“实时世界”

李飞飞团队World Labs表示,强大的世界(jiè)模型将能够实时重建、生成并模拟具有持久性、交互性且物理精度高的虚拟世界。这类模型将彻底改变从媒体到机器人技术乃至更广泛领域的产业格局。

过去一年间,这项新兴技术发展迅猛,生成式视频建模的突破性进展已成功应用于生成式世界建模领域。一个趋势随之逐渐明朗:生成式世界模型的(de)计算需求将远超当前的大型语言模型。

若简单套用现代视频架构,要生成60帧/秒的交互式4K视频流,每秒需要生成超过10万个标记(相当于《科学怪人》或《哈利·波特》第一部的篇幅)。若要让这些生成模型持续运行一小时以上,需处理的上下文token更将超过1亿(yì)。以(yǐ)当(dāng)今(jīn)的计算基础设施来看,这种方案既不可行,也不具备经济可行性。

World Labs认为,在人工智能领域,随着计算能力提升而优雅扩展的简单方法往往占据主导地位,因为这些方法能够受益于推动技术发展数十年的计算成本指数级下降趋势。生成式世界模型完全具备优势,将在未来持续降低的计算成本中获益。

这就引出了一个自然的问题:生成式世界模型是否被当今的硬件限制所阻碍?或者现在是否有方法可以预览这项技术?

于是,李飞飞团队设定了一个简单而明确的目标:设计一个高效且可部署的生成式世界模型,能够随着计算能力提升持续扩展。

他们想要构建一个能在单张H100GPU上运行的模型,既能保持交互帧率,又能确保世界数据在长时间互动后依然完整。实现这些条件能让他们通过当前的体验提前预判未来这些模型可能达成的高度。

这一目标影响了他们从任务设置到模型架构的整个系统架构设计,并通过仔细优化推理堆栈的所有部分,应用架构设计、模型蒸馏和推理优化方面的最新进展,为在当今硬件上运行的未来模型提供最高保真的预览。

李飞飞发布全新世界模型,可在单张H100GPU上流畅运行

RTFM 对地板上的复杂阴影和反射进行建模

从图像到世界:RTFM如何突破生成式建模的边界

扩展性方面,传统3D图形管线依赖人工设计的显式三维模型(如三角网格、高斯贴图)和算法,对几何、材质、光照等进行精确建模,再渲染为二维图像。该方法虽成熟,但在处理大规模数据时扩展性受限。

而RTFM采用了一种基于生成式视频建模的创新方法,其核心是一个经端到端训练的神经网络。它仅输入场景的二维图像,无需构建显式三维模型,即可从新视角生成对应图像。

该技术基于生成式视频建模,训练一个神经网络将输入图像转换为一种隐式的世界表征(KV缓存),进而通过注意力机制直接从该表征中读取信息,来生成新视角下的连贯图像。这意味着复杂的光照、反射等效果并非由人工规则定义,而是通过从数据中学习自(zì)动(dòng)掌(zhǎng)握,从而能够与Marble 实现从单张图像高效创建具有真实感的3D场景。

RTFM还有一个重要特性是模糊了重建与生成的传统界限:当输入视图充足时,系统倾向于精确重建;当输入视图稀疏时,它则能进行合理的内容推演与生成。

李飞飞发布全新世界模型,可在单张H100GPU上流畅运行

使用 RTFM 渲染的户(hù)外(wài)游(yóu)乐(lè)场

另外,现实世界具有持久性:当视线移开时,场景不会消失或重置,人们可以随时返回之前的位置。这一特性对自回归帧模型构成了显著挑战。由于此类模型仅通(tōng)过(guò)二(èr)维(wéi)图(tú)像(xiàng)帧(zhèng)序(xù)列(liè)隐(yǐn)式(shì)地(de)表(biǎo)示(shì)世(shì)界(jiè),随(suí)着(zhe)探(tàn)索(suǒ)范(fàn)围(wéi)扩(kuò)大(dà),需(xū)要(yào)处(chù)理(lǐ)的(de)帧(zhèng)数(shù)量(liàng)持(chí)续(xù)增(zēng)长(zhǎng),导(dǎo)致(zhì)每(měi)一(yī)帧(zhèng)的(de)生(shēng)成(chéng)成(chéng)本(běn)不(bù)断累积,模型的“记忆容量”实际上受限于可用的计算资源。

RTFM通过引入“姿态帧”作为空间记忆,有效突破了这一限制。该方法将每一帧与其在三维空间中的姿态绑定,使模型能够在生成新帧时依据目标姿态从已有的空间记忆中检索邻近帧,构建局部上下文。这种设计为模型提供了一个弱空间先验—即世界处于三维欧氏空间中,而无需显式进行几何重建,既降低了建模复杂度,也增强了对场景结构的理解。

为实现高效运行,RTFM采用了上下文调度机制,在不同空间区域生成图像时动态切换所使用的上下文帧,称为“上下文切换”。这一策略使模型无需在处理新帧时加载全部历史数据,从而支持大规模场景的持久维护,实现所谓“无限持久性”。通过将帧组织为具有空间结构的记忆系统,RTFM在长期交互中能够保持场景(jǐng)一(yī)致(zhì)性(xìng),同(tóng)时(shí)显(xiǎn)著(zhe)提(tí)升(shēng)生(shēng)成(chéng)效(xiào)率(lǜ)和(hé)可(kě)扩(kuò)展(zhǎn)性(xìng)。

World Labs指(zhǐ)出(chū),RTFM展(zhǎn)示(shì)了(le)在(zài)现(xiàn)有(yǒu)硬(yìng)件(jiàn)上(shàng)部(bù)署(shǔ)高(gāo)效(xiào)世(shì)界(jiè)模(mó)型(xíng)的(de)愿(yuàn)景(jǐng),其(qí)技(jì)术(shù)核(hé)心(xīn)是(shì)将(jiāng)世(shì)界(jiè)模(mó)型定义为端到端、数据驱动的渲染器。该框架具备良好的扩展性,未来可模拟动态世界并支持用户交互。当前模型目标是在单张H100GPU上实时运行,而更大规模的模(mó)型(xíng)将(jiāng)持(chí)续(xù)优(yōu)化(huà)性(xìng)能(néng)。

World Labs成(chéng)立(lì)于(yú)今(jīn)年(nián)4月(yuè),在(zài)四(sì)个(gè)月(yuè)内(nèi)从(cóng)创(chuàng)始(shǐ)公(gōng)司(sī)成(chéng)长(zhǎng)为(wèi)独(dú)角(jiǎo)兽(shòu)。去(qù)年(nián)9月(yuè),World Labs正(zhèng)式(shì)宣(xuān)布(bù)完(wán)成(chéng)2.3亿(yì)美(měi)元(yuán)的(de)巨(jù)额(é)融(róng)资(zī),投(tóu)资(zī)方(fāng)包括硅谷知名投资机构a16z、NEA、加拿大风投公司Radical Ventures,以及英伟达公司的风险投资部门等。众多AI领域的知名人士也参与了投资,包括谷歌DeepMind首席科学家杰夫·迪恩(Jeff Dean)和前谷歌AI研究员杰弗里·辛顿(Geoffrey Hinton)。

现在注册,即可免费试用
申请试用