任意一张照片,就可以生成可以闲逛的3D世界。听起来像科幻作家的幻想,但随着AI技术发(fā)展(zhǎn),已(yǐ)经成为触手可及的现实。
12月3日,斯坦福大学教授李飞飞宣布,她带领的World Labs团队推出了一张图片便能生成3D世界的AI系统,他们将该系统命名为“大型世界模型”(Large World Model, LWM),称自己为空间智能AI公司。模型一经推出就受到全球网友关注,有人表示,现实版的盗梦空间来了!

World Labs 官网截图
在已经开放的即时演示中,用户可以在浏览器上直接操控,感受World Labs塑造的世界。如输入一张博物馆取景照片,AI会帮你设想出入门,下一间相邻的展馆、展品;输入世界名画《夜晚露天咖啡座》,就可以走进画中,感受完整的街区环境……
那么,“大型世界模型”有何不同?具体应用场景有哪些?又将给AI的发展带来怎样的影响?
一张图,生成3D世界
“还是比较惊喜的。此前Sora本身也有点模拟世界的‘味道’,但‘大型世界模型’是另外一种技术路线,整体上行业觉得超出预期。”中国AIGC产业联盟研究院院长、无界AI联合创始人马千里表示。
“大型世(shì)界(jiè)模(mó)型(xíng)”可(kě)以(yǐ)简(jiǎn)单(dān)视(shì)为(wèi)人(rén)工(gōng)智(zhì)能(néng)形(xíng)成(chéng)虚(xū)拟(nǐ)世(shì)界(jiè)的(de)工(gōng)具(jù):用(yòng)户(hù)只(zhǐ)需(xū)上(shàng)传(chuán)一(yī)张(zhāng)图(tú)片(piàn),系(xì)统(tǒng)便(biàn)能(néng)根(gēn)据(jù)这(zhè)张(zhāng)图(tú)片(piàn)中(zhōng)的(de)环(huán)境(jìng)信(xìn)息(xi),自(zì)动(dòng)生(shēng)成(chéng)一(yī)个相应范围内的3D虚拟世界。
此(cǐ)外(wài),用(yòng)户(hù)可(kě)直(zhí)接(jiē)在(zài)网(wǎng)页(yè)端(duān),通(tōng)过(guò)鼠(shǔ)标(biāo)或(huò)键盘(pán),轻(qīng)松(sōng)浏(liú)览(lǎn)这(zhè)个(gè)3D世(shì)界(jiè)。而(ér)且(qiě)生(shēng)成(chéng)的(de)3D世(shì)界(jiè)具(jù)有(yǒu)交(jiāo)互(hù)性(xìng),用(yòng)户(hù)能(néng)够(gòu)像(xiàng)玩(wán)游(yóu)戏(xì)那(nà)样(yàng),自(zì)由(yóu)地(de)移(yí)动(dòng)相(xiāng)机(jī),来探索这个3D世界,景深、变焦等操作均可行。
“交互性实际上是通过键盘的输入或鼠标移动,向AI输入指令,它会根据指令,实时渲染生成相应的场景,而在此之前,大家所看(kàn)到(dào)的3D场景都是由人工预先构建好的。”浙江大学博士生导师朱霖潮解释道。
此次“大型世界模型”让人惊艳的是,遵循了3D几何物理基本规则,具有真实的深度感和空(kōng)间(jiān)感。
在马千里看(kàn)来(lái),3D几(jǐ)何(hé)物(wù)理(lǐ)基(jī)本(běn)规(guī)则(zé)的(de)遵(zūn)循(xún),是(shì)AI模(mó)型(xíng)在(zài)大(dà)量(liàng)的(de)3D数(shù)据(jù)训(xun)练(liàn)后(hòu),对(duì)图(tú)像(xiàng)内(nèi)容(róng)达(dá)成(chéng)了(le)充(chōng)分(fēn)理(lǐ)解(jiě),这(zhè)体(tǐ)现(xiàn)了(le)AI对(duì)现(xiàn)实(shí)世(shì)界(jiè)的(de)理(lǐ)解(jiě)更(gèng)进(jìn)一步。
但在遵循现实世界物理规则上,朱霖潮也表示,“大型世界模型”距离实际应用还有一定的距离。“虽然声称(chēng)引(yǐn)入(rù)一(yī)些(xiē)物(wù)理(lǐ)机(jī)理(lǐ),但(dàn)如(rú)何(hé)生(shēng)成(chéng)更(gèng)遵(zūn)循(xún)物(wù)理(lǐ)基(jī)本(běn)原(yuán)则(zé)的(de)技(jì)术(shù)细(xì)节(jié)尚(shàng)未(wèi)披(pī)露(lù),在(zài)某(mǒu)些(xiē)场(chǎng)景(jǐng)上(shàng),也(yě)出(chū)现(xiàn)渲(xuàn)染(rǎn)错(cuò)误(wù),比(bǐ)如(rú)不同的物体以不自然的方式融合,成为了一团色块。”
不过,据了解,World Labs表示这些只是“早期预览”,他们正在努力提升生成世界的规模和真实度,并探索新的交互方式。
世界生成模型的应用场景广泛
在3D生成赛道,World Labs并不是第一个“吃螃蟹的人”。此前,英伟达、Meta等多家公司也在积极布局物理(lǐ)AI与(yǔ)3D世界的相关技术,市场竞争激烈。
在国内,也有不少企业加入其(qí)中(zhōng)。以(yǐ)无(wú)界(jiè)AI为(wèi)例(lì),企(qǐ)业产品“魔镜”也是利用AI生成3D产品。用户在浏览器上,只要输入一张照片,“魔镜”就可以根据(jù)照(zhào)片(piàn)上(shàng)的(de)人(rén)物(wù),形(xíng)成(chéng)相(xiāng)对(duì)应(yīng)的(de)3D模(mó)型(xíng),最(zuì)终(zhōng)可(kě)制(zhì)作(zuò)成(chéng)手(shǒu)办(bàn)模(mó)型(xíng)。
工(gōng)具(jù)的(de)革(gé)(gé)新(xīn)(xīn),应(yīng)(yīng)用(yòng)(yòng)场(chǎng)(chǎng)景(jǐng)(jǐng)的(de)(de)落(luò)(luò)地(de)(de)是(shì)大(dà)部(bù)分(fēn)人(rén)关心(xīn)的(de)问(wèn)题(tí)。
World Labs在(zài)官(guān)博(bó)中(zhōng)表(biǎo)示(shì),他(tā)们(men)计(jì)划(huà)构(gòu)建(jiàn)对(duì)艺(yì)术(shù)家(jiā)、设(shè)计(jì)师(shī)、开(kāi)发(fā)人(rén)员(yuán)、电(diàn)影(yǐng)制(zhì)片(piàn)人(rén)和(hé)工(gōng)程(chéng)师(shī)等(děng)专(zhuān)业(yè)人(rén)士(shì)有(yǒu)用的工具。允许任何人想象和创造自己的世界,将生成性人工智能的潜力从 2D 图像和视频扩展到3D世界。
“像‘大型世界模型’这类AI模型的出现,未来也许能够很好地填充VR世界里的数字空间。”马千里解释道,VR里的数字空间建设成本非常高,开发的周期也比较慢,这类工具的出现,将会使得数字空间的建模成本降低,并且能(néng)够(gòu)根(gēn)据(jù)需(xū)求(qiú),迅(xùn)速(sù)构(gòu)建(jiàn)出(chū)虚(xū)拟(nǐ)世(shì)界(jiè)场(chǎng)景(jǐng),这(zhè)意(yì)味元宇宙将离人们越来越近。
李飞飞的博士生、World Labs联合创始人(rén)贾(jiǎ)斯(sī)汀(tīng)•约(yuē)翰(hàn)逊(xùn)则(zé)在社交媒体上指出,随(suí)着(zhe)这项技术的成熟,未来我们可能不再需要使用手机、平板等不同尺寸的屏幕。他表示,如果你能够将虚拟内容与物理世界无缝融合,那么对所有这些屏幕的需求就会减少。
空间智能时代已经到来
两(liǎng)年前,ChatGPT惊艳发布,从此生成式AI一路狂奔,从平面图像和文本处理,迈向对三维世界的理解。从文生智能到空间智能,生成式的AI正在以极快地速度认知人类的物理世界。
“大型世界模型”的出(chū)现(xiàn),也(yě)正(zhèng)是(shì)空(kōng)间(jiān)智能的一次实际展示。
李飞飞对空间智能的定义是:空间智能是机器在3D空间和时间中感知、推理和行动的能力。在她看来,空间智能是AI领域的下一(yī)个前沿技术方向。
今年9月,在接受媒体访谈时,李飞飞表示,空间智能是她的下一个北极(jí)星(xīng),该(gāi)技(jì)术(shù)将(jiāng)改(gǎi)变(biàn)AI的(de)发(fā)展(zhǎn)进(jìn)程(chéng)。她(tā)认(rèn)为(wèi),空(kōng)间(jiān)智(zhì)能(néng)与(yǔ)语(yǔ)言(yán)智(zhì)能(néng)一(yī)样(yàng)重(zhòng)要(yào),甚(shén)至(zhì)在(zài)某(mǒu)些(xiē)方(fāng)面(miàn)可(kě)能(néng)更(gèng)古(gǔ)老(lǎo)、更(gèng)基(jī)础(chǔ),AI的(de)发(fā)展(zhǎn)不(bù)会局限于处理平面图像或文本,而是会迈向对三维世界的理解,这是智能发展的自然延伸。
那么,由World Labs开启的空间智能AI,未来对AI发展的影响如何?
朱霖潮表示,人在处理信息过程中,主要还是以视觉信息为主,这样的大模型的出现,可以让更多人去关注视觉模型,包括如何构建一个更好的3D环境,实现符合物理的运动,这些都可能吸引更多的人去往这个领域。
“当前AI投入太大了,方向很重要,这样的AI技术被验证后,那么企业就敢下注赛道,进而促进产业的发展。”马千里说道。
如今,单个图像生成3D世界模型,让我们对空间智能有了初步的理解。未来(lái),或(huò)许(xǔ)还(hái)有(yǒu)更(gèng)多(duō)大(dà)模(mó)型(xíng)的(de)出(chū)现(xiàn)。随(suí)着(zhe)AI算(suàn)法(fǎ)的(de)不(bù)断(duàn)优(yōu)化(huà),和(hé)硬(yìng)件(jiàn)设备的升级,空间智能将进一步突破现有的技术边界,也许就成为人类生活方式转型的重要驱动力。
大胆想象一下,再加上时间维度,训练成功的话,也许AI真(zhēn)的(de)可(kě)以通晓古今,预测未来?
