新闻中心

大语言模型火爆的今天,我们为什么还要拥抱世界模型?

发布时间:2025-04-13 07:31:46  /  浏览次数:470 次

【导语】图灵奖得主杨立昆指出,当前AI界热捧的大语言模型存在四大难以突破的弱点,其中之一便是对物理世界的理解。为解决这一难题,“世界模型”技术应运而生。世界模型通过深度分析现实世界视频,使机器能够像人类一样理解物理空间、规律,并进行推理决策。从理论构想到实践落地,世界模型在游戏、自动驾驶、天气预报等领域展现出巨大潜力,成为探索人工智能通用智能(AGI)核心架构的重要路径。然而,世界模型仍面临算力、泛化能力、数据规模等挑战。尽管如此,作为深度学习之外的探索道路,世界模型为AI的发展提供了更多可能性。

图灵奖得主杨立昆认为,目前AI界持续追捧的大语言模型并非十全十美,它隐藏着四个难以突破的致命弱点:一是理解物理世界,二是拥有持久记忆,三是具备推理能力,四是复杂规划能力。

而能够克服第一个“致命弱点”的技术,叫作世界模型。

这听起来或许很抽象,但你一定知道谷歌的3D游戏、特斯拉的自动驾驶。

世界模型意味着机器能够像人一样辨别物理空间、理解物理规律、根据经验做出推理决策。

与大语言模型不同的是,世界模型不再遵循从海量文本语料生成概率的逻辑,而是在深度分析大规模现实世界视频后推测因果。

就像人类世界的婴儿一样,在交互学习中构建对这个世界的认知。

想象一个刚出生的婴儿,她的眼睛尚未完全聚焦,却能通过触摸、温度、声音的碎片拼凑出世界的轮廓。人类大脑用数百万年进化出这种能力——将感官信息转化为对物理规律的理解。

而这恰是今天人工智能所欠缺的,世界模型正在努力发展的——从数据中重构对重力、时间等知识的理解。

世界模型的概念最早可追溯至1980s到1990s的认知科学和控制理论,那时的研究者受心理学影响,提出AI系统需要构建对环境的内部模拟,从而进行预测和决策,即AI的环境建模能力。

这里有一个重要的要素:环境。

从生物学上来讲,不论是微生物、动物还是人,行为都遵循着一个最基本的规则:刺激-反应模式,即生物反应是对环境刺激的直接响应。

随着生物千亿年漫长的进化,动物发展出感觉和心理,通过视觉、听觉、嗅觉等感官感知外界,产生出兴奋、恐惧等简单情绪;人类进一步发展出自我意识,而人类意识和动物感觉最大的区别是能否自主规划、有目的地进行决策和行动。

拿生物进化过程和AI的发展历程相比,我们不难发现,其实AI的终极形态AGI就是要发展出自主感知现实、自我规划、有目的决策的能力。

世界模型的雏形就萌芽于心理学家对人类和动物认知理解世界并做出决策的观察。这个理论叫作心智模型,1990年由David Rumelhart提出,强调智能体需对环境形成抽象表征。

以我们自身举例,人类大脑对周围世界有一种习得的内在认知框架,根据经验做决策,如看到乌云就联想到下雨。再比如,我们不会记住每片树叶的形状,却能瞬间判断树枝能否承受体重。同理,世界模型就是让机器构建起对周围环境和世界的理解和预测能力,比如看到火就联想到烫伤。这种抽象能力,正是这一时期学者希望机器具有的禀赋。

但是,这阶段的世界模型研究停留在理论构想阶段,虽有(yǒu)了(le)较(jiào)为(wèi)清(qīng)晰(xī)的(de)定(dìng)义(yì)和(hé)目(mù)标(biāo),仍(réng)没(méi)有(yǒu)具(jù)体(tǐ)的(de)技(jì)术(shù)路径。

世(shì)界(jiè)模(mó)型(xíng)研(yán)究(jiū)开(kāi)始(shǐ)落(luò)地(de)是(shì)2000s到(dào)2010s的(de)计(jì)算(suàn)建(jiàn)模(mó)阶(jiē)段(duàn),随(suí)着(zhe)强化学习和深度学习的深入发展,学者开始尝试用神经网络构建可训练的世界模型。

强化学习通过奖惩机制让其在与环境交互过程中不断习得策略,类似于“训狗”,深度学习通过分层特(tè)征(zhēng)提(tí)取(qǔ)让(ràng)其(qí)从(cóng)海(hǎi)量(liàng)数(shù)据(jù)中(zhōng)自(zì)动(dòng)学(xué)习(xí)规(guī)律(lǜ),类(lèi)似(shì)于(yú)“炼(liàn)金(jīn)”。

2018年(nián),DeepMind 《World Models》(Ha & Schmidhuber)论(lùn)文首(shǒu)次(cì)用(yòng)“VAE+RNN+控(kòng)制(zhì)器(qì)”的(de)三(sān)段(duàn)式(shì)架(jià)构(gòu),构(gòu)建(jiàn)可(kě)预(yù)测(cè)环境的神经网络模型,成为现代世界模型的里程碑。

这一过程类似于“造梦”——先通过自动编码器VAE将现实场景压缩成数据,再利用RNN循环神经网络推演未来可能的情节,最后用精简的控制器指导行动。这意味着世界模型首次具备了颅内推演的能力,像人类一样在行动前预判后果,大大降低了试错成本。

2022年后,世界模型进入大模型时代,借助Transformer的序列建模能力和多模态学习技术,应用范围从单一模态扩展到跨模态仿真,世界模型的推演也从2D走向3D(如OpenAI的GATO、DeepMind的Genie)。

近期研究如Meta的VC-1、Google的PaLM-E进一步将世界模型的概念带入公众视野,将世界模型与大语言模型结合以实现更通用的环境推理成为一种技术发展路径。

Google的PaLM-E(5620亿参数)模型成功将语言模型与视觉、传感器数据等物理世界信息结合,机器人能够理解复杂指令(如“捡起掉落的锤子”)并适应新环境执行任务。Meta Llama系列的开源多模态框架(如MultiPLY)进一步促进了对物理环境的3D感知研究。

由上,从概念推演到落地实践,世界模型在发展中逐步摸索,渐渐走出一条从混沌到清明的路。

Transformer架构的进化、多模态数据的爆发,让世界模型走出训练场,走进游戏场,再(zài)走(zǒu)向(xiàng)真(zhēn)实(shí)世(shì)界(jiè)——谷(gǔ)歌(gē)、腾(téng)讯(xùn)通(tōng)过(guò)其(qí)生(shēng)成(chéng)逼(bī)真(zhēn)的(de)游(yóu)戏(xì)场(chǎng)景(jǐng),特(tè)斯(sī)拉(lā)用(yòng)神(shén)经(jīng)网(wǎng)络(luò)预(yù)测(cè)车(chē)辆(liàng)轨(guǐ)迹(jī),DeepMind通(tōng)过(guò)建(jiàn)模(mó)预(yù)测(cè)全球(qiú)天(tiān)气(qì)。

就(jiù)这(zhè)样(yàng),在(zài)实(shí)验(yàn)室(shì)中(zhōng)蹒(pán)跚(shān)学(xué)步(bù)的(de)世(shì)界(jiè)模(mó)型(xíng)开(kāi)始(shǐ)了(le)他(tā)对(duì)现(xiàn)实(shí)物(wù)理(lǐ)规(guī)律(lǜ)的(de)探(tàn)索(suǒ)之(zhī)路。

就(jiù)像(xiàng)人(rén)类(lèi)幼(yòu)年(nián)通(tōng)过(guò)游(yóu)戏(xì)感(gǎn)受(shòu)规(guī)则(zé)完(wán)成(chéng)社(shè)会(huì)化(huà)一(yī)样(yàng),世(shì)界(jiè)模(mó)型(xíng)的(de)第(dì)一(yī)关也(yě)是(shì)游(yóu)戏(xì)。

初(chū)期(qī)的(de)模(mó)型(xíng)应(yīng)用(yòng)仰(yǎng)赖(lài)规(guī)则(zé)明(míng)确(què)的(de)虚(xū)拟(nǐ)环(huán)境(jìng)和(hé)边(biān)界(jiè)清(qīng)晰(xī)的(de)离(lí)散(sàn)空(kōng)间(jiān),如(rú)Atari游(yóu)戏(xì)(DQN)、星(xīng)际(jì)争(zhēng)霸(bà)(AlphaStar),采用(yòng)表(biǎo)格(gé)型(xíng)模(mó)型(xíng)(如(rú)Dyna),后(hòu)期(qī)结(jié)合(hé)CNN/RNN处(chù)理(lǐ)图(tú)像(xiàng)输(shū)入(rù)。

进(jìn)化(huà)至(zhì)3D版(bǎn)后(hòu),谷(gǔ)歌(gē)DeepMind的(de)Genie 2可(kě)通(tōng)过(guò)单(dān)张(zhāng)图(tú)片(piàn)生(shēng)成(chéng)可(kě)交(jiāo)互(hù)的(de)无(wú)限(xiàn)3D世(shì)界(jiè),时(shí)长(zhǎng)达(dá)1min,用(yòng)户(hù)可(kě)自(zì)由(yóu)探(tàn)索(suǒ)动(dòng)态(tài)环(huán)境(jìng)(如(rú)地(de)形(xíng)变(biàn)化(huà)、物(wù)体(tǐ)互(hù)动)。由腾讯、港科大、中国科大联合推出的GameGen-O模型可一键生成西部牛仔、魔法师、驯兽师等游戏角色,还能以更高保真度、更复杂的物理效果生成海啸、龙卷风、激光等各种场景。

经过大量训练后,世(shì)界(jiè)模(mó)型(xíng)由(yóu)游(yóu)戏(xì)过(guò)渡(dù)到(dào)工(gōng)业(yè)场(chǎng)景(jǐng)。

游(yóu)戏(xì)引(yǐn)擎(qíng)的核心能力在于构(gòu)建(jiàn)高(gāo)保(bǎo)真(zhēn)、可(kě)交(jiāo)互(hù)的(de)3D虚(xū)拟(nǐ)环(huán)境(jìng)。这(zhè)种(zhǒng)能(néng)力(lì)被(bèi)直(zhí)接(jiē)迁(qiān)移(yí)到(dào)工(gōng)业(yè)场(chǎng)景(jǐng)中(zhōng),用(yòng)于(yú)模(mó)拟(nǐ)工(gōng)业(yè)场(chǎng)景(jǐng)中(zhōng)各(gè)种(zhǒng)可(kě)能(néng)出(chū)现(xiàn)故(gù)障(zhàng)的(de)复(fù)杂(zá)场景。

机器人公司波士顿动力在虚拟环境中预演机器人动作(如摔倒恢复),再迁移到实体机器;特斯拉2023年提出的世界模型直接整合了游戏引擎的仿真技术,利用合成数据训练自动驾驶系统,减少对真实路测数据的依赖;蔚来的智能世界模型能够在极短时间内推演数百种可能情境并做好预案和决策。

最近,世界模型还走进了基础研究领域。

DeepMind的GraphCast靠世界模型处理百万级网格气象变量,预测天气能力比传统数值模拟快1000倍,能耗降低1000倍。它通过图神经网络架构,能够直接从历史再分析数据中学习天气系统的复杂动力学,精准、高效预测全球天气。

从游戏般的虚拟场景到自动驾驶等现实场景,世界模型的本质是通过大量多模态资料理解物理世界的规律。未来,“世界模型+大语言模型”可能成为AGI的核心架构,让AI不仅能聊天,还能真正理解并做出决策改变现实世界。

不过,我们为何需要世界模型?在大语言模型火爆全球的今天,是什么让其显得不可替代呢?

让AI真正从模仿表征到感知本质,克服其各种恐怖谷效应的关键是:让它真正理解这个世界,了解现实空间和物理规律,进而理解它为什么会做这件事,而不是机械地根据海量数据的关联概率推测下一个token是什么。

这是基于大规模文本语料的大语言模型和不断试错优化寻找最优路径的强化学习做不到的,只有世界模型能做到。

传统AI是数据驱动型的被动反应系统,而世界模型通过构建内部虚拟环境理解了物理、碰撞等现实规律,能够像人类一样通过想象预演行动后果,并在游戏、机器人等领域共享底层推理算力。

首先是通过底层建模和多模态整合构建出跟人类一样的心智模型。外部,世界模型不仅模拟物理规律,还试图理解社会规则和生物行为,从而在复杂场景中趋利避害。内部,世界模型根据感知、预测、规划和学习的协同,形成类似人类心智的时空认知能力。

其次是因果预测和反事实推理能力。世界模型(xíng)能(néng)够(gòu)基(jī)于(yú)当(dāng)前(qián)状(zhuàng)态(tài)和(hé)行(xíng)动(dòng),预(yù)测(cè)未(wèi)来(lái)的(de)演(yǎn)变(biàn)结(jié)果(guǒ)。其(qí)具(jù)备(bèi)类(lèi)似(shì)人(rén)类(lèi)的(de)常(cháng)识(shi)库(kù),能(néng)填(tián)补缺失信息并进行反事实推理(what if),即使未直接观察某事件,也能推断“如果采取不同行动会如何”。这种能力使其在数据稀缺时仍能有效决策,减少对海量标注数据的依赖,在自动驾驶领域应用较多。

最后,世界模型通过自监督学习构建对世界的通用表征,获得了跨任务、跨场景的泛化能力,而传统模型通常需针对特定领域的具体任务微调。

但是,这些能力,为什么火极一时的大语言模型做不到呢?

要弄清为什么世界模型的预测能力和大语言模型的推测token能力不一样,我们需要弄清一个概念:相关性≠因果性。前者是概率关联、后者是因果推理。

大语言模型(如GPT系列)侧重于大数据驱动的自回归学习,通过海量文本数据训练模型以生成文本,本质是预测概率,而世界模型学派认为自回归的Transformer无法通往AGI。AI需要具备真正的常识性理解能力,这些能力只能通过深度分析大量照片、音视频等多模态数据对世界的内在表征来获得。

模型结构层面,大语言模型主要依赖Transformer架构,通过自注意力机制处理文本序列。世界模型则包含多个模块,如配置器、感知、世界模型、角色等,能够估计世界状态、预测变化、寻找最优方案。

通俗地讲,大语言模型训练出的文本天才是纸上谈兵的文将,对常识可能一窍不通。而世界模型更像在建模环境里身经百战的武将,可以凭直觉和经验预判对手如何出招。

世界模型虽前景可期,目前依然面临着一些瓶颈。

算力上,训练世界模型所需要的计算资源远超大语言模型,且存在“幻觉”(错误预测)问题;泛化能力上,如何平衡模型复杂度与跨场景适应性仍需突破;训练集上,多模态的数据规模更少,且需深度标注,质量把关是重中之重。

如果说类似GPT一样的大语言模型已经到了能言善辩的青春期,世界模型实则还处于牙牙学语的幼年期。

总的来讲,世界模型是深度学习之外的另一条探索道路。如果未来深度学习陷入发展瓶颈,世界模型可能是一种备选方案。但现阶段,世界模型仍在探索期,我们仍要将主心骨放在大语言模型和深度学习这条技术线上。

多点发力,协同并进,才能让AI的成长有更多道路可走。