新闻中心

雷涛:未来的AI,需要自主生产数据来训练自己

发布时间:2025-04-08 11:01:55  /  浏览次数:479 次

“我(wǒ)们(men)建(jiàn)设(shè)的(de)各(gè)种(zhǒng)算(suàn)力(lì)基(jī)础(chǔ)设(shè)施(shī),构(gòu)建(jiàn)的(de)庞(páng)大(dà)算(suàn)力(lì),不(bù)能仅仅供给AI企业,更应扩展视野,服务于千行百业。”近日,由北京市科协、北京科技记协组织的“首都科技人”宣传活动中天云数据CEO、第九届吴文俊人工智能科学技术发明奖获得者雷涛如此阐述自己对人工智能所需算力的理解。

雷涛是中国第一代Java开发者之一,20世纪90年代参与制定了存储行业国际标准,2000年,他推动云计算落地,后又带领团队一直深耕数据智能赛道。

坚持“做原创”,开发国产自研数据库

作为IT行业知名数据专家、首批中国计算机学会(CCF)大数据专委会委员,雷涛对于数据的价值有着独到的认识。他(tā)认(rèn)为(wèi),“数(shù)字(zì)经(jīng)济(jì)时(shí)代(dài),我(wǒ)们(men)要(yào)给(gěi)数(shù)据(jù)赋(fù)能(néng),让(ràng)数(shù)据(jù)服(fú)务(wu)大(dà)众(zhòng)。如(rú)何(hé)做(zuò)到(dào)这(zhè)一(yī)点(diǎn)?首(shǒu)先(xiān)需(xū)要(yào)新(xīn)一(yī)代(dài)的(de)基(jī)础(chǔ)设(shè)施(shī),而(ér)数(shù)智(zhì)技(jì)术(shù)搭(dā)建(jiàn)的(de)正(zhèng)是(shì)这(zhè)样(yàng)一(yī)种(zhǒng)大(dà)平(píng)台(tái)。”

而(ér)他(tā)自(zì)己(jǐ),就(jiù)是(shì)一(yī)个(gè)数(shù)据(jù)基(jī)础(chǔ)设(shè)施(shī)的(de)搭(dā)建(jiàn)者(zhě)。2010 年(nián),当(dāng)分(fēn)布(bù)式(shì)数(shù)据(jù)和(hé)机(jī)器(qì)学(xué)习(xí)(AI)的(de)曙(shǔ)光(guāng)初(chū)现(xiàn)时(shí),雷(léi)涛(tāo)凭(píng)借(jiè)敏锐的洞察力,毅然投身到这一领域,带领团队研发国产自研数据库。

其实做一个数据库工程并不难,把应用场景打磨好,一两年时间就可以实现快速盈利,但雷涛果断选择了“做原创”。

“做原创产品,才是下一代产品的核心命脉,工程只是在上一代产品上做延续性创新,无法支撑基础设施。”雷涛把几乎全部的资金都用在了研发上,可(kě)最(zuì)初(chū)推(tuī)向(xiàng)市(shì)场(chǎng)的(de)时(shí)候(hou),却(què)经(jīng)常(cháng)被(bèi)客(kè)户(hù)质(zhì)疑(yí)。

但(dàn)这(zhè)所(suǒ)有(yǒu)的(de)难(nán),并(bìng)没(méi)有(yǒu)让(ràng)雷(léi)涛(tāo)打(dǎ)退(tuì)堂(táng)鼓(gǔ),他(tā)最(zuì)终(zhōng)开(kāi)发(fā)出(chū)一(yī)套(tào)基(jī)于(yú)Go语言纯自研的HTAP数据库产品Hubble。这套数据库通过中国软件测评中心的源代码测试,系统自主研发率达到99.62%,完全符合国家信创战略,解决了基础设施“卡脖子”的难题。

有了自研的数据库,就有了未来面对国际巨头能够立足的底气与根本。雷涛说,现在机器传感物联网的数据时代已经到来,大量的数据通过设备或者产业服务产生出来,“而在我们搭建的基础设施之下,能诞生更多类(lèi)似(shì)ChatGPT的(de)智(zhì)能(néng)应(yīng)用(yòng)。我(wǒ)们(men)只(zhǐ)要(yào)把(bǎ)数(shù)字(zì)基(jī)建(jiàn)搭(dā)好(hǎo),把(bǎ)平(píng)台(tái)不(bù)断(duàn)完(wán)善(shàn),数(shù)据(jù)就(jiù)能(néng)真(zhēn)正(zhèng)服(fú)务(wu)每(měi)一(yī)个(gè)人(rén)。”

近(jìn)年(nián)来(lái),人(rén)工(gōng)智(zhì)能(néng)的(de)快(kuài)速(sù)发(fā)展(zhǎn)深(shēn)刻(kè)地(de)改(gǎi)变(biàn)着(zhe)各(gè)个(gè)行(xíng)业(yè)的(de)格(gé)局(jú)。2019年(nián),资(zī)本(běn)市(shì)场(chǎng)剧(jù)烈(liè)震(zhèn)荡(dàng),伞(sǎn)形(xíng)信(xìn)托(tuō)引(yǐn)发(fā)的(de)配(pèi)资(zī)乱(luàn)象(xiàng)让(ràng)传(chuán)统(tǒng)规(guī)则(zé)监(jiān)管(guǎn)束(shù)手(shǒu)无(wú)策(cè)。雷(léi)涛(tāo)带领的天云数据团队另辟蹊径,将600万正常账户数据与2000多个问题账户“喂”给深度学习模型,让人工智能自主发现人类难以察觉的异常模式。

“就(jiù)像(xiàng)训(xun)练(liàn)警(jǐng)犬(quǎn)识(shi)别(bié)新(xīn)型(xíng)毒(dú)品(pǐn),我(wǒ)们(men)不(bù)需(xū)要(yào)告(gào)诉(su)它(tā)化(huà)学(xué)成(chéng)分(fēn),只(zhǐ)需(xū)让(ràng)它(tā)记(jì)住(zhù)气(qì)味(wèi)。”雷(léi)涛(tāo)说(shuō),这(zhè)套(tào)系(xì)统(tǒng)将(jiāng)监(jiān)管(guǎn)效(xiào)率(lǜ)提(tí)升(shēng)数(shù)个(gè)量(liàng)级(jí),成(chéng)为(wèi)“证(zhèng)监(jiān)会(huì)版(bǎn)”监(jiān)管(guǎn)沙(shā)盒(hé)项(xiàng)目(mù)之一。

他拿出手机展示团队研发的工业检测系统,AI通过3D点云数据,能像资深技工般“摸”出精密零件的微米级瑕疵。“语言大模型是二维革命,视觉大模型是2.5维突破,空间计算将开启三维智能时代。”他说。

在雷涛和团队的努力之下,现在的天云数据,能同时提供国产HTAP数据库Hubble与AI平台型基础设施,并被评为国家级高新技术企业,首批中关村前沿科技企业,以及Forrester人工智能认知层第一象限公司。

算力基础设施应服务于千行百业

人工智能有三大核心要素,即所谓算力、算法、数据,其中算力可以说是其中的基础。什么是算力?通俗地说,就是计算能力,代表数据中心的服务器对数据进行处理后实现结果输出的一种能力。

人们常说,人工智能的尽头是算力,而算力的尽头是电力。数据显示,2023年我国算力中心能耗总量为1500亿千瓦时,同比增长15.4%,约占全社会用电量的1.6%。可见算力增长也会大幅增加对电力的消耗。雷涛表示,现在已有越来越多的国内外AI巨头积极与能源电力企业合作,有的甚至直接生产电力,以满足算力快速增长对于电力的庞大需求。

在我国,很多地方正大力建设算力基础设施,投资不菲。雷涛认为,大家顺应AI时代潮流进行这些建(jiàn)设(shè)本(běn)来是件好事,但也要考虑实际情况,因地制宜,不要搞重复建设,更不能有投机(jī)的(de)想(xiǎng)法(fǎ)。“规(guī)划(huà)建(jiàn)设(shè)过(guò)程(chéng)中(zhōng)要(yào)看(kàn)清(qīng)AI的(de)发(fā)展(zhǎn)趋(qū)势(shì),紧(jǐn)跟(gēn)技(jì)术(shù)前(qián)沿(yán),不(bù)要(yào)再(zài)做(zuò)一(yī)些(xiē)已(yǐ)经(jīng)明(míng)显(xiǎn)落(luò)伍(wu)的(de)东(dōng)西(xi),所(suǒ)谓(wèi)一(yī)步(bù)落(luò)后(hòu),步(bù)步(bù)落(luò)后(hòu)!”他(tā)说(shuō)。

雷(léi)涛(tāo)还(hái)表(biǎo)示(shì),建(jiàn)好(hǎo)的(de)算(suàn)力(lì)基(jī)础(chǔ)设(shè)施(shī)要(yào)如(rú)何(hé)发(fā)挥(huī)作(zuò)用(yòng)很(hěn)关键,不(bù)能(néng)仅(jǐn)仅(jǐn)满(mǎn)足(zú)AI企(qǐ)业(yè)需(xū)要(yào),更(gèng)要(yào)关注(zhù)MaSS市(shì)场(chǎng)(大(dà)众(zhòng)市(shì)场(chǎng)),要(yào)让(ràng)算(suàn)力(lì)像(xiàng)互(hù)联(lián)网(wǎng)或(huò)者(zhě)水(shuǐ)、空(kōng)气(qì)一(yī)样(yàng),成(chéng)为(wèi)一(yī)种(zhǒng)基(jī)础(chǔ)的(de)东(dōng)西(xi),服(fú)务(wu)于(yú)千(qiān)行(xíng)百(bǎi)业(yè)。

“现(xiàn)在(zài)我(wǒ)们(men)很(hěn)多(duō)的(de)算(suàn)力(lì)中心应用场景、客户群体等都较为单一,远不能发挥其全部作用。”雷涛说,“现在已是AI+的时代,AI本身正在与千行百业相结合(hé),已(yǐ)渐(jiàn)渐(jiàn)成(chéng)为一种基础性工具,国家建设的算力基础设施,也应该把重点放在服务各行各业上。”

未来AI将自己生产训练所需的数据

春节期间,国产大模型DeepSeek-R1横空出世(shì),证(zhèng)明(míng)了(le)用(yòng)更(gèng)低(dī)的(de)成(chéng)本(běn)、更(gèng)少(shǎo)的(de)算(suàn)力(lì)需(xū)求(qiú),就(jiù)可(kě)以(yǐ)实(shí)现(xiàn)世(shì)界(jiè)一(yī)流(liú)的(de)模(mó)型(xíng)性(xìng)能(néng)水(shuǐ)平(píng)。据(jù)测(cè)算(suàn),DeepSeek-R1模(mó)型(xíng)仅(jǐn)花(huā)费(fèi)约(yuē)600万(wàn)美(měi)元(yuán)就(jiù)完(wán)成了训练,约为美国和欧盟同类大语言模型成本的1/50.在某些方面,该模型比OpenAI的o1模型要好得多。更重要的是,R1的运营成本仅为(wèi)OpenAI通(tōng)常(cháng)对(duì)计(jì)算(suàn)密(mì)集型(xíng)输(shū)出(chū)收(shōu)取(qǔ)的(de)费(fèi)用(yòng)的(de)3%。

雷(léi)涛(tāo)认(rèn)为(wèi),DeepSeek实(shí)现(xiàn)了(le)大(dà)模(mó)型(xíng)的(de)祛(qū)魅(mèi),开(kāi)启(qǐ)了(le)中(zhōng)美(měi)后(hòu)训(xun)练(liàn)时(shí)代(dài)的(de)大(dà)门(mén),曾(céng)经(jīng)被(bèi)广(guǎng)泛(fàn)依(yī)赖(lài)的(de)技(jì)术(shù)大(dà)模(mó)型(xíng)预(yù)训(xun)练(liàn)模(mó)式(shì),如(rú)今(jīn)已(yǐ)不(bù)再(zài)是(shì)唯(wéi)一(yī)的(de) “金(jīn)科(kē)玉(yù)律(lǜ)”。相(xiāng)比(bǐ)算(suàn)力(lì)过(guò)剩(shèng)的(de)问(wèn)题(tí),我(wǒ)们(men)更(gèng)应(yīng)该(gāi)关注(zhù)的(de)是(shì)算(suàn)力(lì)和(hé)效(xiào)率(lǜ)都(dōu)满(mǎn)足(zú)的(de)情(qíng)况(kuàng)下(xià)有(yǒu)没(méi)有(yǒu)可(kě)以(yǐ)用(yòng)来(lái)训(xun)练(liàn)的(de)优(yōu)质(zhì)数(shù)据(jù)。

实(shí)际(jì)上(shàng),数(shù)据(jù)是(shì)大(dà)模(mó)型(xíng)的(de)核(hé)心(xīn)竞(jìng)争(zhēng)力(lì),高(gāo)质(zhì)量(liàng)的(de)数(shù)据(jù)资(zī)源(yuán)会(huì)成(chéng)为(wèi)核(hé)心(xīn)生(shēng)产(chǎn)力(lì),AI模(mó)型(xíng)生(shēng)产(chǎn)的(de)内(nèi)容(róng)高(gāo)度(dù)依(yī)赖(lài)源(yuán)头(tóu)数(shù)据(jù)。有(yǒu)研(yán)究(jiū)机(jī)构(gòu)估(gū)计(jì),机(jī)器(qì)学(xué)习(xí)可(kě)能(néng)会(huì)在(zài)2026年前耗尽所有“高质量语言数据”。

雷涛表示,今天的数据并不能满足明天的AI使用,明天的AI要自己生产数据资源。数据质量的高低并非由主观认知简单判定,而是取决于所采用的AI算法。如今已有大量数(shù)据(jù)由(yóu)AI生(shēng)成,但这并不意味着这些数据就是 “假数据”。

“所谓高质量与低质量数据,其评价标准与方式,归根结底在于AI算法。” 雷涛进一步阐释,“这就是当下热议的数据飞轮概念。AI模型使用的数据由其自身生成,数据飞轮正是构建模型持续迭代生长的关键方法。”

很多人说AI自我生成的合成数据是虚拟的、空数据或者说是造出来的数据。不过雷涛认为,合成数据是已知的数据通过确定的逻辑生产出来的数据,这些结果数据服务于真实的生产过程。

他还举了个例子,“百模大战”过后,为什么英伟达发布的大模型还可以挤到第一阵营?英伟达模型训练使用了98%的合成数据。无独有偶,特斯拉也是用合成数据获得具身机器人的智能。

合成数据可降低对真实数据的依赖

雷涛认为,硬件的增长遵循摩尔定律,而数据的增长则呈现指数型态势。我们如今所处的时代,已然是机器生产数据的时代,合成数据则是未来算力的主要解决方案。

合成数据究竟又是如何生成的呢?雷涛打(dǎ)了(le)个比方,往一瓶水中滴一滴墨水,墨水会从相对简单的状态逐渐扩散,变得复杂、分散。通过逆扩散算法识别墨水扩散规律,就能模拟出不同的墨水扩散场景。合成数据也是利用类似原理,抓住核心规律,从简单数据出发,模拟数据的复杂变化过程,创造出丰富多样的数据。

“人类的抽象逻辑留给我们的数据资产有限,都是信息化进程中沉淀下来的结构化概要信息。而要把这(zhè)些(xiē)概(gài)要(yào)信(xìn)息(xi)转(zhuǎn)变(biàn)为(wèi)能(néng)用(yòng)于(yú)理(lǐ)解(jiě)和(hé)处(chù)理(lǐ)复(fù)杂(zá)世(shì)界(jiè)中(zhōng)复(fù)杂(zá)系(xì)统(tǒng)的(de)内(nèi)容(róng),就(jiù)需(xū)要(yào)大(dà)量(liàng)合(hé)成(chéng)数据。”他说。

另外,在某些特定领域或场景下,获取真实数据存在困难。以自动驾驶领域为例,其需要百万级别的路况数据,涵盖模拟极端灾难天气、极端恶性交通事故(如波音747在高速公路上迎面迫降)、复杂路况(如路面破损、立交桥断桥)等情况的数据。这些数据难以从现实世界获取,而合成数据可按需生成,填补数据缺口,降低对有限真实数据的依赖。

后训练推动AI从“发动机时代”走向“造车时代”

雷涛表示,当前,大模型的预训练时代已经结束,后训练时代正式开启。在后训练时代,大模型构建起从数据生成到模型强化的正向循环机制至关重要。就像移动互联网时代搜推系统的“数据飞轮”效应——通过应用数据优化算法,算法又反哺应用,人工智能大模型也应形成“数据飞轮”,借助AI生产训练数据实现自我训练。

他还认为,后训练的核心在于从通用模型到领域知识、再到个体经验的深化。谷歌提出的L0-L6层级标准为后训练提供了框架,从基础模型的泛泛问答到高级的强化学习和智能体应用,后训练将推动AI从“发动机时代”走(zǒu)向(xiàng)“造(zào)车(chē)时(shí)代(dài)”。

“国(guó)内(nèi)AI市(shì)场(chǎng)已(yǐ)经(jīng)全面(miàn)进(jìn)入(rù)后(hòu)训(xun)练(liàn)时(shí)代(dài),企(qǐ)业(yè)需(xū)要(yào)从(cóng)通(tōng)用(yòng)模(mó)型(xíng)出(chū)发(fā),结(jié)合(hé)传(chuán)统(tǒng)机(jī)器(qì)学(xué)习(xí)和(hé)机(jī)理(lǐ)方(fāng)法(fǎ),最(zuì)终(zhōng)实(shí)现(xiàn)个(gè)体(tǐ)化(huà)的(de)应(yīng)用(yòng)。”他(tā)说(shuō)。

来(lái)源(yuán):北(běi)京(jīng)科(kē)技(jì)报(bào)