新闻中心

AI画画又快又好,那AI到底是怎么画画的?

发布时间:2025-01-21 11:07:06  /  浏览次数:552 次

欢迎来到特别推出的寒假精品栏目“给孩子的高新科技课”!

人工智能作为当今最前沿的科技之一,正在以令人惊叹的速度改变着我们的生活。从智能语音助手到无人驾驶汽车,从 AI 绘画到机器学习,它为我们打开了一个充满无限可能的未来。本栏目将以通俗易懂的方式,用视频和文字给孩子讲(jiǎng)述(shù)人(rén)工(gōng)智(zhì)能的原理、应用及其对社会的深远影响。

快跟我们一起开启这场 AI 之旅吧!

这是一位英国小女孩苏珊,这是她的爸爸,亚当。在这对父女的照上(shàng)有(yǒu)一个相同点,仔细看一看他们的照片,你能找到这个共同点吗?

微信图片_20250121103836.jpg

AI 生成图片

好吧,揭晓答案。共同点就是,这两张照片都是 AI 生成的,没有什么苏珊和亚当父女,他们的身份是瞎编的。

看到这样的照片,你可能会觉得有点惊讶,毕竟在过去,游戏、动画电影里的人物做的再逼真,还是能一眼看出这是 AI 合成的人像。但现在这两张图片上的人,看着几乎跟真人差不多。

除了生成人类照片,AI 还可以根据我们的需求画出各种各样风格的照片。今天这一集,我们就来说一说 AI 是怎么样画出这样的图片的?

生成式对抗网络

AI 生成图像的背后,有一项非常重要的技术——GAN。

GAN 是 Generative Adversarial Networks 的首字母缩写,意思是生成式对抗网络。它是 2014 年,伊恩·古德菲洛和他的同事一起提出的。GAN 听起来很高大上,但它的原理其实非常好理解。

假如我们要建立一个 GAN,专门画人脸照片。在这个网络里面,有两个重要的成员,生成器和鉴别器。

生成器的任务就是负责生成人像图片,这些生成的图片,会和真人的照片混在一起,让鉴别器去做判断。鉴别器要识别出,哪些是生成器生成的,哪些是真正的人类照片。

如果生成器生成的照片如果骗过了鉴别器,那么生成器就得分,反之就是鉴(jiàn)别(bié)器(qì)得(de)分(fēn)。

可(kě)以(yǐ)想(xiǎng)象(xiàng),最(zuì)开(kāi)始(shǐ)的(de)时(shí)候(hou),生(shēng)成(chéng)器(qì)生(shēng)成(chéng)的(de)照(zhào)片(piàn)其(qí)实(shí)非(fēi)常(cháng)简(jiǎn)单(dān),放(fàng)在(zài)真(zhēn)实(shí)照(zhào)片(piàn)里(lǐ)面(miàn)一(yī)眼(yǎn)就(jiù)能(néng)看(kàn)出(chū)来(lái)。

但(dàn)随(suí)着(zhe)成(chéng)千(qiān)上(shàng)万(wàn)次(cì)(cì)的(de)(de)学(xué)(xué)习(xí)(xí)训(xun)(xun)练(liàn)(liàn),生(shēng)(shēng)成(chéng)(chéng)器(qì)(qì)生(shēng)(shēng)成(chéng)(chéng)的(de)(de)图(tú)(tú)片(piàn)(piàn)会(huì)(huì)越(yuè)(yuè)来(lái)(lái)越(yuè)(yuè)接(jiē)(jiē)近(jìn)(jìn)真(zhēn)(zhēn)实(shí)(shí)的(de)(de)人(rén)(rén)类(lèi)(lèi)照(zhào)(zhào)片(piàn)(piàn)。在(zài)(zài)这(zhè)(zhè)个(gè)(gè)过(guò)(guò)程(chéng)(chéng)中(zhōng)(zhōng),鉴(jiàn)(jiàn)别(bié)(bié)器(qì)(qì)为(wèi)(wèi)了(le)(le)得(de)(de)分(fēn)(fēn),也(yě)(yě)需(xū)(xū)要(yào)(yào)提(tí)(tí)升(shēng)(shēng)自(zì)(zì)己(jǐ)(jǐ)的(de)(de)鉴(jiàn)(jiàn)别(bié)(bié)能(néng)(néng)力(lì)(lì)。

而(ér)(ér)为(wèi)(wèi)了(le)(le)骗(piàn)(piàn)过(guò)(guò)越(yuè)(yuè)来(lái)(lái)越(yuè)(yuè)聪(cōng)(cōng)明(míng)(míng)的(de)(de)鉴(jiàn)(jiàn)别(bié)(bié)器(qì)(qì),生(shēng)(shēng)成(chéng)(chéng)器(qì)又(yòu)要(yào)继(jì)续(xù)提(tí)升(shēng)自(zì)己(jǐ)的(de)能(néng)力(lì),就(jiù)这(zhè)样(yàng),经(jīng)过(guò)几(jǐ)千(qiān)万(wàn)次(cì)的(de)训(xun)练(liàn),AI就(jiù)能(néng)画(huà)出(chū)极(jí)其(qí)逼(bī)真(zhēn)的(de)人(rén)像(xiàng)了(le)。

微(wēi)信(xìn)图(tú)片(piàn)_20250121103712.jpg

图(tú)库(kù)版(bǎn)权(quán)图(tú)片(piàn),转(zhuǎn)载(zài)使(shǐ)用(yòng)可(kě)能(néng)引(yǐn)发(fā)版(bǎn)权(quán)纠(jiū)纷(fēn)

当(dāng)然(rán)了(le),除(chú)了(le)画(huà)人(rén)像(xiàng),人(rén)们(men)也(yě)可(kě)以(yǐ)让(ràng) GAN 去(qù)画(huà)不(bù)同(tóng)风(fēng)格(gé)的(de)图(tú)像(xiàng)。

比(bǐ)如(rú)让(ràng) GAN 生(shēng)成(chéng)毕(bì)加(jiā)索(suǒ)风(fēng)格(gé)的(de)画(huà),那(nà)它(tā)的(de)鉴(jiàn)别(bié)器(qì)就(jiù)不(bù)再(zài)需(xū)要(yào)判(pàn)断(duàn)图(tú)片(piàn)是(shì)不(bù)是(shì)像(xiàng)真(zhēn)人(rén)了(le),而(ér)是(shì)需(xū)要(yào)判(pàn)断(duàn)出(chū)哪(nǎ)些(xiē)图(tú)片(piàn)是(shì)毕(bì)加(jiā)索(suǒ)的(de)真(zhēn)迹(jī),哪(nǎ)些(xiē)是(shì) AI 生(shēng)成(chéng)的(de)作(zuò)品(pǐn),在(zài)这(zhè)样(yàng)的(de)训(xun)练(liàn)下(xià),就(jiù)可(kě)以(yǐ)画(huà)出(chū)不(bù)同(tóng)类(lèi)型(xíng)风(fēng)格(gé)的(de)图(tú)片(piàn)了(le)。Style GAN 模(mó)型(xíng)做(zuò)的(de)就(jiù)是(shì)这(zhè)件(jiàn)事(shì)。

除(chú)了(le) GAN,还(hái)有(yǒu)一(yī)种(zhǒng)图(tú)像(xiàng)生(shēng)成(chéng)技(jì)术(shù)——Stable Diffusion。最(zuì)近(jìn)比(bǐ)较(jiào)火(huǒ)的(de) MidJourney 就(jiù)是(shì)通(tōng)过(guò)这(zhè)种(zhǒng)模(mó)型(xíng)生(shēng)成(chéng)的(de)。简(jiǎn)单(dān)地(de)说(shuō),Stable Diffusion 能(néng)够(gòu)将(jiāng)一(yī)堆(duī)杂(zá)乱(luàn)无(wú)序(xù)的(de)噪(zào)声(shēng)图(tú)像(xiàng)一(yī)步(bù)步(bù)去(qù)噪(zào)声(shēng),最(zuì)终(zhōng)生(shēng)成(chéng)预(yù)期(qī)图(tú)片(piàn)的(de)过(guò)程(chéng)。

当(dāng)然(rán)了,我们今天熟悉的图像生成软件还有一个很重要的功能,根据自然语言描述的内容生成图像。

这个过程可不简单,但幸好有两项技术,让这件事成为了可能。

首先是图像识别技术。在过去几十年里,无(wú)论(lùn)是(shì)自(zì)动(dòng)驾(jià)驶(shǐ)、还(hái)是(shì)搜(sōu)索(suǒ)图(tú)片(piàn)中(zhōng)的(de)物(wù)品(pǐn),它(tā)们(men)都(dōu)依(yī)赖(lài)于(yú) AI 对(duì)图(tú)像(xiàng)上(shàng)内(nèi)容(róng)的(de)识(shi)别(bié)。在(zài)这(zhè)个(gè)过(guò)程(chéng)中(zhōng),人(rén)类(lèi)已(yǐ)经(jīng)对(duì)大(dà)量(liàng)图(tú)片(piàn)上(shàng)的(de)内(nèi)容(róng)进(jìn)行(xíng)了(le)标(biāo)注(zhù),并(bìng)且(qiě)用(yòng)它(tā)们(men)训(xun)练(liàn) AI,让(ràng) AI 能(néng)够(gòu)识(shi)别(bié)出(chū)各(gè)种(zhǒng)各(gè)样(yàng)的(de)东(dōng)西(xi)。

另(lìng)一(yī)项(xiàng)重(zhòng)要(yào)技(jì)术(shù),就(jiù)是自然语言识(shi)别(bié)了(le)。在(zài)过(guò)去(qù)几(jǐ)十(shí)年(nián)时(shí)间(jiān)里(lǐ),人(rén)们(men)也(yě)一(yī)直(zhí)在(zài)想(xiǎng)办(bàn)法(fǎ)让(ràng) AI 看(kàn)得(de)懂(dǒng)我(wǒ)们(men)写(xiě)的(de)字(zì),了(le)解(jiě)我(wǒ)们(men)在(zài)说(shuō)什(shén)么(me)。这(zhè)(zhè)让(ràng)(ràng) AI 能(néng)(néng)够(gòu)(gòu)更(gèng)(gèng)好(hǎo)(hǎo)地(de)(de)理(lǐ)(lǐ)解(jiě)(jiě)我(wǒ)(wǒ)们(men)(men)给(gěi)(gěi)定(dìng)的(de)文本的含义。

当你说“树上有只猫头鹰”的时候,计算机能够知道你说的是一种鸟,而不是树上有一只“猫”一个“头”,外加一只“鹰”。

在图像识别和自然语言处理技术日趋成熟之后,一种叫做跨模态检索的技术出现了。

模态说的是数据的存在形式,比如文本、图像、视频等形式。跨模态检(jiǎn)索(suǒ)能(néng)够(gòu)将(jiāng)不(bù)同(tóng)模(mó)态(tài)的(de)数(shù)据(jù)进(jìn)行(xíng)关联(lián)对(duì)应(yīng),比(bǐ)如(rú)将(jiāng)文本(běn)中(zhōng)的(de)“杯(bēi)子(zi)”和(hé)图(tú)片(piàn)中(zhōng)杯(bēi)子(zi)的(de)图(tú)像(xiàng)建(jiàn)立(lì)关联(lián)。

在(zài)跨(kuà)模(mó)态(tài)检(jiǎn)索(suǒ)技(jì)术(shù)的(de)帮(bāng)助(zhù)下(xià),AI 就(jiù)可(kě)(kě)以(yǐ)(yǐ)把(bǎ)(bǎ)我(wǒ)(wǒ)们(men)(men)输(shū)(shū)入(rù)(rù)的(de)(de)文本(běn)(běn)信(xìn)(xìn)息(xi)转(zhuǎn)化(huà)成(chéng)图(tú)像(xiàng)信(xìn)息(xi)了(le)。

在(zài)今(jīn)天(tiān),基(jī)于(yú) GAN、stable diffusion 的 AI 图像生成技术已经有了非常多的应用。除了在图像生成上,在生成音乐、视频、文字生成上面都有极其广泛的应用。

甚至从 2022 年末开始,很多公司就放出风声,要用 AI 画(huà)师(shī)代(dài)替(tì)人(rén)类画师。而在各种各样的社交媒体上,我们也可能看到 AI 生成的图片和视频了。

当然了,对于 AI 生成图片、视频之类的事情,有一些人也表示了担忧,毕竟,它们生成的照片视频实在是太逼真了,有些不怀好意的人,可能会拿这些照片进行诈骗,或者造谣生事。

很多 AI 公司也考虑到了这一点,开始对提供的 AI 服务做出了一些限制。而很多国家也纷纷开始考虑,要完善对 AI 生成式内容的法律法规。

相信随着规则的健全以及技术的进一步发展,AI 技术给我们带来的利会远远超它们的弊,AI 终将会更好地为人类服务。

策划制作

本文为-创作培育计划作品

出品|中国科协科普部

监制|中国科学技术出版社有限公司、北京中科(kē)星(xīng)河(hé)文化(huà)传(chuán)媒(méi)有(yǒu)限(xiàn)公(gōng)司(sī)

作(zuò)者(zhě)丨(gǔn)北(běi)京(jīng)云(yún)御(yù)纪(jì)文化(huà)传(chuán)播(bō)有(yǒu)限(xiàn)公(gōng)司(sī)

审(shěn)核(hé)丨(gǔn)秦(qín)曾(céng)昌(chāng) 北(běi)京(jīng)航(háng)空(kōng)航(háng)天(tiān)大(dà)学(xué) 自(zì)动(dòng)化(huà)科(kē)学(xué)与(yǔ)电(diàn)气(qì)工(gōng)程(chéng)学(xué)院(yuàn) 副(fù)教(jiào)授(shòu)

策(cè)划(huà)丨(gǔn)符(fú)思(sī)佳(jiā)

责(zé)编(biān)丨(gǔn)符(fú)思(sī)佳(jiā)

审(shěn)校(xiào)丨(gǔn)徐(xú)来(lái) 林(lín)林(lín)