新闻中心

用大脑“说话”:这项技术让失语者再次发声

发布时间:2025-07-16 09:30:10  /  浏览次数:375 次

【导语】一项革命性的脑机接口技术横空出世,借助AI算法成功将大脑神经信号实时转化为自然语音,为神经疾病导致的失语患者带来了重新开口说话的希望。在Nature杂志上发表的这项研究中,加州大学戴维斯分校等机构的科研团队通过精密的系统设计和创新算法,实现了从大脑信号到个性化语音的突破。这一技术不仅标志着神经工程和脑机接口领域的重要进展,更为失语者重建语言、身份与人际连结提供了前所未有的可能。未来,随着技术的不断优化和推广,我们或将迈入一个全新的语言纪元,让思维本身成为交流的直接源泉。

一项新型脑机接口技术,借助 AI 算法将神经信号映射为预期声音,首次实现将脑活动实时转化为语音,为神经疾病失语者恢复对话能力提供可能。

撰文 | 常恺

“这就像我重新拥有了⾃⼰的声⾳。”

一位渐冻症患者在通过脑语⾳接⼝系统说出第一句话时如此表达。

2025年6⽉12⽇,由加州⼤学戴维斯分校(UC Davis)联合布朗⼤学、哈佛医学院附属⻢萨诸塞总医院及美国退伍军⼈事务部神经恢复中⼼组成的研究团队,在Nature杂志发表了一项引发全球关注的神经⼯程研究。他们⾸次实现了通过⼤脑信号直接⽣成⾃然语⾳的技术,让一位因渐冻症(ALS)失去发声能⼒的患者“重新开⼝”。

图1:脑—语音接口系统的工作原理示意图。

⽤⼤脑说话:⾸次实现⾃然语⾳的脑机接⼝

在神经⼯程和脑机接⼝领域,实现“⽤⼤脑直接说话”一直是一个意义⾮凡却充满挑战的⽬标。过去的脑机接⼝⼤多依赖⽂字拼写或按钮输⼊,即便能合成语⾳,往往也机械⽽单调,缺乏⾃然语⾔的韵律和情感。⽽对于那些⽆法发声的⼈来说,语⾔从未在⼤脑中沉默,只是被困在了⽆声的意图之中。如今,科学家们终于找到了一种⽅式,让这些“沉默的语⾔”被真实听⻅。

此(cǐ)次发表在Nature上的研究,⾸次通过⼤脑运动⽪层的神经信号,实时⽣成带有语调、节奏与个性化⾳⾊的⾃然语⾳。这不仅让语⾔障碍患者能够重新“说话”,更让他们能⽤属于⾃⼰的声⾳、⾃⼰的⽅式进⾏交流。

对于参与试验的ALS患者来说,这是一次技术测试,更是一次(cì)语(yǔ)⾔(⾔)⾝(⾝)份(fèn)的(de)重(zhòng)建(jiàn)。他(tā)成(chéng)功(gōng)说(shuō)出(chū)“你(nǐ)好(hǎo)”“今(jīn)天(tiān)感(gǎn)觉(jué)很(hěn)好(hǎo)”等(děng)简(jiǎn)单(dān)句(jù)⼦(⼦),并(bìng)能(néng)灵(líng)活(huó)调(diào)控(kòng)语(yǔ)调(diào)语(yǔ)⽓(⽓),甚(shén)⾄(⾄)尝(cháng)试(shì)哼(hēng)唱(chàng)旋(xuán)律(lǜ)。这(zhè)些(xiē)表(biǎo)达(dá),不(bù)再(zài)只(zhǐ)是(shì)功(gōng)能(néng)性(xìng)的(de)输(shū)出(chū),⽽(⽽)是(shì)具(jù)有(yǒu)⾃(⾃)我(wǒ)⾊(⾊)彩(cǎi)、情(qíng)感(gǎn)温(wēn)度(dù)和(hé)交(jiāo)流(liú)能(néng)⼒(⼒)的(de)完(wán)整(zhěng)语(yǔ)⾔(⾔)。

从(cóng)沉(chén)默(mò)到(dào)发(fā)声(shēng):⼤(⼤)脑(nǎo)如(rú)何(hé)直(zhí)接(jiē)驱(qū)动(dòng)真(zhēn)实(shí)语(yǔ)⾳(⾳)

要(yào)实(shí)现(xiàn)如(rú)此(cǐ)⾃(⾃)然(rán)流(liú)畅(chàng)的(de)语(yǔ)⾳(⾳)表(biǎo)达(dá),背(bèi)后(hòu)依(yī)赖(lài)的(de)是(shì)一(yī)个(gè)⾼(⾼)度(dù)精(jīng)密(mì)的(de)脑(nǎo)—语(yǔ)⾳(⾳)接(jiē)⼝(⼝)系(xì)统(tǒng)。研(yán)究(jiū)团(tuán)队(duì)将(jiāng)整(zhěng)个(gè)流(liú)程(chéng)设(shè)计(jì)为(wèi)四(sì)个(gè)关键步(bù)骤(zhòu):神(shén)经(jīng)信(xìn)号(hào)采集(neural recording)、神(shén)经(jīng)解(jiě)码(mǎ)(neural decoding)、语(yǔ)⾳(⾳)合(hé)成(chéng)(speech synthesis)和(hé)实(shí)时(shí)播(bō)放(fàng)(real-time audio feedback),构(gòu)建(jiàn)出(chū)一(yī)个(gè)完(wán)整(zhěng)的(de)闭(bì)环(huán)路径,让(ràng)意(yì)图(tú)真(zhēn)正(zhèng)转(zhuǎn)化(huà)为(wèi)可(kě)听(tīng)⻅(⻅)、可(kě)互(hù)动(dòng)的(de)语(yǔ)⾔(⾔)。

⾸(⾸)先(xiān),研(yán)究(jiū)⼈(⼈)员(yuán)在(zài)患(huàn)者(zhě)⼤(⼤)脑(nǎo)左(zuǒ)侧(cè)前(qián)中(zhōng)央(yāng)回(huí)腹(fù)部(bù)(ventral premotor cortex)——这(zhè)一(yī)控(kòng)制(zhì)⾯(⾯)部(bù)和(hé)喉(hóu)部(bù)运(yùn)动(dòng)的(de)关键区(qū)域——植(zhí)⼊(⼊)了(le)两(liǎng)组(zǔ)共(gòng)计(jì)256通(tōng)道(dào)微(wēi)电(diàn)极(jí)阵(zhèn)列(liè)(microelectrode arrays)。即(jí)便(biàn)患(huàn)者(zhě)已(yǐ)⽆(⽆)法(fǎ)发(fā)声(shēng),但(dàn)在(zài)“试(shì)图(tú)说(shuō)话(huà)”时(shí),⼤(⼤)脑(nǎo)依(yī)然(rán)会(huì)产(chǎn)⽣(⽣)可(kě)被(bèi)记(jì)录(lù)的(de)电(diàn)信(xìn)号(hào)。随(suí)后(hòu),这(zhè)些(xiē)神(shén)经(jīng)信(xìn)号(hào)被(bèi)输(shū)⼊(⼊)⾄(⾄)两(liǎng)套(tào)并(bìng)⾏(⾏)的(de)深(shēn)度(dù)神(shén)经(jīng)⽹(⽹)络(luò)模(mó)型(xíng)中(zhōng)进(jìn)⾏(⾏)解(jiě)码(mǎ):

•第(dì)一(yī)套(tào)模(mó)型(xíng)⽤(⽤)于(yú)预(yù)测(cè)语(yǔ)⾳(⾳)内(nèi)容(róng)(phoneme probabilities及(jí)acoustic features),即(jí)识(shi)别(bié)“说(shuō)了(le)什(shén)么(me)”;

•第(dì)⼆套模型则专⻔提取语调和情绪等副语⾔信息(paralinguistic features),如语句是否为疑问句、是否强调某一词等。

这种“双路径解码”机制,不仅能还原语义信息,还能呈现语言中的情感和个性表达,使系统输出更接近真实人类语言。

由于患者无法清晰发声,研究团队面临缺乏“真实语音”训练数据的难题。为此,他们开发了一种创新算法:借助屏幕提示语引导患者进行“尝试说话”,并实时记录其神经活动。系统随后从这些神经信号中识别出音节边界,再通过语音合成技术(text-to-speech)生成对应的目标语音。最后,研究人员将合成语音与神经信号在时间上对齐,从而构建出神经—语音配对数据,间接还原出患者的“预期发音”,为神经解码模型的训练提供了可靠基础。

在此基础上,团队训练了一套基于 Transformer 架构的深度学习模型,每10毫秒预测一次语音的频谱与音高特征。该模型实现了“因果解码”能力,还对不同实验时段之间神经信号的波动进行了结构优化,以确保不同使用时间下的稳定性和精确性。

最终的语音输出由一套个性化声码器(personalized neural vocoder)完成。该系统通过模拟人类声带与发音机制,将神经解码得到的语言参数转化为清晰自然的语音,并通过扬声器实时播放给患者。这种闭环式音频反馈有助于重建大脑与语言表达之间的神经通路,也增强了交流的沉浸感。

为了最大限度保留个体特征,声码器在训练时还融⼊了患者早期的语⾳录⾳,使得合成的语音在音色、语调上更贴近患者原有的嗓⾳特征,具有⾼度个体化识别度。

整体而言,该系统在音素识别、语调判断等方面均表现出色。实验显示,该系统对疑问语调的识别准确率约为 90.5%,词语重读的识别准确率约为 95.7%;在部分自由表达任务中,合成语音的音频质量与提示语条件下生成结果相当(Pearson 相关系数约为 0.79±0.05)。整个过程在毫秒级时间窗⼝内完成闭环,从神经信号产⽣到声⾳输出延迟极低,⼏乎可实现实时对话。这一速度远超以往的脑—机语⾳系统,真正做到了“⽤⼤脑实时说话”。

图2:语言相关脑区的神经信号采集与放电波形图。左侧图显示了研究中电极阵列的植入区域,包括中前中央回(Middleprecentral gyrus,55b)、腹侧前运动皮层(ventral premotorcortex,6v)、初级运动皮层(primary motorcortex,M1)以及相关子区(d6v、v6v)。黄色虚线标示中央沟(central sulcus)作为解剖参照。右侧图为从每个脑区采集到的神经放电波形(spike waveforms),展示了不同皮层区域中神经元的典型放电模式。这些信号构成了接口系统语音解码的神经基础。

图3:脑—语⾳接⼝系统的表达⼒与语调控制能⼒。本图展示系统在语速调控(kòng)(a–b)、词语(yǔ)重(zhòng)读(dú)(c)、语(yǔ)调(diào)识(shi)别(bié)(d–e)、强(qiáng)调(diào)重(zhòng)建(jiàn)(f–g)和(hé)⾳(⾳)⾼(⾼)合(hé)成(chéng)(h–k)⽅(⽅)⾯(⾯)的(de)多(duō)维(wéi)解(jiě)码(mǎ)能(néng)⼒(⼒)。a–b:系(xì)统(tǒng)可(kě)区(qū)分(fēn)快(kuài)速(sù)与(yǔ)缓(huǎn)慢(màn)语(yǔ)速(sù)的(de)神(shén)经(jīng)意(yì)图(tú),并(bìng)合(hé)成(chéng)相(xiāng)应(yīng)节(jié)奏(zòu)语(yǔ)⾳;c:在不同⽪层(M1、v6v、d6v、55b)中检测到与词语强调相关的神经调制;d–e:区分疑问句与陈述句语调,并实现⾼准确率的语调解码(90.5%);f–g:成功识别并再现句中不同词语的强调位置(如“Where” vs “You”);h–k:合成不同⾳⾼(Low,Mid,High)的旋律语⾳,并达到了与⽬标语调一致的频率分布(合成精度>73%)。

语⾔的未来:不仅是技术,更是权利的归还

这项研究的意义,不仅在技术层面实现了用“大脑说话”的突破,更在于它为失语者在重建语言、身份与人际连结提供了全新可能。在传统沟通手段失效的情况下,这一脑语音接口技术让沉默的大脑重新被听见,让表达不再依赖声音或动作,而直通思维本身。

为加速这一方向的发展,研究团队已将完整的数据与代码在GitHub(
Neuroprosthetics-Lab/brain-to-voice-2025)开源,并邀请全球研究者共同优化算法、拓展功能。未来,它有望推广至中⻛、脑瘫、喉癌术后等多类失语人群;与此同时,研究人员也在探索其与⾮侵⼊式脑电技术(如EEG)的结合,以进一步降低使用⻔槛;它还可能与AI语义理解系统融合,构建新—代⾃然语⾔交互平台。

尽管该研究已实现了神经信号到自然语音的实时转化,但目前仍处于早期探索阶段。在实验中,患者需要根据屏幕提示语进行“默念”或“尝试说话”,系统才能识别相应意图并合成语音。换句话说,当前的表达仍依赖于“外部引导”,尚未达到完全由大脑自主驱动的自由交流。

不过,研究团队也尝试在更开放的场景中进行测试。例如,在部分无提示的问答任务中,系统依然能够生成清晰、自然的语音输出。这一结果提示:脑语音接口正朝着“无提示、自主表达”的方向迈进,为未来实现意图直接驱动语言奠定了技术基础。

当然,这项技术目前仅在一位ALS患者中完成验证,样本数量有限,仍不足以评估其在不同个体、不同病理状态下的通用性与稳定性。同时,从公开演示视频来看,系统生成的语音虽然具备个性化音色,但在语调灵活性、节奏自然度与情感表现方面,仍与真实人类对话存在一定差距。

要实现真正的日常实用化,该技术仍面临诸多挑战:如何从“提示语驱动”迈向(xiàng)“自(zì)由(yóu)表(biǎo)达(dá)”?如(rú)何(hé)减(jiǎn)少(shǎo)设(shè)备(bèi)的(de)侵(qīn)入(rù)性(xìng)、提(tí)升(shēng)长(zhǎng)期(qī)使(shǐ)用(yòng)的(de)稳(wěn)定(dìng)性(xìng)与(yǔ)适(shì)配(pèi)性(xìng)?这(zhè)些(xiē)问(wèn)题(tí)将(jiāng)决(jué)定(dìng)脑(nǎo)语(yǔ)音(yīn)接(jiē)口(kǒu)能(néng)否(fǒu)从(cóng)实(shí)验(yàn)室(shì)走(zǒu)进(jìn)真(zhēn)实(shí)生(shēng)活(huó)的(de)深(shēn)度(dù)与(yǔ)广(guǎng)度(dù)。

但(dàn)毋(wú)庸(yōng)置(zhì)疑(yí),我(wǒ)们(men)正(zhèng)在(zài)迈(mài)入(rù)一(yī)个(gè)新(xīn)的(de)语(yǔ)言(yán)纪(jì)元(yuán)。未(wèi)来(lái)的(de)语(yǔ)⾔(⾔),不(bù)再(zài)依(yī)赖(lài)声(shēng)带(dài)、⽂(⽂)字(zì)或(huò)⼿(⼿)势(shì),⽽(⽽)将(jiāng)直(zhí)接(jiē)来(lái)源(yuán)于(yú)我(wǒ)们(men)的(de)思(sī)维(wéi)本(běn)⾝(⾝)。语(yǔ)⾔(⾔),原(yuán)本(běn)就(jiù)是(shì)我(wǒ)们(men)存(cún)在(zài)的(de)延(yán)伸(shēn)。⽽(⽽)今(jīn)天(tiān)的(de)这(zhè)项(xiàng)研(yán)究(jiū),让(ràng)我(wǒ)们(men)看(kàn)到(dào):即(jí)使(shǐ)在(zài)沉(chén)默(mò)之(zhī)中(zhōng),⼤(⼤)脑(nǎo)依(yī)然(rán)有(yǒu)话(huà)可(kě)说(shuō)。科(kē)技(jì),正(zhèng)在帮助那些失去语⾔的⼈再次被世界听⻅。

注:本文封面图片来自版权图库,转载使用可能引发版权纠纷。

特 别 提 示

1. 进入『返朴』微信公众号底部菜单“精品专(zhuān)栏(lán)“,可(kě)查(chá)阅(yuè)不(bù)同(tóng)主题(tí)系(xì)列(liè)科(kē)普(pǔ)文章(zhāng)。

2. 『返(fǎn)朴(pǔ)』提(tí)供(gōng)按(àn)月检索文章功能。关注公众号,回复四位数组成的年份+月份,如“1903”,可获取2019年3月的文章索引,以此类推。

版权说明:欢迎个人转发,任何形式的媒体或机构未经授权,不得转载和摘编。转载授权请在「返朴」微信公众号内联系后台。