
与(yǔ)基(jī)于(yú)文本(běn)的(de)大(dà)语(yǔ)言(yán)模(mó)型(xíng)(LLM)相(xiāng)比(bǐ),语(yǔ)音(yīn)语(yǔ)言(yán)模(mó)型(xíng)(SpeechLM)接(jiē)受(shòu)语(yǔ)音(yīn)输(shū)入(rù)并(bìng)生(shēng)成(chéng)语(yǔ)音(yīn)输(shū)出(chū),能(néng)够(gòu)实(shí)现(xiàn)更(gèng)自(zì)然的人机交互。然而,传统的 SpeechLM 因缺乏无监督语音数据和并行语音-文本数据,很难像 LLM 一样进行大规模扩展。
为解决这一问题,来自清华大学和智谱的研究团队提出了一种新方法,利用从文本语料库中提取的大规模合成交错数据来扩展语音-文本预训练,从而消除了对并行语音(yīn)-文本(běn)(běn)数(shù)(shù)据(jù)(jù)集的需求。这一方法从现有文本库中抽取文本片段,并使用 text-to-token 模型合成相应的语音片段,从而高效地构建语音-文本交错数据,而无需生成实际语音。
此外,通过在编码器中加入向量量化的瓶颈层,他们还采用了从自动语音识别(ASR)模型中提取的监督语音 tokenizer。即使在较低的采样率(如 12.5Hz)下,这种有监督的训练方法也能生成语义保存较好的离散(sàn)语(yǔ)音(yīn) token,同(tóng)时(shí)保(bǎo)持(chí)语(yǔ)音(yīn)重(zhòng)构(gòu)质(zhì)量(liàng)。

研(yán)究(jiū)团(tuán)队(duì)表(biǎo)示(shì),从(cóng)预(yù)训(xun)练(liàn)的(de)语(yǔ)言(yán)模(mó)型(xíng)开(kāi)始(shǐ),并(bìng)将(jiāng)预(yù)训(xun)练(liàn)扩(kuò)展(zhǎn)到(dào) 1 万(wàn)亿(yì)个(gè) token(其(qí)中包括 6000 亿合成交错语音文本数据),他们在语音语言建模和口语问题解答方面取得了 SOTA,将语音问答任务方面的性能从之前的 13%(Moshi)提高到 31%。

图|随着合成交错数据量的增加,Spoken QA 的(de)性(xìng)能(néng)不断提高,大大超过了之前的 SOTA 模型 Moshi(左图)。合成交错语音文本数据的 pipeline(右(yòu)图(tú))。
他(tā)们(men)进(jìn)一(yī)步(bù)证(zhèng)明(míng),通(tōng)过(guò)使(shǐ)用语音对话数据对预训练的模型进行微调,他们开发出的一种端到端语音聊天机器人,在对话能力和语音质量方面都达到了与现有基线相(xiāng)当(dāng)的(de)性(xìng)能(néng),展(zhǎn)现(xiàn)了(le)在(zài)纯(chún)语(yǔ)音(yīn)领(lǐng)域中(zhōng)应(yīng)用(yòng)的(de)巨(jù)大(dà)潜(qián)力(lì)。
研(yán)(yán)究(jiū)(jiū)方(fāng)(fāng)法(fǎ)(fǎ)
研(yán)(yán)究(jiū)(jiū)团(tuán)(tuán)队(duì)(duì)提(tí)(tí)出(chū)(chū)了(le)(le)一(yī)(yī)种(zhǒng)(zhǒng)通(tōng)(tōng)过(guò)(guò)从(cóng)(cóng)文本(běn)(běn)语(yǔ)(yǔ)料(liào)(liào)库(kù)(kù)合(hé)成(chéng)高质量交错语音-文本数据来扩展语音-文本预训练的新方法,使得大规模预训练无需依赖大量的语音数据集成为可能。完整方法框(kuāng)框(kuāng)架结合了(le)语(yǔ)音(yīn) token 化(huà)、语(yǔ)音(yīn)-文本(běn)交(jiāo)替(tì)数(shù)据(jù)生(shēng)成(chéng)以及两阶段训练。

图|研究方法概述。
在语音 token 化的设计上,他们采用了一种基于自动语音识别(ASR)的监督语音 tokenizer,通过在编码器中加入向量量化的瓶颈层和平均池化层来有效生成离散语音 token。
同时,为提高实时语音处理能力,tokenizer 还优化为支持流式推理从而降低在线应用中的延迟。

图|语音重构结果。使用了词错误率(WER)评估语义保留情况,并使用 VisQOL 和 MOSNet 评估不同语音tokenizer 在不同采样率下的重建质量。
语音-文本交错数据是 SpeechLM 预训练的关键。他们先是基于现有的文本到语音(TTS)数据集训练了一个 text-to-token 模型,能直接将文本片段转换为对应的语音 token,较传统多步生成方法效率更高且潜在(zài)错(cuò)误(wù)的(de)累(lèi)积(jī)更(gèng)少(shǎo)。
接(jiē)着,他们使用训练好的 text-to-token 模型从大规模文本语(yǔ)料(liào)库(kù)中(zhōng)采样(yàng)文本(běn)片(piàn)段(duàn),并(bìng)将(jiāng)其(qí)转(zhuǎn)换(huàn)为(wèi)语(yǔ)音(yīn) token。这(zhè)些(xiē)语(yǔ)音(yīn) token 与(yǔ)原(yuán)始(shǐ)文本(běn)片(piàn)段(duàn)交(jiāo)错(cuò)组(zǔ)合(hé),从(cóng)而(ér)生(shēng)成(chéng)高(gāo)质(zhì)量(liàng)语(yǔ)音(yīn)-文本(běn)交(jiāo)错(cuò)数(shù)据(jù)。最(zuì)终(zhōng),他(tā)们基于 FineWeb 语料库为模型预训练生成了 6000 亿 token 的语音-文本交错数据。

图|文本到 token 模型的 WER。
之后,他们开展了一个两阶段训练,在第一阶(jiē)段(duàn),使(shǐ)用(yòng)合(hé)成(chéng)语(yǔ)音(yīn)-文本交错数据对模型进行预训练,在第二阶段,使用语音对话数据集微调预训练模型。
在语音-文本预训练阶段,他们通过使用不同用途的 4 类数据:语音-文本交错数据、无监督文本数据、无监督语音数据和有监督语音-文本数据进行预训练,使模型学习语音和文本之间的对齐关系。
到了监督微调阶段,他们利用语音对话数据进行微调,使模型能够支持端到端语音输入与输出。
实验结果
研究团队通过一系列实验验证了提出方法的有效性,包括语音语言建模、语音问答、语音聊天机器人等任务,展现了在多个语音应用场景中的突破性进展。
他们在语音语言建模任务中首次测试了大规模合成语音-文本交错数据的效果。结果表明,由他们的方法(fǎ)预(yù)训(xun)练(liàn)的(de)模(mó)型(xíng)在(zài)所(suǒ)用(yòng)任(rèn)务(wu)上(shàng)均(jūn)优(yōu)于(yú)现(xiàn)有(yǒu)方(fāng)法(fǎ)。模(mó)型(xíng)不(bù)仅(jǐn)能(néng)更(gèng)精(jīng)准(zhǔn)地(de)预(yù)测(cè)语(yǔ)音(yīn)序(xù)列(liè),还(hái)表(biǎo)现(xiàn)出(chū)更(gèng)强(qiáng)的(de)泛(fàn)化(huà)能(néng)力(lì),能(néng)够(gòu)适(shì)应(yīng)多(duō)样(yàng)化(huà)的(de)语(yǔ)音输入模式。

图|模型预训练结果。
在语音问答任务中,他们评估了模型处理自然语音问答的能力,特别是其在跨模态输入输出场景中的表现。相比之前 SOTA 模型 Moshi 的 13% 准确率,新模型将问答任务的准确率大幅提升至 31%,实现了近 3 倍的性能增长。
他们进一步微调预训练模型,开发出一个完(wán)全基(jī)于(yú)语(yǔ)音(yīn)的(de)端(duān)到(dào)端(duān)语(yǔ)音(yīn)聊(liáo)天(tiān)机(jī)器(qì)人(rén)。评(píng)估(gū)结(jié)果(guǒ)显(xiǎn)示(shì),具(jù)有(yǒu)文本(běn)引(yǐn)导(dǎo)的(de) 9B 模(mó)型(xíng)在(zài)一(yī)般(bān)问(wèn)答(dá)和(hé)基(jī)于(yú)知(zhī)(zhī)识(shi)的(de)任(rèn)务(wu)中(zhōng)优(yōu)于(yú)所(suǒ)有(yǒu)基(jī)线(xiàn)模(mó)型(xíng),在(zài)语(yǔ)音(yīn)质(zhì)量(liàng)评(píng)估(gū)方(fāng)面(miàn)也(yě)比(bǐ)其(qí)他(tā)模(mó)型(xíng)取(qǔ)得(de)了(le)更(gèng)好(hǎo)的(de)结(jié)果(guǒ)。
值(zhí)得(de)注(zhù)意(yì)的(de)是(shì),即(jí)使(shǐ)没(méi)有(yǒu)文本(běn)引(yǐn)导(dǎo),9B 模(mó)型(xíng)仍(réng)然(rán)与(yǔ)文本(běn)引(yǐn)导(dǎo)的(de)基(jī)线(xiàn)模(mó)型(xíng)表(biǎo)现(xiàn)相(xiāng)当(dāng),突(tū)出(chū)了(le)该(gāi)方法在文本和语音模态对齐方面的有效性。

图|端到端语音聊天机器人的评估结果。
此外,研究团队进一步开展了消融实验探究数据规模与组成、tokenizer 采样率和跨模态数据生成方法对模型性能的影响(xiǎng),为(wèi)优(yōu)化(huà)语(yǔ)音(yīn)-文本(běn)预(yù)训(xun)练(liàn)提(tí)供(gōng)了(le)实(shí)证(zhèng)依(yī)据(jù)。
首(shǒu)先(xiān),数(shù)据(jù)规(guī)模(mó)与(yǔ)组(zǔ)成(chéng)部(bù)分(fēn)的(de)实(shí)验(yàn)结(jié)果(guǒ)显(xiǎn)示(shì),移(yí)除(chú)交(jiāo)错(cuò)数(shù)据(jù)时(shí)模(mó)型(xíng)性能显著下降,表明这种数据在对齐语音和文本模态中发挥了核心作用。进一步增加交错数据的规模(从 1000 亿扩展至 6000 亿 token)后,语音问答和语音语言建模的表现均有明(míng)显(xiǎn)提(tí)升(shēng),特(tè)别(bié)是(shì)在(zài)语(yǔ)音(yīn)到(dào)文本(běn)(S→T)和(hé)语(yǔ)音(yīn)到(dào)语(yǔ)音(yīn)(S→S)模(mó)式(shì)下(xià),任(rèn)务(wu)性(xìng)能(néng)显(xiǎn)著(zhe)优(yōu)化(huà)。
此(cǐ)外(wài),尽(jǐn)管(guǎn)未标注语音数据的移除对小模型影(yǐng)响(xiǎng)不(bù)大(dà),但(dàn)在(zài)大(dà)规(guī)模(mó)模(mó)型(xíng)(9B 参(cān)数(shù))中(zhōng),保(bǎo)留(liú)所(suǒ)有(yǒu)数(shù)据(jù)类(lèi)型(xíng)能(néng)够(gòu)大(dà)幅(fú)提(tí)升(shēng)整(zhěng)体(tǐ)性(xìng)能(néng)。

图(tú)|关于(yú)交(jiāo)错(cuò)数(shù)据(jù)尺(chǐ)度(dù)和(hé)预(yù)训(xun)练(liàn)数(shù)据(jù)组(zǔ)成(chéng)的(de)消(xiāo)融(róng)研(yán)究(jiū)。
之(zhī)后(hòu),他(tā)们(men)评(píng)估(gū)了(le) tokenizer 的(de)采样(yàng)率(lǜ)对(duì)模(mó)型(xíng)表(biǎo)现(xiàn)的(de)影(yǐng)响(xiǎng)。研(yán)究(jiū)发(fā)现(xiàn),较(jiào)低(dī)采样(yàng)率(lǜ)(如 12.5Hz)在平衡语义保留与计算效率方面表现最佳,这为(wèi)模(mó)型在实际应用中的优化提供了有力支持。
最后,跨度损坏率(即交错样本中文本和语音 token 的比例)对模型性能有显著影响。当损坏比率接近 0 或 1 时,交错样本主要由文本或(huò)语(yǔ)音(yīn) token 主导(dǎo),导(dǎo)致(zhì)性(xìng)能(néng)下(xià)降(jiàng)。实(shí)验(yàn)通(tōng)过(guò)调(diào)整(zhěng)不(bù)同(tóng)的(de)损(sǔn)坏(huài)比(bǐ)率(lǜ)训(xun)练(liàn)(liàn)了(le)(le)多(duō)(duō)个(gè)(gè) 1.5B 模(mó)(mó)型(xíng)(xíng),得(de)(de)出(chū)(chū) 0.2 到(dào)(dào) 0.4 之(zhī)(zhī)间(jiān)(jiān)的(de)(de)跨(kuà)(kuà)度(dù)(dù)损(sǔn)(sǔn)坏(huài)(huài)率(lǜ)(lǜ)效(xiào)(xiào)果(guǒ)(guǒ)最(zuì)(zuì)佳(jiā)(jiā),进(jìn)(jìn)而(ér)(ér)选(xuǎn)(xuǎn)取(qǔ)(qǔ)了(le)(le) 0.3 作(zuò)(zuò)为(wèi)(wèi)最(zuì)(zuì)佳(jiā)(jiā)的(de)(de)跨(kuà)(kuà)度(dù)(dù)损(sǔn)(sǔn)坏(huài)率(lǜ)用(yòng)于(yú)主要(yào)模(mó)型(xíng)的(de)训(xun)练(liàn)。

图|采样率与平均准确率(a);跨度损坏率与平均准确率(b);监督微调后的交错数据 token 与平均性能对比(c)。
研究团队表示,他们将继续探索更高效的训练方法,进一步扩展模型(xíng)规(guī)模(mó)与(yǔ)多(duō)语(yǔ)言(yán)能(néng)力(lì),促(cù)进(jìn)语(yǔ)音(yīn) AI 实现更高效的应用。
作者:阮文韵