当下,大语言模型似乎具备了与人交流对话的能力,不仅如此,大语言模型还能飞速完成很多人类需要花更多时间(jiān)才(cái)能(néng)完(wán)成(chéng)的(de)文字生成任务,比如,写篇总结文章、作首诗、写段Rap。然而,大语言模型的推理能力却引起了很多争议,近两年来的很多测试显示,大模型在计数、符号推理、算术推理、子集求和、几何推理等方面的表现都不理想。

反复“刷题”,或导致数据污染
为了提高大模型的推理能力,Open AI发布了一个名为GSM8K的数据集,这个由人类写手创造的数据集包含了8000多个小学数学问题和答案,其中有7473个(gè)训(xun)练(liàn)问(wèn)题(tí)和(hé)1319个(gè)测(cè)试(shì)问(wèn)题(tí)。对(duì)于(yú)人(rén)类(lèi)而(ér)言(yán),这(zhè)些(xiē)问(wèn)题(tí)只(zhǐ)需(xū)用(yòng)到(dào)简(jiǎn)单(dān)的(de)加(jiā)、减(jiǎn)、乘(chéng)、除(chú)运(yùn)算(suàn),通(tōng)过(guò)2-8个(gè)步(bù)骤(zhòu),就可以得出最终答案。
经过不断地训练和调整,大语言模型在面对GSM8K时,性能已经有了显著提高。但这是否真的意味着大模型的数学推理能力变强了?一种质疑是,由于这个数据集的题目固定且被拿来反复使用,很可能出现数据污染——用于测试的例子同时也被包含在了模型的训练数据中。所以,即使测试结果变得更好了(le),也(yě)不(bù)能(néng)确(què)认(rèn)这(zhè)些(xiē)大(dà)语(yǔ)言(yán)模(mó)型(xíng)的(de)数(shù)学(xué)推(tuī)理(lǐ)能力真的提高了。
微调题库,测试应变能力
今年10月,苹果公司发布的一项测评证实了这一质疑的合理性。为避开GSM8K可能导致的数据污染,苹果公司的研究人员想出了一个好办法,他们给出了一个在GSM8K基础上进行微调的测试系统GSM-Symbolic。微调方式主要有3种:替换题目中的专(zhuān)有(yǒu)名词;改(gǎi)变其中的数字;添加无关信息。
举个例子,假设原题库中的题目是这样的:
小明周五钓了6条鱼,周六钓了15条鱼,周日钓到的鱼是周五的2倍,问小(xiǎo)明(míng)总(zǒng)共(gòng)收(shōu)获(huò)了(le)多(duō)少(shǎo)条(tiáo)鱼(yú)?
GSM-Symbolic对(duì)这(zhè)道(dào)题(tí)采取(qǔ)以(yǐ)下(xià)3种(zhǒng)方(fāng)式(shì)进(jìn)行(xíng)微(wēi)调(diào):或(huò)是(shì)把(bǎ)原题中的小明换成小丽;或是把原题中6换成9,15换成23;或是增加一些无关信息,比如增加条件“周日钓到的鱼中,有5条鱼的重量低于平均值”。当然,还可能把这几种微调综合在一起。基于这些微调,从GSM8K数据集中的题目出发,GSM-Symbolic可以千变万化出更多题目来对大语言模型进行评估。
从(cóng)人(rén)类(lèi)的(de)视(shì)角(jiǎo)来(lái)看(kàn),这(zhè)些(xiē)微(wēi)调(diào)策(cè)略(è)就(jiù)是(shì)我(wǒ)们(men)常(cháng)说(shuō)的(de)“换(huàn)汤(tāng)不(bù)换(huàn)药(yào)”,做(zuò)过(guò)小(xiǎo)学(xué)数(shù)学(xué)题(tí)的(de)读(dú)者(zhě)们(men)再(zài)熟(shú)悉(xī)不(bù)过(guò)了(le)。所(suǒ)谓(wèi)“不(bù)换(huàn)药(yào)”,是(shì)说(shuō)微(wēi)调(diào)完(wán)全没(méi)有(yǒu)涉(shè)及(jí)这些数学问题的逻辑结构,只是调整了一些无关参数。
正确率大幅下滑
但正是这样的微调,却造成了大语言模型输出答案正确率的大幅下滑。其中(zhōng),无(wú)关信(xìn)息(xi)的(de)添加会导致所有最先进的大语言模(mó)型(xíng)的(de)性(xìng)能(néng)大(dà)幅(fú)下(xià)降(jiàng),降(jiàng)幅(fú)高(gāo)达(dá)65%。
苹(píng)果(guǒ)公(gōng)司(sī)的(de)研(yán)究(jiū)人(rén)员(yuán)基(jī)于(yú)这(zhè)些(xiē)测(cè)评(píng)得(de)出(chū)结(jié)论(lùn):大(dà)语(yǔ)言(yán)模(mó)型(xíng)既(jì)不(bù)理(lǐ)解(jiě)这(zhè)些问题中的数学概念,也不能进行逻辑推理,而仅(jǐn)仅(jǐn)是(shì)将(jiāng)面(miàn)对(duì)的(de)问(wèn)题(tí)和(hé)训(xun)练(liàn)数(shù)据(jù)中(zhōng)的(de)问(wèn)题(tí)进(jìn)行(xíng)比(bǐ)较(jiào)而(ér)已(yǐ)。
目(mù)前(qián)来(lái)看(kàn),大(dà)语(yǔ)言(yán)模(mó)型(xíng)所(suǒ)得(de)出(chū)的(de)正(zhèng)确(què)答(dá)(dá)案(àn)(àn),主要(yào)(yào)体(tǐ)现(xiàn)了(le)系(xì)(xì)统(tǒng)(tǒng)的(de)(de)记(jì)(jì)忆(yì)(yì)和(hé)(hé)匹(pǐ)(pǐ)配(pèi)(pèi)能(néng)力(lì),这(zhè)种(zhǒng)应(yīng)答(dá)机制更像一种模式匹配,这与人类推理的机制完(wán)全不(bù)同(tóng),也(yě)没(méi)有(yǒu)遵循逻辑。
人类才懂“万变不离其宗”
那么,人类在做小学数学推理题时,究竟启用了哪些隐藏技能?
笔者理解至少有两条,一是透过现象看本质的能力:人类能够抓取或识别表层语言背后的一般性运算和(hé)推理的规律;二是由内及外、活学活用的能力(lì):人类能够通过非关键因素(比如前面提到的3种微调因素)的替换和变化展开千变万化的实际应用。
这两条综合起来,就是我们常说的“万变不离其宗”。
(作者张立英系中国科学院哲学研究所教授)