新闻中心

开源第二弹!DeepSeek突破极限,颠覆级创新

发布时间:2025-02-28 09:08:54  /  浏览次数:519 次

2月25日,DeepSeek在“开源周”的第二日开源了DeepEP通信库。DeepSeek表示,这是第一个用于MoE(专家)模型训练和推理的开源EP通信库。

“高效、优化的全员沟通;节点内和节点间均支持NVLink和RDMA(远程直接内存访问,一种通信技术);用于训练和推理预(yù)填(tián)充(chōng)的(de)高(gāo)吞(tūn)吐(tǔ)量内核;用于推理解码的低延迟内核;原生FP8调度支持;灵活的GPU(图形处理器)资源控制,实现计算与通信重叠。”DeepSeek如此介绍DeepEP的特点。

EP即expert parallelism(专家并行),是一种在大规模分布式AI模型训练中使用的技术,能用于(yú)提(tí)升(shēng)模型并行处理能力和训练效率。DeepSeek表示,对于延迟敏感的推理解码任务,DeepEP包含有一组使用纯RDMA的低延迟内核,可以用于将延迟最小化,DeepEP还引入一种通信与计算重叠的方法,这种方法(fǎ)可(kě)以(yǐ)不(bù)占(zhàn)用(yòng)SM(流(liú)处(chù)理(lǐ)器(qì))资(zī)源(yuán)。简(jiǎn)而(ér)言(yán)之,DeepEP也是用于提升GPU(图形处理器)利用效率的关键技术之一。

有位软件工程师激动地表示,“DeepSeek在MoE模型上所达到的优化水平,令人印象深刻,因为MoE模型因其规模和复杂性而广为人知,难度非常大。而DeepEP能够如此精确地处理这些问题,使用像NVLink和RDMA这样的先进硬件,并且支持FP8,真是太牛了。”


有网友称,DeepSeek再次突破了AI基础设施的极限。这种创新方法或将改变AI领域的沟通方式。从此,AI开发者也许能有效突破大规模AI模型的界限。

性能可比肩OpenAI o1的DeepSeek-R1是基于DeepSeek-V3训练出来的模型,DeepSeek-V3此前就以不大规模使用最先进的英伟达GPU、低训练预算著称。为了在已有的GPU上训练大模型,DeepSeek进行了诸多创新,以高效利用GPU算力。有学界人士此前就解读了DeepSeek-V3实现计算与通信重叠的重要作用。

清华大学计算机系长聘教授翟季冬在解读DeepSeek的相关技术时表示,DeepSeek-V3为了训练效率提(tí)升(shēng),做了四方面的优化,包括负载均衡、通信优化、内存优化和计算优化。为此,DeepSeek团队充分挖掘了算法、软件和硬件协同创新的潜力,例如为了(le)降(jiàng)低(dī)通(tōng)信(xìn)开(kāi)销(xiāo)想(xiǎng)了(le)很(hěn)多(duō)办(bàn)法(fǎ),包(bāo)括(kuò)精(jīng)细(xì)化(huà)编(biān)排(pái)计(jì)算(suàn)和(hé)通(tōng)讯(xùn)。“DeepSeek提(tí)出(chū)一(yī)种(zhǒng)流(liú)水(shuǐ)线(xiàn)并(bìng)行(xíng)算(suàn)法(fǎ)DualPipe,通(tōng)过(guò)精(jīng)细(xì)控(kòng)制(zhì)分(fēn)配(pèi)给(gěi)计(jì)算(suàn)和(hé)通(tōng)信(xìn)的(de)GPU SM数(shù)量(liàng),实(shí)现(xiàn)计(jì)算(suàn)和(hé)通(tōng)信(xìn)完(wán)全重(zhòng)叠(dié),从(cóng)而(ér)提(tí)高(gāo)GPU资(zī)源(yuán)的(de)利(lì)用(yòng)率(lǜ)。期(qī)间(jiān),DeepSeek团(tuán)队(duì)使(shǐ)用(yòng)了(le)英(yīng)伟(wěi)达(dá)底(dǐ)层(céng)的(de)PTX语(yǔ)言(yán)来(lái)控(kòng)制(zhì)SM的(de)使(shǐ)用(yòng)。” 翟(dí)季(jì)冬(dōng)表(biǎo)示(shì)。中(zhōng)存(cún)算(suàn)半(bàn)导(dǎo)体(tǐ)董(dǒng)事(shì)长(zhǎng)陈(chén)巍(wēi)解(jiě)析(xī)DeepSeek-V3和(hé)R1训练结构的独特优势时也指出,DeepSeek设计了DualPipe算法来实现更高效的流水线并行,并通过计算与通信的重叠隐藏了大模型训练过程中的大部分通信开销。此外,DeepSeek开发了跨节点All-to-All通信内核,以充分利用InfiniBand和NVLink带宽,对显存使用进行了优化,使得DeepSeek无需使用昂贵的张量并行即可训练DeepSeek-V3。就开源DeepEP通信库的影响询问DeepSeek后,它的回答是,DeepEP能显著提升MoE模型的训练和推理效率,显著降低计算资源消耗,开源DeepEP有助于降低AI技术的开发成本,且有助于减少重发开发。

DeepSeek此前宣布,本周会陆续开源5个代码库。加上2月24日开源的代码库FlashMLA,DeepSeek已开源了(le)2个(gè)代(dài)码(mǎ)库(kù),接(jiē)下(xià)来(lái)还(hái)有(yǒu)3个(gè)代(dài)码(mǎ)库(kù)待(dài)开(kāi)源(yuán)。