3 月 11 日消息,科大讯飞研究院官宣,科大讯飞携手华为在国产算力领域取得重大进展,双方联合团队率先突破国产算力集群上 MoE 模型的大规模跨节点专家并行集群推理,这是继 DeepSeek 公布其 MoE 模型训练推理方案后,业界首个基于国产算力的全新解决方案。

联合团队通过软硬件的深度协同创新,在多个关键技术层面深挖硬件潜力,完成昇腾集群上的验证和部署。在算子(zi)融(róng)合(hé)方(fāng)面(miàn),团(tuán)队(duì)在(zài) MLA 预(yù)处(chù)理(lǐ)阶(jiē)段(duàn)通(tōng)过(guò) Vector 与(yǔ) Cube 异(yì)构(gòu)计(jì)算(suàn)单(dān)元(yuán)并(bìng)行(xíng)流(liú)水(shuǐ),并(bìng)将(jiāng)多(duō)个(gè)小(xiǎo)算(suàn)子(zi)融(róng)合(hé)重(zhòng)构(gòu)为(wèi)原(yuán)子(zi)级(jí)计(jì)算(suàn)单(dān)元(yuán),消(xiāo)除(chú)小(xiǎo)算(suàn)子(zi)下(xià)发(fā)开(kāi)销(xiāo),MLA 前(qián)处(chù)理(lǐ)时(shí)延(yán)降(jiàng)低(dī) 50%+,实(shí)现(xiàn)性(xìng)能(néng)的(de)显(xiǎn)著(zhe)提升。
科大讯飞研(yán)究(jiū)院(yuàn)介(jiè)绍(shào)称(chēng),在(zài)混(hùn)合(hé)并(bìng)行(xíng)策略和通信计算并行优化方面,团队构建了 TP(张量并行)+EP(专家并行)混合范式:对 MLA 计算层采用机内 TP 并行,发挥机内高速互(hù)联(lián)优(yōu)势(shì),降(jiàng)低(dī)跨(kuà)机(jī)通(tōng)信(xìn)损(sǔn)耗(hào);创(chuàng)新(xīn) MoE 专(zhuān)家(jiā)分(fēn)层(céng)调(diào)度(dù),64 卡(kǎ)均(jūn)衡(héng)分(fēn)配专家计算节点,定制 AllToAll 通信协议,专家数据交换效率提升 40%,构建跨机 / 机内双层通信架构,通过分层优化降低跨机流量 60%;同时研发路由专家负载均衡算法,实现卡间负载差异小于 10%,集群吞吐提升 30%。
通过分布式架构创新与算法协同优化,联合团队在国产算力上实现了显著的性能提升。单卡静(jìng)态(tài)内(nèi)存(cún)占(zhàn)用(yòng)缩(suō)减(jiǎn)至(zhì)双(shuāng)机(jī)部(bù)署(shǔ)的(de) 1/4,效(xiào)率(lǜ)提(tí)升(shēng) 75%,专(zhuān)家(jiā)计(jì)算(suàn)密(mì)度(dù)增(zēng)加(jiā) 4 倍(bèi),推(tuī)理(lǐ)吞吐提升 3.2 倍,端到端时延降低 50%。
科大讯飞研究院表示,这一突破性的解决方案也将应用于讯飞星火深度推理模型的训练加速,预期训练时推理效率将提升 200%。同时,基于该方案的推理(lǐ)引(yǐn)擎(qíng)也(yě)实(shí)现(xiàn)了(le)国(guó)产算力上 DeepSeek V3 和 R1 的高效推理。
IT之家从科大讯飞公告获悉,科大讯飞深度推理大模型星火 X1 也完成升级,在模型参数量比业界同行少一个数量级的情况下,星火 X1 的数学能力全面对标 DeepSeek R1 和 OpenAI o1,在中文数学各项任务中“均实现领先”。
官方网站-首页