官方网站-首页官方网站-首页

软硬协同优化,安谋科技新一代“周易”NPU实现DeepSeek-R1端侧高效部署

形状
形状
形状
形状
形状
形状
形状
形状

近日,搭载安谋科技最新一代“周易”NPU处理器的硬件平台成功运行DeepSeek-R1系列模型,性能卓越、成本优异,为用户带来了更高效、便捷的AI应用体验。这款创新性NPU处理器采用专为大模型特性优化的架构设计,其(qí)beta版(bǎn)本(běn)在(zài)2024年(nián)底(dǐ)已(yǐ)面(miàn)向(xiàng)早(zǎo)期(qī)用(yòng)户(hù)开(kāi)放(fàng)评(píng)估(gū)测(cè)试(shì),并(bìng)获(huò)得(de)了(le)广(guǎng)泛(fàn)认(rèn)可(kě)与(yǔ)积(jī)极(jí)反(fǎn)馈。预计今年上半年,这款备受期待的NPU产品将正式亮相市场,届时将为更多用户带来突破性的端侧算力体验。

11.jpg

DeepSeek自发布以来,凭借其出色的性能表现和低成本训练模式,迅速成为AI领域的焦点。在DeepSeek-R1的1.5B和7B蒸馏版本推出后,安谋科技新一代“周易”NPU处理器短时间内在Emulation平台上完成了部署与优化,并在FPGA平台上成功实现了端到端应用的演示。

经过严苛的测(cè)试验证,新一代“周易”NPU处理器在运行DeepSeek-R1的1.5B和7B蒸馏版本时表现优异。在标准单批次输入、上下文长度为1024的(de)测试(shì)环境中,其在首字计算阶段的算力利用率突破40%,解码阶段的有效带宽利用率高达80%以上。其带宽利用率呈现高线性特性,能够灵活适配16GB/s至256GB/s的系统带宽需求。在7B版本、1024上下文长度的场景下,该处理器在(zài)充(chōng)分(fēn)保(bǎo)障(zhàng)模(mó)型(xíng)应(yīng)用(yòng)精(jīng)度(dù)的(de)同(tóng)时(shí),最(zuì)高(gāo)处(chù)理(lǐ)速(sù)度(dù)可(kě)达(dá)40 tokens/s,并(bìng)支(zhī)持(chí)动(dòng)态(tài)长(zhǎng)度(dù)的(de)模(mó)型(xíng)推(tuī)理(lǐ)输(shū)入(rù)。面(miàn)对(duì)复(fù)杂(zá)AI任(rèn)务(wu)时(shí),“周(zhōu)易(yì)”NPU处(chù)理(lǐ)器(qì)凭(píng)借(jiè)其(qí)卓(zhuō)越(yuè)的(de)计(jì)算(suàn)性(xìng)能(néng)、高(gāo)带(dài)宽(kuān)利(lì)用(yòng)率(lǜ)和(hé)能(néng)效(xiào)比(bǐ),展(zhǎn)现(xiàn)出(chū)显(xiǎn)著(zhe)的(de)技(jì)术(shù)优(yōu)势(shì),为(wèi)终端设备的智能化升级提供了(le)强(qiáng)劲(jìn)“芯(xīn)”动(dòng)力(lì)。

 QQ浏(liú)览(lǎn)器(qì)截(jié)图(tú)20250214162936.png

新(xīn)一(yī)代(dài)“周(zhōu)易(yì)”NPU处(chù)理(lǐ)器(qì)运(yùn)行(xíng)DeepSeek-R1模(mó)型(xíng)效(xiào)果(guǒ)演(yǎn)示(shì)

新(xīn)一(yī)代(dài)“周(zhōu)易(yì)”NPU处(chù)理(lǐ)器(qì)对(duì)DeepSeek等(děng)最(zuì)新(xīn)大(dà)模(mó)型(xíng)的(de)高(gāo)效(xiào)适(shì)配(pèi)和(hé)调优,得益于其软件栈对大模型的成熟支持。软件栈提供高效的量化编译工具,能够在显著压缩模型体积的同时,保持高性能推理能力,并通过灵活的编译选项满足多样化需求。此外,软件栈针对大模型进行了深度优化,包括动态推理优化和硬件算力潜力的挖掘,从而显著提升推理速度和吞吐量。目前,软件栈已支持Llama、Qwen、DeepSeek、ChatGLM和MiniCPM等多种主流大模型,并提供了与Hugging Face模型库的对接工具链,方便用户直接部署(shǔ)主流(liú)模(mó)型(xíng)。

在(zài)硬(yìng)件(jiàn)层(céng)面(miàn),新(xīn)一(yī)代(dài)“周(zhōu)易(yì)”NPU处(chù)理(lǐ)器(qì)突(tū)破(pò)了(le)传(chuán)统(tǒng)设(shè)计(jì)限(xiàn)制(zhì),将(jiāng)对(duì)外(wài)带(dài)宽(kuān)提(tí)高(gāo)至(zhì)256GB/s,有(yǒu)效(xiào)解(jiě)决(jué)了(le)大(dà)模(mó)型(xíng)计(jì)算(suàn)的(de)带(dài)宽(kuān)瓶颈问题。为满足端侧大模型对高精度的需求,该NPU处理器全面支持FP16计算,并提供完整的int4软硬量化加速方案,确保模型高效稳定运行。针对端侧模型的低首字延迟需求,“周易”NPU处理器通过软硬协同优化,实现了多核算力的高效扩展。在7nm制程工艺下,单Cluster算力最高可达80 TOPS,能够轻松应对超过16K上下文长度的大模型部署需求,同时满足多模态场景及思维(wéi)链(liàn)计(jì)算(suàn)的(de)高算力要求。此外,该NPU处理器还具备强大的多任务并行处理能力,通过细粒度的任务调度和优先级资源分配,实现多任务灵活切换,确保传统语音、视觉业务与大模型应用高效(xiào)协(xié)同(tóng),为(wèi)用(yòng)户(hù)带(dài)来(lái)更(gèng)加(jiā)流(liú)畅(chàng)的(de)使(shǐ)用(yòng)体(tǐ)验(yàn)。

目(mù)前(qián),安(ān)谋(móu)科(kē)技(jì)正(zhèng)在(zài)积(jī)极(jí)拓(tà)展(zhǎn)DeepSeek系(xì)列(liè)模(mó)型(xíng)在(zài)端侧加速卡的应用场景,通过提升模型推理性能,加速端侧AI应用的商业化落地进程。依托雄厚的技术积累、生态系统优势以及前瞻性布局,安谋科技将持续推动(dòng)AI大(dà)模(mó)型(xíng)技(jì)术(shù)在(zài)PC、手(shǒu)机(jī)、智(zhì)能(néng)汽(qì)车(chē)、机(jī)器(qì)人(rén)、可(kě)穿(chuān)戴(dài)设(shè)备(bèi)等(děng)多(duō)终(zhōng)端(duān)领(lǐng)域的(de)深(shēn)度(dù)应(yīng)用(yòng)与(yǔ)创(chuàng)新(xīn),全面(miàn)加(jiā)速(sù)端(duān)侧(cè)AI生(shēng)态(tài)的(de)构(gòu)建(jiàn)与(yǔ)完(wán)善(shàn)。

发表评论