日韩av电影在线观看-在线视频91-麻豆国产91在线播放-欧美人性生活-六月丁香激情-天堂资源中文在线-国产人人看-黄色资源网站-色综合视频在线-成人av片在线观看-不卡的毛片-精品久久久视频-日韩av三区-欧美人妻精品一区二区三区-黑人性高潮

星空人工智能技術(shù)網(wǎng)

昇騰支持Qwen3.8-2.4T-A95B,釋放超大規(guī)模MoE模型推理潛能

 2026年8月12日,Qwen正式開放Qwen3.8-2.4T-A95B模型權(quán)重。作為Qwen新一代旗艦模型,Qwen3.8-2.4T-A95B擁有2.4T總參數(shù)量、95B激活參數(shù),并采用超大規(guī)模MoE與混合線性注意力架構(gòu),對專家并行、跨卡通信、線性注意力計算及顯存效率提出了更高要求。

Qwen3.8-2.4T-A95B開源后,昇騰Atlas 800 A3超節(jié)點通過vLLM-Ascend/SGLang開源推理引擎快速實現(xiàn)了推理支持。圍繞該模型的結(jié)構(gòu)特點,昇騰采用大規(guī)模專家并行、MoE通算融合、GDN線性注意力、量化及Decode加速等關(guān)鍵路徑進行針對性優(yōu)化,充分釋放Qwen3.8-2.4T-A95B在昇騰上的推理性能。

Qwen3.8-2.4T-A95B——新一代超大規(guī)模MoE旗艦模型

Qwen3.8-2.4T-A95B采用稀疏MoE架構(gòu),每個Token僅激活部分專家,在擴展模型容量的同時控制單Token計算開銷。

在Attention層,Qwen3.8采用Gated DeltaNet(GDN)與標準Attention相結(jié)合的混合線性注意力架構(gòu),兼顧長序列處理效率與上下文建模能力。

MoE與混合線性注意力的結(jié)合,也對推理系統(tǒng)提出新的挑戰(zhàn):大規(guī)模Expert的跨NPU部署帶來更高的通信開銷,GDN則引入?yún)^(qū)別于傳統(tǒng)Attention的計算與狀態(tài)管理模式,需要針對模型架構(gòu)進行專項優(yōu)化。

基于昇騰實現(xiàn)Qwen3.8-2.4T-A95B的推理部署

昇騰持續(xù)深耕大模型推理關(guān)鍵技術(shù),從EP64大規(guī)模專家并行、Fused MC2通算融合,到GDN線性注意力與Hybrid Cache優(yōu)化,再到W8A8量化、MTP與ACL Graph Decoe加速,昇騰不斷完善面向前沿模型架構(gòu)的高性能推理能力,通過vLLM-Ascend/SGLang開源推理引擎實現(xiàn)Qwen3.8-2.4T-A95B在昇騰AI基礎(chǔ)軟硬件上的高效部署。

大規(guī)模專家并行:EP64支撐MoE高效部署

針對Qwen3.8 2.4T參數(shù)規(guī)模的MoE架構(gòu),vLLM-Ascend/SGLang支持EP64大規(guī)模專家并行,將不同Expert分布至多NPU協(xié)同執(zhí)行,降低單卡模型權(quán)重與計算壓力,充分發(fā)揮MoE稀疏計算優(yōu)勢。

MoE通算融合:Fused MC2提升大規(guī)模EP效率

隨著Expert Parallel規(guī)模擴大,Token在不同NPU之間的Dispatch與Combine通信成為影響MoE推理效率的關(guān)鍵因素。

vLLM-Ascend使能Fused MC2通算融合能力,圍繞Token Dispatch、Expert Compute與Combine等關(guān)鍵階段進行通信與計算協(xié)同,減少通信等待和Host側(cè)調(diào)度開銷,提升大規(guī)模專家并行場景下的執(zhí)行效率。

混合線性注意力優(yōu)化:GDN融合算子與Hybrid Cache管理

Qwen3.8-2.4T-A95B采用Gated DeltaNet(GDN)與標準Attention相結(jié)合的混合線性注意力架構(gòu),GDN通過固定規(guī)模狀態(tài)承載歷史信息,有效降低長序列場景下的計算與存儲開銷,同時也引入新的線性注意力計算路徑。

針對GDN的計算特點,vLLM-Ascend/SGLang在Prefill階段采用GDN融合算子,以Chunk方式高效處理長序列,并融合關(guān)鍵計算過程,減少中間數(shù)據(jù)搬運和算子調(diào)度開銷。

同時,針對GDN與標準Attention混合存在的模型結(jié)構(gòu),vLLM-Ascend/SGLang采用Hybrid KV Cache / Mamba State管理機制,統(tǒng)一管理Attention層KV Cache與GDN層狀態(tài)緩存,提升顯存利用效率。

W8A8量化:降低超大參數(shù)模型部署的資源開銷

面對2.4T參數(shù)規(guī)模帶來的顯存壓力,vLLM-Ascend/SGLang支持Qwen3.8的W8A8量化部署,適配模型及MoE Expert等關(guān)鍵模塊的量化權(quán)重加載與執(zhí)行,在兼顧模型精度的同時,降低顯存占用和部署資源需求。

Decode加速:MTP與ACL Graph協(xié)同優(yōu)化

Qwen3.8-2.4T-A95B具備Multi-Token Prediction(MTP)能力。vLLM-Ascend/SGLang支持MTP投機推理,通過預測后續(xù)Token并由主模型進行校驗,提升單次模型執(zhí)行產(chǎn)生的有效Token數(shù)量,加速Decode過程。

同時,Decode階段支持ACL Graph,通過將高頻執(zhí)行的計算路徑捕獲為設(shè)備側(cè)執(zhí)行圖,降低Host調(diào)度與Kernel下發(fā)開銷,并與MTP協(xié)同優(yōu)化,進一步提升Token生成效率。

星空人工智能技術(shù)網(wǎng) 倡導尊重與保護知識產(chǎn)權(quán)。如發(fā)現(xiàn)本站文章存在版權(quán)等問題,煩請30天內(nèi)提供版權(quán)疑問、身份證明、版權(quán)證明、聯(lián)系方式等發(fā)郵件至1851688011@qq.com我們將及時溝通與處理。?。?a href="/">首頁 > 星空人工智能產(chǎn)業(yè) > AI大模型 » 昇騰支持Qwen3.8-2.4T-A95B,釋放超大規(guī)模MoE模型推理潛能

感覺不錯,很贊哦! ()
分享到:

相關(guān)推薦

留言與評論(共有 0 條評論)
   
驗證碼: