8月28日,2026中國(guó)國(guó)際大數(shù)據(jù)產(chǎn)業(yè)博覽會(huì)期間,中科曙光發(fā)布新一代詞元加速方案ParaCache。該方案通過(guò)保存并復(fù)用大模型已經(jīng)完成的計(jì)算結(jié)果,減少不同請(qǐng)求、不同計(jì)算節(jié)點(diǎn)之間的重復(fù)計(jì)算。測(cè)試顯示,在約12萬(wàn)詞元輸入下,ParaCache可使模型開(kāi)始回答前的等待時(shí)間最高降低98.5%;高并發(fā)場(chǎng)景下,系統(tǒng)每秒處理的詞元量最高達(dá)到原來(lái)的27倍。
少做重復(fù)計(jì)算,讓算過(guò)的直接復(fù)用
隨著大模型進(jìn)入長(zhǎng)文本、多輪對(duì)話、知識(shí)庫(kù)問(wèn)答和智能體等場(chǎng)景,大量相同或相似內(nèi)容被反復(fù)計(jì)算,不僅增加等待時(shí)間,也持續(xù)消耗算力資源。
ParaCache的思路很直接:把已經(jīng)算過(guò)的結(jié)果長(zhǎng)時(shí)間保存下來(lái),下次需要時(shí)直接復(fù)用。
該方案統(tǒng)一管理GPU顯存、CPU內(nèi)存、固態(tài)硬盤(pán)和分布式存儲(chǔ),根據(jù)使用頻率對(duì)計(jì)算結(jié)果進(jìn)行分層存放和智能調(diào)度,并支持在不同請(qǐng)求、不同計(jì)算節(jié)點(diǎn)之間共享,實(shí)現(xiàn)“一次計(jì)算、多次使用”。
ParaCache以曙光分布式存儲(chǔ)ParaStor為基礎(chǔ),并融合集中式全閃存儲(chǔ)FlashNexus,將存儲(chǔ)能力從保存原始數(shù)據(jù)進(jìn)一步延伸至保存和復(fù)用大模型計(jì)算結(jié)果,在減少重復(fù)計(jì)算的同時(shí),降低對(duì)高成本顯存的占用。
“多快好省”,推理效率全面提升
ParaCache帶來(lái)的價(jià)值,可以概括為“多、快、好、省”。
“多”:高并發(fā)場(chǎng)景下,系統(tǒng)每秒處理的詞元量最高達(dá)到原來(lái)的27倍,同樣的硬件資源能夠承接更多業(yè)務(wù)請(qǐng)求。
“快”:輸入約12萬(wàn)詞元時(shí),單輪對(duì)話開(kāi)始回答前的等待時(shí)間可降至0.4秒;連續(xù)20輪對(duì)話中,這一時(shí)間由43.1秒降至4.9秒。
“好”:兼容主流推理框架和國(guó)產(chǎn)AI加速卡,可在現(xiàn)有系統(tǒng)基礎(chǔ)上接入,降低部署和遷移成本。
“省”:高頻內(nèi)容保留在顯存,其他內(nèi)容轉(zhuǎn)移至成本更低的存儲(chǔ)設(shè)備,減少對(duì)高成本顯存和新增硬件資源的依賴(lài)。
目前,ParaCache已在國(guó)內(nèi)某頭部互聯(lián)網(wǎng)企業(yè)在線推理業(yè)務(wù)中落地,模型開(kāi)始回答前的平均等待時(shí)間降低50%以上;在同等硬件條件下,系統(tǒng)可承載的業(yè)務(wù)請(qǐng)求也提升數(shù)倍。
同時(shí),ParaCache已在全國(guó)產(chǎn)十萬(wàn)卡AI超集群曙光8000上完成驗(yàn)證,可面向長(zhǎng)文本對(duì)話、知識(shí)庫(kù)問(wèn)答、智能客服、智能體及高并發(fā)推理等場(chǎng)景。
中科曙光分布式存儲(chǔ)產(chǎn)品部總經(jīng)理石靜表示,ParaCache不是簡(jiǎn)單提升單張GPU的性能,而是通過(guò)減少重復(fù)計(jì)算,把更多算力用于處理新的任務(wù)。
過(guò)去,存儲(chǔ)主要負(fù)責(zé)保存數(shù)據(jù)。ParaCache進(jìn)一步將模型已經(jīng)完成的計(jì)算結(jié)果納入存儲(chǔ)和復(fù)用體系。對(duì)于大模型推理而言,少一次重復(fù)計(jì)算,就意味著少一段等待,也少一份算力消耗。
圍繞本屆數(shù)博會(huì)“詞元——數(shù)據(jù)要素價(jià)值釋放新路徑”主題,ParaCache提供了一條更具體的技術(shù)路徑:不僅保存數(shù)據(jù),也保存數(shù)據(jù)在計(jì)算過(guò)程中產(chǎn)生的結(jié)果,讓一次計(jì)算形成的價(jià)值被持續(xù)復(fù)用。
星空人工智能技術(shù)網(wǎng) 倡導(dǎo)尊重與保護(hù)知識(shí)產(chǎn)權(quán)。如發(fā)現(xiàn)本站文章存在版權(quán)等問(wèn)題,煩請(qǐng)30天內(nèi)提供版權(quán)疑問(wèn)、身份證明、版權(quán)證明、聯(lián)系方式等發(fā)郵件至1851688011@qq.com我們將及時(shí)溝通與處理。!:首頁(yè) > 星空人工智能產(chǎn)業(yè) > AI大模型 » 讓大模型少做重復(fù)計(jì)算,中科曙光發(fā)布ParaCache