近日,華為云大模型后訓(xùn)練團(tuán)隊發(fā)布技術(shù)報告《AgentOmnia: Scaling Agentic Models for Full-Scenario Applications》,提出面向全場景應(yīng)用的Agent大模型后訓(xùn)練體系A(chǔ)gentOmnia,探索如何推動Agent從“在專項測試中表現(xiàn)優(yōu)秀”進(jìn)一步確保“能夠適應(yīng)不同用戶、業(yè)務(wù)系統(tǒng)和復(fù)雜任務(wù)”,從而提升其面向多類真實應(yīng)用場景的通用能力。
大語言模型驅(qū)動的Agent正從工具調(diào)用走向與用戶和復(fù)雜環(huán)境的持續(xù)交互。然而,現(xiàn)有訓(xùn)練與評測通常圍繞有限的領(lǐng)域或平臺展開。模型在單項benchmark上取得高分,并不代表它能夠穩(wěn)定處理企業(yè)軟件、消費(fèi)者服務(wù)、辦公文檔、數(shù)據(jù)分析和復(fù)雜規(guī)劃等不同任務(wù)。
針對這一問題,華為云大模型后訓(xùn)練團(tuán)隊提出AgentOmnia,探索Full-Scenario Agentic Scaling,即如何通過統(tǒng)一的任務(wù)空間,銜接數(shù)據(jù)構(gòu)造、模型后訓(xùn)練、評測診斷與持續(xù)迭代,系統(tǒng)擴(kuò)展Agent大模型的全場景能力。
以Qwen3-30B-A3B-Thinking-2507為基礎(chǔ)模型進(jìn)行Agentic后訓(xùn)練,AgentOmnia-30B-A3B在全場景測評基準(zhǔn)OmniaBench挑戰(zhàn)集上的任務(wù)通過率由9.16%提升至37.11%,提升覆蓋 76/90 個L1 domain及全部capability和atomic difficulty維度。此外,AgentOmnia在OmniaBench、τ²-Bench、DeepPlanning和VitaBench四項基準(zhǔn)的宏平均由22.86%提升至41.69%,綜合得分超過多項同類型前沿工作。

▲AgentOmnia整體評測結(jié)果。 以Qwen3-30B-A3B-Thinking-2507為基礎(chǔ)模型,展示AgentOmnia在四項基準(zhǔn)宏平均、跨基準(zhǔn)表現(xiàn),以及領(lǐng)域、能力和原子難度維度上的提升。
AgentOmnia以全場景分類體系定義任務(wù)空間,以環(huán)境、任務(wù)和軌跡合成構(gòu)建訓(xùn)練數(shù)據(jù),再通過SFT與在線Agentic RL提升模型能力。評測結(jié)果和外部需求還可以進(jìn)一步轉(zhuǎn)化為PRD,指導(dǎo)下一輪針對性數(shù)據(jù)構(gòu)造。
▲AgentOmnia全場景Agent大模型后訓(xùn)練體系。 全場景分類體系定義并度量任務(wù)空間,數(shù)據(jù)合成模塊構(gòu)建可執(zhí)行環(huán)境、任務(wù)與可靠軌跡,SFT和在線Agentic RL將其轉(zhuǎn)化為模型能力,評測診斷與PRD則進(jìn)一步指導(dǎo)后續(xù)數(shù)據(jù)合成和模型迭代。
用統(tǒng)一坐標(biāo)描述全場景能力
AgentOmnia建立了Domain × Capability × Atomic Difficulty三軸分類體系,覆蓋To-Consumer、To-Business和To-Employee三類應(yīng)用,包括90個一級領(lǐng)域、354個二級領(lǐng)域、10類能力和8類原子難度因素。
該體系既用于規(guī)劃合成數(shù)據(jù)的覆蓋范圍,也用于評測后的細(xì)粒度診斷。同期發(fā)布的OmniaBench將其落實為包含1,431個任務(wù)的全場景Agent benchmark。
▲面向全場景Agent任務(wù)的三軸分類體系。Domain描述任務(wù)所在的應(yīng)用場景,Capability描述完成任務(wù)所需的能力,Atomic Difficulty描述任務(wù)困難的原因,三者共同連接數(shù)據(jù)構(gòu)造與評測診斷。
構(gòu)建“困難但可驗證”的訓(xùn)練數(shù)據(jù)
AgentOmnia共構(gòu)建5,018個代碼驅(qū)動的有狀態(tài)環(huán)境、255,375個工具和52,361個任務(wù)。環(huán)境與任務(wù)采用雙向合成,并通過三類任務(wù)管線擴(kuò)展不同推理結(jié)構(gòu):
DAG-based synthesis構(gòu)建多工具依賴與長鏈工作流;
Program-based synthesis表達(dá)分支、循環(huán)和運(yùn)行時數(shù)據(jù)依賴;
Solver-based synthesis覆蓋選擇、調(diào)度、規(guī)劃與全局約束優(yōu)化。
與單純依賴教師模型生成答案不同,AgentOmnia使用程序、求解器、狀態(tài)變化、評分細(xì)則和驗證器建立獨(dú)立的正確性依據(jù)。在此基礎(chǔ)上形成53K個SFT樣本和5K個RL訓(xùn)練任務(wù)。
▲AgentOmnia的全場景數(shù)據(jù)合成體系。 雙向環(huán)境—任務(wù)合成連接代碼驅(qū)動的可執(zhí)行環(huán)境、DAG、Program和Solver三類任務(wù)管線,并進(jìn)一步生成經(jīng)過校驗的訓(xùn)練軌跡。
讓困難任務(wù)真正產(chǎn)生學(xué)習(xí)信號
對于教師模型難以直接求解的任務(wù),AgentOmnia在數(shù)據(jù)合成階段引入特權(quán)指導(dǎo),幫助教師生成可靠軌跡;最終保留的軌跡仍須通過任務(wù)評分、邏輯一致性、證據(jù)grounding和泄漏檢查。
在線Agentic RL階段,Rollback-based Curriculum Reinforcement Learning會在一組rollout全部失敗時,從經(jīng)過驗證的軌跡前綴恢復(fù)探索,再隨著模型能力提升逐步縮短前綴,使困難任務(wù)也能產(chǎn)生有效訓(xùn)練信號。
▲AgentOmnia SFT與Agentic RL后訓(xùn)練流程。 特權(quán)指導(dǎo)幫助生成困難任務(wù)的可靠監(jiān)督軌跡,RCRL則為常規(guī)rollout全部失敗的任務(wù)恢復(fù)學(xué)習(xí)信號。
從評測診斷走向持續(xù)演進(jìn)
AgentOmnia利用Diagnose Agent從評測結(jié)果中自動抽取Product Requirements Documents(PRDs),明確目標(biāo)場景、能力缺口、環(huán)境語義、任務(wù)結(jié)構(gòu)、合成約束和驗收條件,從而指導(dǎo)下一輪環(huán)境、任務(wù)和軌跡合成。另一方面,PRD作為AgentOmnia的自演進(jìn)數(shù)據(jù)協(xié)議,還可以高效連接業(yè)務(wù)需求與模型研發(fā),產(chǎn)品經(jīng)理或業(yè)務(wù)人員撰寫PRD即可直接引導(dǎo)后續(xù)的數(shù)據(jù)合成與模型演進(jìn)。
依據(jù)OmniaBench診斷結(jié)果構(gòu)建121個環(huán)境和804個任務(wù),進(jìn)行小規(guī)模的自演進(jìn)技術(shù)驗證。完成一輪增量訓(xùn)練后,OmniaBench挑戰(zhàn)集由37.11%提升至38.49%,三項外部基準(zhǔn)宏平均由43.22%提升至44.14%,初步證明了技術(shù)的有效性和泛化性。
▲PRD引導(dǎo)的模型持續(xù)演進(jìn)閉環(huán)。 評測失敗被聚合為能力診斷,并轉(zhuǎn)化為包含環(huán)境、任務(wù)、驗證和數(shù)據(jù)優(yōu)先級要求的PRD,進(jìn)一步指導(dǎo)下一輪數(shù)據(jù)合成與模型后訓(xùn)練。
團(tuán)隊后續(xù)將嘗試在性能更強(qiáng)的新一代基礎(chǔ)模型上驗證這一體系,擴(kuò)大數(shù)據(jù)合成與診斷規(guī)模,開展多輪自演進(jìn)的實驗。同時也將探索如何從產(chǎn)品文檔、業(yè)務(wù)需求和代表性用戶Query出發(fā),構(gòu)建更貼近真實產(chǎn)品運(yùn)行條件的環(huán)境和任務(wù),在華為云智果AgentArts、OfficeAce辦公智能體等核心產(chǎn)品場景中完成后訓(xùn)練技術(shù)能力的遷移應(yīng)用。
星空人工智能技術(shù)網(wǎng) 倡導(dǎo)尊重與保護(hù)知識產(chǎn)權(quán)。如發(fā)現(xiàn)本站文章存在版權(quán)等問題,煩請30天內(nèi)提供版權(quán)疑問、身份證明、版權(quán)證明、聯(lián)系方式等發(fā)郵件至1851688011@qq.com我們將及時溝通與處理。?。?a href="/">首頁 > 星空人工智能產(chǎn)業(yè) > AI大模型 » AgentOmnia:面向全場景能力擴(kuò)展的Agent大模型后訓(xùn)練技術(shù)實踐