環(huán)境」用插件包成可訓(xùn)練 Agent,讓 LLM 在死物里學(xué)會(huì)決策)
Google EnvHarness把「靜態(tài)環(huán)境」用插件包成可訓(xùn)練 Agent讓 LLM 在死物里學(xué)會(huì)決策Hugging Face 每日論文2026-08-22 精選 · 事實(shí)流論文EnvHarness: Awakening Static Worlds for Agent Learning作者Chengsong Huang、Zifeng Wang、Rujun Han、Jun Yan、Yanfei Chen、Ke Jiang、Peng Xia、Han Yu、Jiaqi Pan、Bhavana Dalvi Mishra、Jiaxin Huang、Burak Gokturk、Tomas Pfister、Chen-Yu LeeGoogleGitHubgoogle-research/envharness136 stars項(xiàng)目頁(yè)https://envharness.com/arXiv2608.198802026-08-20一句話總結(jié)Google 這篇 8 月 20 日的論文解決了 Agent RL 訓(xùn)練里一個(gè)最樸素的問(wèn)題當(dāng)環(huán)境是靜態(tài)的、沒(méi)法改的時(shí)候怎么讓它針對(duì)某個(gè) Agent 的弱點(diǎn)變成可訓(xùn)練解法是把「環(huán)境修改」抽成一層可編程插件EnvHarness再用EnvRigger自動(dòng)化生成這些插件二者構(gòu)成「Agent 與環(huán)境共同進(jìn)化」的閉環(huán)。在 5 個(gè) benchmark、4 個(gè)領(lǐng)域的實(shí)驗(yàn)中EnvHarness 在未見(jiàn)過(guò)的實(shí)例上比原始環(huán)境最多高出 9.0 分執(zhí)行步數(shù)減少9.8%——這意味著同樣一個(gè)靜態(tài)環(huán)境被插件「包」一下之后就能榨出更強(qiáng)的訓(xùn)練信號(hào)。一、要解決的真問(wèn)題LLM Agent 訓(xùn)練的環(huán)境瓶頸過(guò)去三年 LLM Agent 論文幾乎都默認(rèn)一個(gè)隱含條件環(huán)境會(huì)響應(yīng)。但工程化部署的現(xiàn)實(shí)是相反的——絕大多數(shù)真實(shí)任務(wù)環(huán)境是靜態(tài)的SQL 數(shù)據(jù)庫(kù)表結(jié)構(gòu)固定Agent 不能改瀏覽器自動(dòng)化DOM 結(jié)構(gòu)由前端開(kāi)發(fā)者決定代碼倉(cāng)庫(kù)除非顯式 fork否則 Agent 看不到修改后的狀態(tài)操作系統(tǒng) shell文件系統(tǒng)是別人管理好的。這就造成了一個(gè)尷尬的局面Agent 的策略在變強(qiáng)環(huán)境卻原地踏步。強(qiáng)化學(xué)習(xí)最依賴的「獎(jiǎng)勵(lì)信號(hào)多樣性」就枯竭了——RL 需要大量軌跡變體但固定環(huán)境的軌跡變體是有限的。Google 給出的解法思路很巧不改環(huán)境改 Agent 看到的「入口」。二、EnvHarness環(huán)境外再套一層「可編程插件」EnvHarness 是一個(gè)插件層harness layer外掛在靜態(tài)環(huán)境外面對(duì)外暴露同樣的接口但內(nèi)部把 Agent 的行為做了重塑不動(dòng)環(huán)境核心原環(huán)境的 verifier、狀態(tài)機(jī)、獎(jiǎng)勵(lì)邏輯全部保留可編程注入用插件重寫 Agent 的觀察、重寫它的動(dòng)作映射、重寫它的獎(jiǎng)勵(lì) shape統(tǒng)一接口插件以標(biāo)準(zhǔn)協(xié)議掛載所以同一個(gè)環(huán)境可以接不同領(lǐng)域的 Agent。關(guān)鍵設(shè)計(jì)取舍「harness 與環(huán)境解耦」。以往改造環(huán)境的做法是改環(huán)境本身代價(jià)是不同任務(wù)要寫不同的環(huán)境變體現(xiàn)在把改造放在 harness 層環(huán)境不變、插件可換、訓(xùn)練信號(hào)換思路。論文把這種結(jié)構(gòu)稱為「pluginable harness」——在軟件工程里這就是經(jīng)典的「中間件」思維但用在 RL 環(huán)境上是新的。三、EnvRigger自動(dòng)生成插件讓環(huán)境跟著 Agent 走僅有 EnvHarness 還不夠——插件要人寫就退化成「每個(gè)任務(wù)一組 hack」。Google 給的第二件工具是EnvRigger作用是自動(dòng)合成 harness 組件。EnvRigger 的工作流是四步黑盒觀察把目標(biāo)策略當(dāng)成黑盒輸入一串任務(wù)讓它跑出一堆軌跡失敗診斷分析軌跡里 Agent 卡在哪、錯(cuò)在哪、把哪些狀態(tài)判斷錯(cuò)了插件合成根據(jù)失敗模式生成對(duì)應(yīng)的 harness 插件——比如「把這一類狀態(tài)觀察值換成更稀疏的表征」「把這一類動(dòng)作重命名」「把這一類子任務(wù)獎(jiǎng)勵(lì)放大」新軌跡回歸在合成出的插件上跑一組 fresh rollouts驗(yàn)證插件確實(shí)改善了 Agent 表現(xiàn)避免過(guò)擬合到某類樣本。整個(gè)流程是policy 在變 → harness 在變 → policy 再變的循環(huán)所以論文核心敘事是「agent-environment co-evolution」——Agent 和環(huán)境共同進(jìn)化。四、關(guān)鍵實(shí)驗(yàn)數(shù)字論文 abstract 給了兩組核心數(shù)字評(píng)測(cè)數(shù)字Benchmark 覆蓋5 個(gè) / 4 個(gè)領(lǐng)域未見(jiàn)實(shí)例最大提升9.0 分執(zhí)行步數(shù)減少9.8%解讀這兩組數(shù)字9.0 分是「未見(jiàn)實(shí)例」評(píng)估集不參與 harness 合成所以這 9 分不是過(guò)擬合而是泛化提升9.8% 步數(shù)減少說(shuō)明 Agent 在改造后的環(huán)境里用更少的步數(shù)拿到更高的分這正是 harness 在「裁剪無(wú)效軌跡、放大有效信號(hào)」上的直接收益5 個(gè) benchmark、4 個(gè)領(lǐng)域說(shuō)明這套框架不是某個(gè)領(lǐng)域的玩具——從 web 自動(dòng)化到代碼到工具調(diào)用、再到推理任務(wù)都驗(yàn)證過(guò)。具體到三個(gè)基線的對(duì)比論文里沒(méi)有數(shù)字細(xì)節(jié)但 abstract 明確說(shuō)「優(yōu)于原環(huán)境和領(lǐng)域特定生成 pipeline」——這意味著無(wú)論是 baseline 靜態(tài)環(huán)境還是別的「環(huán)境增強(qiáng)」方案都被這套插件框架跑贏了。五、三個(gè)值得展開(kāi)的工程機(jī)制5.1 插件與環(huán)境的解耦標(biāo)準(zhǔn)化接口EnvHarness 的插件不是「每個(gè)環(huán)境自定義」而是遵守標(biāo)準(zhǔn)接口。這帶來(lái)兩個(gè)工程紅利可移植性同一個(gè)插件可以從 web 環(huán)境遷移到代碼環(huán)境只要目標(biāo)環(huán)境提供了同樣的 hook可復(fù)用性訓(xùn)練過(guò)程中發(fā)現(xiàn)的「有用插件」可以組成一個(gè)插件庫(kù)下一次新 Agent 來(lái)用現(xiàn)成的。5.2 EnvRigger 的「黑盒」特性EnvRigger 不需要訪問(wèn) Agent 的內(nèi)部梯度、參數(shù)或推理日志。論文 abstract 明確寫「treat the target policy as a black box」。這非常重要——它意味著閉源 LLMGPT、Claude、Gemini作為 Agent 也能用策略升級(jí)了不需要重訓(xùn) harness整個(gè) pipeline 可以被作為 service 提供。5.3 Verifier 保留獎(jiǎng)勵(lì)信號(hào)不被插件污染所有插件只能在 Agent 輸入/輸出/獎(jiǎng)勵(lì) shaping 層面改寫不能動(dòng)原環(huán)境的 verifier。這是論文一個(gè)反復(fù)出現(xiàn)的約束——目的是避免「獎(jiǎng)勵(lì)黑客」式的 hack插件發(fā)現(xiàn)了一個(gè)漏洞可以讓 Agent 拿高分但實(shí)際并不解決問(wèn)題。這一條對(duì)真實(shí)部署極關(guān)鍵——RL 訓(xùn)練里最容易翻車的就是獎(jiǎng)勵(lì) hackingEnvHarness 把這道防線放在了架構(gòu)里。六、這個(gè)工作對(duì) Agent 訓(xùn)練的實(shí)際意義6.1 對(duì)研究者RL 訓(xùn)練的「環(huán)境多樣性」問(wèn)題有了工程級(jí)答案之前大家只能用 self-play、自動(dòng)課程學(xué)習(xí)等方式擴(kuò)軌跡EnvHarness 提供了一個(gè)顯式、可編程、可版本管理的擴(kuò)展維度跨環(huán)境遷移成為可能插件層統(tǒng)一了接口意味著訓(xùn)練好的 Agent 配合不同 harness 就能切換任務(wù)——這正是通用 Agent 的關(guān)鍵屬性之一RLHF 與 RLHF-style 工具調(diào)用有清晰接口harness 層天然適合把人類反饋?zhàn)⑷氲?Agent 訓(xùn)練中。6.2 對(duì)工程團(tuán)隊(duì)可以在不動(dòng)業(yè)務(wù)后端的前提下做 Agent 強(qiáng)化企業(yè)的 SQL、ERP、CRM 接口都能用 harness 包裹同一個(gè) Agent 多個(gè)環(huán)境插件庫(kù)可以讓一個(gè)模型在不同業(yè)務(wù)系統(tǒng)間切換復(fù)用 RL 投資失敗診斷自動(dòng)化EnvRigger 的失敗診斷模塊可以單獨(dú)抽出用對(duì)企業(yè)級(jí) Agent 調(diào)試有幫助。6.3 局限依賴環(huán)境的 hook 暴露如果某個(gè)環(huán)境沒(méi)有任何可觀察/可重寫的 hookharness 裝不上黑盒策略分析有偏EnvRigger 只能從軌跡反推失敗模式對(duì)極復(fù)雜決策鏈的診斷可能不夠細(xì)致插件庫(kù)的可解釋性當(dāng)插件組合很多時(shí)調(diào)參空間變大需要額外機(jī)制控制復(fù)雜度。七、與近一年同類工作對(duì)比工作核心機(jī)制是否動(dòng)環(huán)境是否黑盒 AgentSelf-PlayAgent 內(nèi)戰(zhàn)否是Automatic Curriculum Learning自動(dòng)出題否是Voyager (Minecraft)skill library否否白盒Toolformer 風(fēng)格工具合成工具自動(dòng)合成部分是EnvHarness環(huán)境插件化不改只包是EnvHarness 的差異化是對(duì)環(huán)境的「非侵入式增強(qiáng)」——其他工作要么改環(huán)境、要么改 Agent 內(nèi)部而它是「把環(huán)境外面套一層?xùn)|西」。這種思路在軟件工程里叫「sidecar pattern」被搬到 RL 環(huán)境上是新的。八、給做 Agent 產(chǎn)品的人三條結(jié)論如果你在生產(chǎn)環(huán)境跑 Agent把環(huán)境外面加一層 harness 是性價(jià)比最高的改造不動(dòng)后端、不會(huì)影響其他系統(tǒng)但能直接拿到「可訓(xùn)練」的接口把 Agent 失敗軌跡歸檔未來(lái)用 EnvRigger 風(fēng)格工具做插件合成失敗日志是被低估的資產(chǎn)EnvHarness 的方法論直接告訴你怎么把它們變成訓(xùn)練信號(hào)關(guān)注 2026 下半年 Agent RL 框架的兩個(gè)方向環(huán)境插件化 失敗驅(qū)動(dòng)課程學(xué)習(xí)這是從「環(huán)境不變 → Agent 自己進(jìn)化」到「環(huán)境也跟著 Agent 進(jìn)化」的范式轉(zhuǎn)變。arXiv2608.198802026-08-20GitHubhttps://github.com/google-research/envharness項(xiàng)目頁(yè)https://envharness.com/HF 鏈接https://huggingface.co/papers/2608.19880