
26年7月來自 Inclusive Brains和Wavestone AI Lab 的論文“Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents”。對 11 個代碼 Agent 生產系統做源碼級實證研究,提出在駕馭工程(Harness Engineering)中,2026 上半年編碼 Agent 的 harness 已經從工具演變為平臺。一、核心概念:什么是 駕馭(Harness)公式:Agent = 大模型 Model + HarnessModel:負責推理、智能;Harness:是除模型之外全部運行時環境,承擔循環控制、工具調用、上下文管理、安全權限、編排、擴展能力,把大模型能力對接真實世界。區分容易混淆概念:?不是 Agent 框架(LangChain/AutoGen 是供開發者導入的庫;harness 是開發者直接在里面運行的運行時)?不是評估 harness(SWE?bench 評估器是包裹 Agent 做測試;Agent harness 包裹模型去干活,包裹方向相反)?不是編排器 / 元駕馭 Meta?harness:Omnigent在更高層調度多個 harness,自身不實現代碼編輯主循環。如圖1 所示編碼智能體框架的典型結構:圍繞智能體循環的七個子系統,以及人類和程序驅動該循環的接口層。語料庫中的所有十一個系統都實現這些子系統,但復雜度各不相同。如表 1 所示每個子系統的復雜度范圍:Harness 七大標準子系統論文解剖所有系統統一使用 7 大組件,每個組件存在「最小實現」和「生產級最大實現」兩級形態:1 Agent Loop/智能體循環:交替執行大模型推理與工具動作,定義停止條件、失敗恢復。極簡版就是 while 循環;高級為事件溯源、并行動作批處理。2 LLM Integration/大模型集成:對接模型 API、組裝 Prompt、緩存、路由。從簡單單 SDK 調用到多模型傳輸層、模型路由。3 Tools Actions/工具與動作系統:Agent 可執行操作,核心是文件編輯。從單個 bash 命令到數十個帶校驗、延遲加載的類型化工具集。4 Memory Context/記憶與上下文:管理上下文窗口,跨輪次、跨會話持久知識。從無限制消息列表到會話鏈式壓縮、Agent 自主維護長期記憶。5 Safety Permissions/安全與權限:動作審批、沙箱、執行隔離。從簡單步數 / 成本限制,到 OS 級沙箱、多層策略、LLM 風險審核器。6 Orchestration/編排:生成、協調子智能體;可以選擇完全不用(單 Agent);高級為遞歸組合、跨廠商協調。7 Extensibility/可擴展能力:鉤子 hooks、skills 技能、插件、MCP 協議。