Microsoft Agent Lightning v1.0:在你實際上線的同一套 Harness 裡訓練 AI 代理

你的 AI 代理早就有「身體」了——只是訓練時常假裝看不見
現代 AI 代理不是單純的聊天框。它們活在 harness(運行骨架) 裡——負責管理工具、記憶、沙盒,以及把目標拆成一步步行動的控制迴路。
真正做事的地方就在這層骨架:開檔、跑測試、搜尋網路、把任務交給子代理。但很長一段時間,強化學習(RL)訓練卻把代理當成「只有模型」的系統。團隊常常得在訓練器裡重寫一整套代理迴路——或者訓練出一個跟實際上線完全不像的東西。
Microsoft Research 與合作單位剛發布 Agent Lightning v1.0:一套輕量開源框架,核心想法很單純——用你實際上線的同一套 harness 來訓練模型。他們把這種範式稱為 harnessed agentic RL。
技術報告 Agent Lightning v1.0: Towards Harnessed Agentic RL(arXiv:2608.17528)展示了實戰做法,其中包含只用約 6,000 筆訓練樣本就交出漂亮成績的程式代理實驗。
Agent Lightning v1.0 是什麼?
Agent Lightning 是現有代理與 RL 訓練堆疊之間的中介層。你不必把 OpenHands、mini-SWE-agent 或 OpenClaw 重寫進訓練器,只要把代理的模型呼叫指向 Agent Lightning 的 proxy。Harness 照常做事;訓練器觀察請求與回應,再從真實迴路裡發生的事去改進模型。
v1.0 刻意做得精簡——大約 3,500 行程式碼——並內建 Kubernetes 支援,讓代理 rollout 能以真實 Job 執行,而不是硬塞在訓練器上的玩具沙盒。
真實 harness,幾乎零改寫
代理保留工具、上下文規則與控制流。你換的是 LLM 端點到 proxy——不是整套代理架構。
以輕量為設計原則
簡單是第一原則。精簡程式碼更容易理解、稽核與擴充。
為正式叢集而生
本機除錯,或在需要規模時以 Kubernetes Jobs 跑代理——不必把迴路外包給另一套沙盒產品。
各元件如何串起來
高層來看,三個服務把「代理世界」接到「訓練世界」:
| 元件 | 做什麼 |
|---|---|
| API Gateway | 代理模型呼叫,並儲存 rollout、事件與訓練軌跡 |
| Rollout Controller | 啟動並監控代理(本機行程池或 Kubernetes) |
| Customized Trainer | 組裝樣本並更新策略(建於 verl / vLLM 之上) |
代理連同 harness 在一邊;推理與訓練引擎在另一邊。Gateway 與 Controller 讓兩邊對話,而不必把代理迴路硬塞進 GPU 訓練器。

圖 1 出自 He 等人,〈Agent Lightning v1.0: Towards Harnessed Agentic RL〉(arXiv:2608.17528)。
為什麼「帶 harness 的訓練」是另一局棋
在傳統 agentic RL 裡,訓練引擎往往擁有互動迴路。模型看到的是一輪輪持續變長的 token 歷史。
在 harnessed agentic RL 裡,harness 擁有這條迴路。它組裝每個 prompt、呼叫工具、管理上下文,也可能產生子代理。訓練器只看到一連串類似 API 的請求–回應對——也就是你的產品本來就在用的邊界。
聽起來像記帳細節。其實不是。當一個任務可能炸成很多訓練樣本時,如何分配 credit、合併回合、正規化 loss 都會改變。論文仔細拆解這些陷阱;Agent Lightning v1.0 也是把這些細節做對的實用測試場。

圖 2 出自 He 等人,〈Agent Lightning v1.0: Towards Harnessed Agentic RL〉(arXiv:2608.17528)。
為什麼這對開發者很重要
拉近訓練與上線的落差
在使用者真正碰到的同一套骨架裡改進模型——而不是簡化版替身。
留下你喜歡的代理堆疊
支援真實的程式與通用 harness,不必強迫改寫成「訓練器原生」代理。
獨立擴展 rollout
代理執行與 GPU 訓練可落在不同資源,並依不同節奏擴展。
可重現的程式代理 RL
團隊公開了資料清理、防 reward hacking 措施與訓練腳本——不只一張圖表。
頭條結果:適度算力也能讓程式代理變強
作者評估了指令跟隨、搜尋與程式代理。對覺得軟體代理 RL 工具偏薄的團隊,程式這條線特別有用。
使用開源 SWE-smith 資料集與 Qwen3.5-9B,搭配 Agent Lightning 的強化學習,讓 SWE-bench Verified 從 41.8% 升到 56.4%——絕對提升 14.6 個百分點——只用約 6,000 筆訓練樣本,以及作者所稱的適度算力。
| 項目 | 細節 |
|---|---|
| 模型 | Qwen3.5-9B |
| 基準 | SWE-bench Verified |
| RL 前 | 41.8% |
| RL 後 | 56.4% |
| 絕對增益 | +14.6 百分點 |
| 訓練規模 | 約 6K 樣本、適度算力 |
| 框架規模 | 約 3,500 行程式碼 |
這不是「把無限 GPU 砸向封閉堆疊」。而是實驗室與產品團隊都能重現的路徑:讓代理從真實 harness 行為中學習。
誰該留意
代理產品團隊
若你已上線程式或研究代理,這是改進模型、卻不必丟掉你依賴的 harness 的做法。
RL 與平台工程師
若你維護訓練後端,論文對樣本合併、advantage 與 loss 正規化的討論很務實,不是空談。
開源開發者
程式碼、文件與訓練腳本採開源姿態公開——從 repo 與 docs 開始,而不是投影片。
下一步去哪看
- 技術報告:arXiv:2608.17528
- GitHub:microsoft/agent-lightning
- 文件:Agent Lightning v1.0 docs
- Microsoft Research 早期方法概述:Agent Lightning blog
Agent Lightning v1.0 不會讓每個代理「一夜變聰明」。它做的事更安靜、也更重要:讓模型在實際上線的同一套 harness 裡練習——於是訓練開始長得像真實使用。

