Microsoft Agent Lightning v1.0:在你實際上線的同一套 Harness 裡訓練 AI 代理

August 21, 20268 min read

你的 AI 代理早就有「身體」了——只是訓練時常假裝看不見

現代 AI 代理不是單純的聊天框。它們活在 harness(運行骨架) 裡——負責管理工具、記憶、沙盒,以及把目標拆成一步步行動的控制迴路。

真正做事的地方就在這層骨架:開檔、跑測試、搜尋網路、把任務交給子代理。但很長一段時間,強化學習(RL)訓練卻把代理當成「只有模型」的系統。團隊常常得在訓練器裡重寫一整套代理迴路——或者訓練出一個跟實際上線完全不像的東西。

Microsoft Research 與合作單位剛發布 Agent Lightning v1.0:一套輕量開源框架,核心想法很單純——用你實際上線的同一套 harness 來訓練模型。他們把這種範式稱為 harnessed agentic RL

技術報告 Agent Lightning v1.0: Towards Harnessed Agentic RL(arXiv:2608.17528)展示了實戰做法,其中包含只用約 6,000 筆訓練樣本就交出漂亮成績的程式代理實驗。


Agent Lightning v1.0 是什麼?

Agent Lightning 是現有代理與 RL 訓練堆疊之間的中介層。你不必把 OpenHands、mini-SWE-agent 或 OpenClaw 重寫進訓練器,只要把代理的模型呼叫指向 Agent Lightning 的 proxy。Harness 照常做事;訓練器觀察請求與回應,再從真實迴路裡發生的事去改進模型。

v1.0 刻意做得精簡——大約 3,500 行程式碼——並內建 Kubernetes 支援,讓代理 rollout 能以真實 Job 執行,而不是硬塞在訓練器上的玩具沙盒。

真實 harness,幾乎零改寫

代理保留工具、上下文規則與控制流。你換的是 LLM 端點到 proxy——不是整套代理架構。

以輕量為設計原則

簡單是第一原則。精簡程式碼更容易理解、稽核與擴充。

為正式叢集而生

本機除錯,或在需要規模時以 Kubernetes Jobs 跑代理——不必把迴路外包給另一套沙盒產品。


各元件如何串起來

高層來看,三個服務把「代理世界」接到「訓練世界」:

元件做什麼
API Gateway代理模型呼叫,並儲存 rollout、事件與訓練軌跡
Rollout Controller啟動並監控代理(本機行程池或 Kubernetes)
Customized Trainer組裝樣本並更新策略(建於 verl / vLLM 之上)

代理連同 harness 在一邊;推理與訓練引擎在另一邊。Gateway 與 Controller 讓兩邊對話,而不必把代理迴路硬塞進 GPU 訓練器。

Agent Lightning v1.0 整體架構——帶 harness 的代理、API gateway、rollout controller、trainer 與引擎

圖 1 出自 He 等人,〈Agent Lightning v1.0: Towards Harnessed Agentic RL〉(arXiv:2608.17528)。


為什麼「帶 harness 的訓練」是另一局棋

在傳統 agentic RL 裡,訓練引擎往往擁有互動迴路。模型看到的是一輪輪持續變長的 token 歷史。

在 harnessed agentic RL 裡,harness 擁有這條迴路。它組裝每個 prompt、呼叫工具、管理上下文,也可能產生子代理。訓練器只看到一連串類似 API 的請求–回應對——也就是你的產品本來就在用的邊界。

聽起來像記帳細節。其實不是。當一個任務可能炸成很多訓練樣本時,如何分配 credit、合併回合、正規化 loss 都會改變。論文仔細拆解這些陷阱;Agent Lightning v1.0 也是把這些細節做對的實用測試場。

傳統 agentic RL 與 harnessed agentic RL 的比較

圖 2 出自 He 等人,〈Agent Lightning v1.0: Towards Harnessed Agentic RL〉(arXiv:2608.17528)。


為什麼這對開發者很重要

拉近訓練與上線的落差

在使用者真正碰到的同一套骨架裡改進模型——而不是簡化版替身。

留下你喜歡的代理堆疊

支援真實的程式與通用 harness,不必強迫改寫成「訓練器原生」代理。

獨立擴展 rollout

代理執行與 GPU 訓練可落在不同資源,並依不同節奏擴展。

可重現的程式代理 RL

團隊公開了資料清理、防 reward hacking 措施與訓練腳本——不只一張圖表。


頭條結果:適度算力也能讓程式代理變強

作者評估了指令跟隨、搜尋與程式代理。對覺得軟體代理 RL 工具偏薄的團隊,程式這條線特別有用。

使用開源 SWE-smith 資料集與 Qwen3.5-9B,搭配 Agent Lightning 的強化學習,讓 SWE-bench Verified 從 41.8% 升到 56.4%——絕對提升 14.6 個百分點——只用約 6,000 筆訓練樣本,以及作者所稱的適度算力。

項目細節
模型Qwen3.5-9B
基準SWE-bench Verified
RL 前41.8%
RL 後56.4%
絕對增益+14.6 百分點
訓練規模約 6K 樣本、適度算力
框架規模約 3,500 行程式碼

這不是「把無限 GPU 砸向封閉堆疊」。而是實驗室與產品團隊都能重現的路徑:讓代理從真實 harness 行為中學習。


誰該留意

代理產品團隊

若你已上線程式或研究代理,這是改進模型、卻不必丟掉你依賴的 harness 的做法。

RL 與平台工程師

若你維護訓練後端,論文對樣本合併、advantage 與 loss 正規化的討論很務實,不是空談。

開源開發者

程式碼、文件與訓練腳本採開源姿態公開——從 repo 與 docs 開始,而不是投影片。


下一步去哪看

Agent Lightning v1.0 不會讓每個代理「一夜變聰明」。它做的事更安靜、也更重要:讓模型在實際上線的同一套 harness 裡練習——於是訓練開始長得像真實使用。

緊貼最新動態

隨時掌握最新新聞與更新