Microsoft Agent Lightning v1.0: 실제로 배포하는 바로 그 하네스 안에서 AI 에이전트를 학습시키기

August 21, 20268 min read

AI 에이전트에는 이미 「몸」이 있다. 학습은 그걸 자주 무시했다

요즘 AI 에이전트는 단순 채팅창이 아닙니다. 도구·메모리·샌드박스, 그리고 목표를 행동으로 나누는 제어 루프를 맡는 하네스(harness) 안에서 돌아갑니다.

실제로 일이 벌어지는 곳도 그곳입니다. 파일을 열고, 테스트를 돌리고, 웹을 검색하고, 하위 에이전트에 일을 넘깁니다. 그런데 오랫동안 강화 학습(RL) 훈련은 에이전트를 「모델만 있는 시스템」처럼 취급했습니다. 팀은 트레이너 안에 에이전트 루프를 다시 짜거나, 실제 배포물과 전혀 다른 것을 학습시키곤 했습니다.

Microsoft Research와 공동 연구자들이 공개한 Agent Lightning v1.0은 가벼운 오픈소스 프레임워크입니다. 핵심 아이디어는 단순합니다——실제로 배포하는 바로 그 하네스로 모델을 학습시킨다. 이들은 이 패러다임을 harnessed agentic RL이라고 부릅니다.

기술 보고서 Agent Lightning v1.0: Towards Harnessed Agentic RL (arXiv:2608.17528)는 약 6,000개 학습 예시만으로 코딩 에이전트가 눈에 띄는 결과를 낸 사례를 포함해, 이 접근을 실전에 보여 줍니다.


Agent Lightning v1.0이란?

Agent Lightning은 기존 에이전트와 RL 학습 스택 사이의 미들웨어입니다. OpenHands, mini-SWE-agent, OpenClaw를 트레이너 안에 다시 쓸 필요 없이, 모델 호출을 Agent Lightning proxy로 돌리면 됩니다. 하네스는 평소처럼 일하고, 트레이너는 요청·응답을 관찰해 실제 루프에서 일어난 일로 모델을 개선합니다.

v1.0은 의도적으로 작습니다——대략 3,500줄——그리고 네이티브 Kubernetes를 지원해 에이전트 rollout을 실제 Job으로 돌릴 수 있습니다. 트레이너에 억지로 붙인 장난감 샌드박스가 아닙니다.

실제 하네스, 거의 무수정

도구·컨텍스트 규칙·제어 흐름은 그대로. 바꾸는 것은 LLM 엔드포인트를 proxy로——에이전트 아키텍처 자체가 아닙니다.

가벼움을 설계 원칙으로

단순함이 첫 원칙입니다. 작은 코드베이스는 이해하고, 감사하고, 확장하기 쉽습니다.

프로덕션 클러스터용

디버깅은 로컬에서, 규모가 필요하면 Kubernetes Jobs로——루프를 다른 샌드박스 제품에 외주할 필요가 없습니다.


조각들이 어떻게 맞물리는가

크게 보면 세 서비스가 「에이전트 세계」와 「학습 세계」를 잇습니다.

구성역할
API Gateway모델 호출을 프록시하고 rollout·이벤트·학습 트레이스를 저장
Rollout Controller에이전트 실행·감시 (로컬 프로세스 풀 또는 Kubernetes)
Customized Trainer샘플을 조립하고 정책을 갱신 (verl / vLLM 위)

한쪽에는 하네스와 함께하는 에이전트, 다른 쪽에는 추론·학습 엔진. Gateway와 Controller가 양쪽을 연결해, 에이전트 루프를 GPU 트레이너에 억지로 넣을 필요가 없습니다.

Agent Lightning v1.0 전체 프레임워크 — 하네스 에이전트, API gateway, rollout controller, trainer, 엔진

그림 1: He 외, “Agent Lightning v1.0: Towards Harnessed Agentic RL” (arXiv:2608.17528).


「하네스 기반」학습이 다른 게임인 이유

전통적인 agentic RL에서는 학습 엔진이 상호작용 루프를 소유하는 경우가 많습니다. 모델은 턴마다 길어지는 하나의 토큰 이력을 봅니다.

harnessed agentic RL에서는 하네스가 그 루프를 소유합니다. 프롬프트를 만들고, 도구를 호출하고, 컨텍스트를 관리하며, 하위 에이전트를 띄울 수도 있습니다. 트레이너가 보는 것은 API 스타일 요청–응답 쌍의 연속——제품이 이미 쓰는 경계와 같습니다.

장부 정리처럼 들릴 수 있습니다. 그렇지 않습니다. 한 작업이 수많은 학습 샘플로 불어날 때, 신용 배분·턴 병합·손실 정규화 방식이 달라집니다. 논문은 함정을 꼼꼼히 짚고, Agent Lightning v1.0은 그걸 제대로 다루는 실용 테스트베드이기도 합니다.

전통 agentic RL과 harnessed agentic RL 비교

그림 2: He 외, “Agent Lightning v1.0: Towards Harnessed Agentic RL” (arXiv:2608.17528).


빌더에게 중요한 이유

학습–서빙 간극을 좁힌다

사용자가 실제로 맞닥뜨리는 같은 뼈대 안에서 모델을 개선합니다——단순화한 대체가 아닙니다.

좋아하는 에이전트 스택을 유지

실제 코딩·범용 하네스와 동작합니다. 「트레이너 전용」으로 강제 재작성할 필요가 없습니다.

Rollout을 독립적으로 확장

에이전트 실행과 GPU 학습은 다른 자원에 두고 다른 속도로 키울 수 있습니다.

재현 가능한 코딩 에이전트 RL

데이터 정리, reward hacking 방지, 학습 스크립트를 공개했습니다——차트 한 장이 아닙니다.


헤드라인 결과: 적당한 연산으로도 코딩 에이전트가 좋아진다

저자들은 지시 따르기·검색·코딩 에이전트를 평가했습니다. 소프트웨어 에이전트용 RL 도구가 빈약하다고 느낀 팀에게 코딩 이야기는 특히 유용합니다.

오픈 SWE-smith 데이터셋과 Qwen3.5-9B로 Agent Lightning 강화 학습을 적용해 SWE-bench Verified가 **41.8%에서 56.4%**로——절대 14.6포인트——약 6,000개 학습 예시와 저자들이 말하는 적당한 연산만으로 올랐습니다.

항목내용
모델Qwen3.5-9B
벤치마크SWE-bench Verified
RL 전41.8%
RL 후56.4%
절대 향상+14.6포인트
학습 규모약 6K 예시, 적당한 연산
프레임워크 규모약 3,500줄

「닫힌 스택에 무한 GPU를 쏟아붓는」 이야기가 아닙니다. 실제 하네스 행동에서 배우는 에이전트로 가는, 연구실과 제품 팀이 따라갈 수 있는 재현 가능한 길입니다.


누가 주목해야 하나

에이전트 제품 팀

이미 코딩·연구 에이전트를 배포 중이라면, 의존하는 하네스를 버리지 않고 모델을 올리는 방법입니다.

RL·플랫폼 엔지니어

학습 백엔드를 지킨다면, 샘플 병합·advantage·손실 정규화 논의는 실무적이고 공허하지 않습니다.

오픈소스 빌더

코드·문서·학습 스크립트가 열린 자세로 공개됩니다——슬라이드가 아니라 repo와 docs부터.


다음에 볼 곳

Agent Lightning v1.0은 모든 에이전트를 「하루아침에 똑똑하게」 만들지 않습니다. 더 조용하고 중요한 일을 합니다. 프로덕션과 같은 하네스 안에서 모델이 연습하게 합니다——그래서 학습이 실제 사용처럼 보이기 시작합니다.

최신 소식을 받아보세요

뉴스와 업데이트를 가장 먼저 확인하세요