실습 노트

Agent Lightning v1.0: 에이전트 하네스 그대로 학습시키는 강화학습 구조

Microsoft의 Agent Lightning v1.0과 관련 논문을 바탕으로, 도구·컨텍스트·제어 흐름을 가진 에이전트 하네스에 강화학습을 연결하는 구조를 설명합니다.

보일러플레이트AI 에이전트 · 강화학습 · Agent Lightning · LLM 학습

에이전트의 성능을 학습으로 개선하려면 모델만 바꾸면 되는 것이 아닙니다. 도구 호출, 컨텍스트 구성, 실행 순서를 관리하는 하네스가 실제 환경과 모델 사이에 있기 때문입니다. Agent Lightning v1.0 저장소관련 논문은 이 하네스를 유지한 채 강화학습을 연결하는 구조를 제시합니다.

하네스가 학습의 중심이 되는 이유

일반적인 강화학습 파이프라인에서는 학습 엔진이 환경과 상호작용하는 루프를 직접 관리하는 경우가 많습니다. 하지만 실제 에이전트는 도구, 메모리, 컨텍스트 압축, 여러 단계의 제어 흐름을 하네스가 담당합니다.

Agent Lightning이 말하는 harnessed agentic RL에서는 배포 때 사용하는 하네스가 환경 상호작용 루프를 계속 소유합니다. 학습기는 하네스를 새 프레임워크로 갈아끼우는 대신 LLM 요청과 응답의 흐름을 관찰하고 학습에 활용합니다.

이 구분은 중요합니다. 에이전트 코드를 학습 프레임워크에 맞춰 다시 작성하지 않아도 되는 대신, 요청·응답 시퀀스를 학습 데이터로 바꾸는 과정에서 별도의 문제가 생깁니다.

LLM 프록시로 학습과 실행 분리

공식 저장소는 임의의 에이전트 하네스를 LLM 엔드포인트 프록시에 연결하는 방식을 핵심 구조로 설명합니다. 하네스는 기존처럼 도구와 컨텍스트를 다루고, 프록시는 모델 호출을 학습 파이프라인과 연결하는 경계가 됩니다.

구조를 역할로 나누면 다음과 같습니다.

  • 에이전트 하네스: 도구 호출, 컨텍스트, 제어 흐름, 환경 상호작용
  • LLM 프록시: 하네스의 모델 요청·응답을 학습 시스템과 연결
  • 학습 엔진: 롤아웃을 모으고 보상·어드밴티지·손실을 계산
  • 실행 환경: 검색·코딩·업무 처리처럼 에이전트가 실제로 수행하는 과제

따라서 “모델을 학습한다”는 말만으로는 충분하지 않습니다. 어떤 하네스가 어떤 도구와 컨텍스트를 공급했는지까지 함께 기록해야 결과를 해석할 수 있습니다.

구현에서 생기는 네 가지 문제

논문은 하네스와 학습 엔진이 분리될 때 해결해야 할 문제로 retokenization, 샘플 병합, advantage 계산, loss normalization과 백엔드 스케줄링을 제시합니다.

예를 들어 하네스가 만든 대화와 도구 호출 기록이 학습 모델의 토크나이저와 다르면, 로그를 그대로 손실 계산에 넣을 수 없습니다. 여러 실행 결과를 한 학습 배치로 합칠 때도 길이와 보상 범위가 달라집니다. 한 번의 답변이 아니라 여러 도구 호출을 거친 작업을 평가하려면 보상이 어느 단계에 귀속되는지도 정해야 합니다.

이 문제들은 에이전트의 겉모습을 바꾸는 프롬프트 조정과 다릅니다. 데이터 형식, 학습 안정성, 실행 스케줄이 함께 맞아야 합니다.

공개된 실험 범위

Agent Lightning v1.0 저장소는 약 3,500줄 규모의 구현과 재현 가능한 코딩 에이전트 학습 파이프라인을 공개합니다. 논문 초록은 Qwen3.5-9B를 대상으로 6K 학습 예시를 사용해 SWE-bench Verified 점수가 41.8%에서 56.4%로 올라갔다고 보고합니다.

이 수치는 해당 논문과 저장소가 제시한 실험 결과입니다. 다른 모델·하네스·데이터·보상 설계에도 같은 폭의 개선이 생긴다고 일반화할 수는 없습니다. 적용 전에는 사용하려는 에이전트의 도구 호출 기록과 평가 과제를 별도로 고정해야 합니다.

도입 전 확인할 항목

  1. 현재 하네스가 모델 호출과 도구 결과를 추적하는지 확인
  2. 학습·평가·운영 환경의 모델과 토크나이저를 분리 기록
  3. 보상이 최종 결과와 중간 도구 호출 중 어디에 연결되는지 정의
  4. 실패·재시도·긴 실행을 학습 샘플에서 어떻게 다룰지 결정
  5. 작은 재현 과제로 학습 전후를 비교

Agent Lightning의 실무적 의미는 에이전트 프레임워크를 하나 더 고르는 데 있지 않습니다. 이미 운영 중인 하네스의 실행 흐름을 보존하면서, 모델 후학습과 연결되는 관측 경계를 명확히 보여준다는 데 있습니다.