큐레이션
LongHorizon-Harness
계획·실행·감사를 분리해 GUI와 CLI를 넘나드는 장시간 에이전트 작업의 상태와 검증을 보존하는 하니스

요약
LongHorizon-Harness는 Codex·Claude Code·OpenClaw 같은 에이전트 위에서 장시간 작업의 상태 관리와 결과 검증을 맡는 실행 하니스입니다. Manager가 목표와 검증된 진행을 보존하고, Executor가 다음 작업을 수행하며, Auditor가 실제 파일·화면·로그·테스트를 독립적으로 확인합니다.
도구 소개
공식 README 기준으로 한 작업이 브라우저에서 시작해 터미널·스프레드시트·문서·디자인 도구로 이동해도 하나의 상태로 이어갈 수 있습니다. GUI 상호작용은 별도 computer-use MCP를 연결하고, 하니스 자체는 에이전트 백엔드와 실행 환경을 조정합니다. 검증을 통과한 결과만 영속 상태에 들어가며, 대시보드에서 각 라운드의 계획·실행·감사·재작업을 확인합니다.
README에는 WeaveBench·OSWorld 2.0·Terminal-Bench 2.1 결과도 공개되어 있어, 장시간 작업에서 단순한 모델 성능과 실행·검증 구조의 차이를 비교하는 연구·교육 자료로 사용할 수 있습니다.
사용 포인트
- 브라우저·터미널·문서 편집을 이어가는 복합 업무 자동화 실험
- 긴 작업에서 확인된 진행과 실패·재작업 사유를 대시보드로 검수
- Codex·Claude Code·OpenClaw를 같은 역할 구조에서 비교
- GUI·CLI 에이전트의 실제 작업 완료율과 토큰 사용량을 평가
설치와 시작
공식 README 기준 설치 명령은 다음과 같습니다.
uv tool install lh-harness
lh-harness run --task "Inspect the current directory and summarize its files."
lh-harness run --task @task.md --dashboard
Python 3.10 이상과 claude, codex, openclaw 중 하나의 에이전트 런타임이 필요합니다. GUI 작업을 연결할 때는 별도의 computer-use MCP 설정을 --mcp-config로 지정합니다.
선정 사유
GitHub API에서 219 stars와 2026-08-04 최신 push를 확인했고, 공식 README와 연결된 논문·프로젝트 사이트를 직접 읽었습니다. 500 stars 미만이지만 AMAP-ML 공식 연구 저장소, 공개 벤치마크 표, 명확한 설치·실행 명령이 있고, 장시간 GUI·CLI 업무를 검증 가능한 상태로 운영한다는 실사용 가치가 분명해 선정했습니다.
참고
- GitHub 저장소
- 공식 README
- 논문
- 프로젝트 사이트
- 이미지는 공식 README의 성능 비교 그래프를 사용했습니다.
- Reddit과 국내 사용자·개발자 커뮤니티를 각각 실제 검색했으나 양쪽 모두 HTTP 202 챌린지와 0 링크로 후보 특정 반응을 검증하지 못했습니다. 익명 반응 요약은 생략했습니다. 정확한 쿼리와 응답은
internal/run-notes/2026-08-05-picks-curation-batch.md에 기록했습니다.