큐레이션

LangWatch

LLM 평가·에이전트 시뮬레이션·tracing·프롬프트 개선을 한 루프로 묶는 오픈소스 플랫폼

TypeScript3.4k+
LangWatch 대표 이미지

요약

LangWatch는 LLM과 AI 에이전트를 출시 전부터 운영 환경까지 시험·평가·관찰하는 플랫폼입니다. trace를 수집하고 데이터셋을 만든 뒤 평가와 프롬프트 개선을 반복하는 흐름을 한 제품 안에서 다룹니다.

도구 소개

공식 README 기준으로 에이전트 시뮬레이션, LLM 평가, tracing, 프롬프트 관리, OpenTelemetry/OTLP 연동, AI Gateway를 제공합니다. OpenAI·Anthropic 등 모델 제공자와 LangChain·LangGraph·n8n 등 여러 프레임워크를 연결할 수 있으며, Apache 2.0 기반 오픈소스 영역은 자체 호스팅할 수 있습니다.

사용 포인트

  • 고객 문의 에이전트의 대표 시나리오를 반복 실행하고 회귀 테스트
  • 실제 trace에서 실패 사례를 데이터셋으로 모아 품질 기준 관리
  • 프롬프트 변경 전후의 정확도·비용·응답 품질 비교
  • OpenTelemetry 기반으로 여러 모델 제공자와 앱의 실행 흐름 관찰

설치와 시작

가장 빠른 로컬 시작 방법은 공식 CLI입니다.

npx @langwatch/server

CLI가 필요한 런타임과 데이터베이스를 ~/.langwatch/에 구성하고 http://localhost:5560에서 시작합니다. Docker Compose를 사용하려면 공식 저장소를 받은 뒤 platform/app에서 docker compose up -d --wait --build를 실행합니다.

선정 사유

GitHub API에서 3,474 stars와 2026-08-06 최신 push를 확인했고, 공식 README의 제품 화면과 자체 호스팅 문서를 직접 확인했습니다. 에이전트 자동화에서 빠지기 쉬운 회귀 테스트와 운영 관찰을 교육·실무 검수 단계로 연결하기 좋습니다.

참고

  • GitHub 저장소
  • 공식 README
  • 공식 문서
  • 이미지 원문
  • Reddit과 국내 사용자·개발자 커뮤니티를 각각 실제 검색했으나 양쪽 모두 HTTP 202 챌린지와 결과 링크 0개로 후보 특정 반응을 검증하지 못했습니다. 익명 반응 요약은 생략했습니다. 정확한 쿼리와 응답은 internal/run-notes/2026-08-06-picks-curation-batch.md에 기록했습니다.