큐레이션
LangWatch
LLM 평가·에이전트 시뮬레이션·tracing·프롬프트 개선을 한 루프로 묶는 오픈소스 플랫폼
TypeScript3.4k+

요약
LangWatch는 LLM과 AI 에이전트를 출시 전부터 운영 환경까지 시험·평가·관찰하는 플랫폼입니다. trace를 수집하고 데이터셋을 만든 뒤 평가와 프롬프트 개선을 반복하는 흐름을 한 제품 안에서 다룹니다.
도구 소개
공식 README 기준으로 에이전트 시뮬레이션, LLM 평가, tracing, 프롬프트 관리, OpenTelemetry/OTLP 연동, AI Gateway를 제공합니다. OpenAI·Anthropic 등 모델 제공자와 LangChain·LangGraph·n8n 등 여러 프레임워크를 연결할 수 있으며, Apache 2.0 기반 오픈소스 영역은 자체 호스팅할 수 있습니다.
사용 포인트
- 고객 문의 에이전트의 대표 시나리오를 반복 실행하고 회귀 테스트
- 실제 trace에서 실패 사례를 데이터셋으로 모아 품질 기준 관리
- 프롬프트 변경 전후의 정확도·비용·응답 품질 비교
- OpenTelemetry 기반으로 여러 모델 제공자와 앱의 실행 흐름 관찰
설치와 시작
가장 빠른 로컬 시작 방법은 공식 CLI입니다.
npx @langwatch/server
CLI가 필요한 런타임과 데이터베이스를 ~/.langwatch/에 구성하고 http://localhost:5560에서 시작합니다. Docker Compose를 사용하려면 공식 저장소를 받은 뒤 platform/app에서 docker compose up -d --wait --build를 실행합니다.
선정 사유
GitHub API에서 3,474 stars와 2026-08-06 최신 push를 확인했고, 공식 README의 제품 화면과 자체 호스팅 문서를 직접 확인했습니다. 에이전트 자동화에서 빠지기 쉬운 회귀 테스트와 운영 관찰을 교육·실무 검수 단계로 연결하기 좋습니다.
참고
- GitHub 저장소
- 공식 README
- 공식 문서
- 이미지 원문
- Reddit과 국내 사용자·개발자 커뮤니티를 각각 실제 검색했으나 양쪽 모두 HTTP 202 챌린지와 결과 링크 0개로 후보 특정 반응을 검증하지 못했습니다. 익명 반응 요약은 생략했습니다. 정확한 쿼리와 응답은
internal/run-notes/2026-08-06-picks-curation-batch.md에 기록했습니다.