큐레이션
Future AGI
시뮬레이션·평가·보호·OpenTelemetry 관측·게이트웨이·최적화를 한 피드백 루프로 묶는 AI 에이전트 플랫폼

요약
Future AGI는 AI 에이전트를 출시하기 전후의 품질 루프를 하나의 오픈소스 플랫폼으로 묶는 프로젝트입니다. 공식 README는 시뮬레이션, 평가, 보호, 모니터링, Agent Command Center, 프롬프트 최적화를 핵심 축으로 제시합니다.
도구 소개
기존 에이전트 코드에 Python 또는 TypeScript 계측을 붙여 OpenTelemetry 기반 trace를 남기고, 여러 턴의 대화·엣지 케이스를 시뮬레이션할 수 있습니다. 평가 축에는 groundedness·hallucination·tool-use correctness·PII·tone 같은 항목과 사용자 정의 rubric이 포함되며, 보호 기능은 PII·jailbreak·injection 탐지와 vendor adapter를 제공합니다.
실행 경로에는 여러 provider를 연결하는 OpenAI 호환 gateway도 포함됩니다. README는 전체 플랫폼을 Docker Compose로 자체 호스팅할 수 있다고 안내하지만, 프로젝트 자체가 nightly release 단계의 초기 테스트용임을 함께 명시합니다.
사용 포인트
- 실제 사용자에게 내보내기 전 현실적인 persona·adversarial input으로 시나리오 실행
- trace에서 모델 호출·도구 사용·지연·토큰 비용과 실패 단계를 확인
- 정해 둔 rubric과 여러 평가 지표로 에이전트 회귀를 비교
- PII·jailbreak·prompt injection 검사를 gateway 또는 SDK에서 적용
- 생산 trace와 실험 결과를 다음 prompt·workflow 개선의 근거로 사용
설치와 시작
공식 README의 자체 호스팅 경로는 Docker Compose가 준비된 환경에서 저장소의 설치 스크립트를 실행하는 방식입니다.
git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install
처음에는 운영 trace를 바로 넣지 말고, 작은 에이전트 흐름과 고정된 평가 세트를 하나 정하는 것이 좋습니다. 한 번의 정상 응답보다 도구 오류·긴 입력·권한 경계 같은 실패 시나리오를 먼저 고정하고, 어떤 rubric이 배포를 막을지 팀에서 합의해야 결과를 해석할 수 있습니다.
적용 판단
Future AGI의 차별점은 관측 대시보드 하나가 아니라 시뮬레이션→평가→보호→관측→개선을 같은 데이터 흐름으로 연결하려는 데 있습니다. 이미 에이전트를 운영하며 실패 trace를 테스트 케이스와 개선 작업으로 이어야 하는 팀이 전체 구조를 비교해 보기에 좋습니다.
반면 README는 nightly release라서 거친 부분이 있을 수 있다고 경고합니다. 벤치마크 수치나 공급자 자체 비교표를 그대로 품질 보증으로 받아들이기보다, 내 데이터와 rubric으로 재현하고 self-host 경로·의존성 라이선스·민감한 trace 보관 정책을 별도로 검토해야 합니다.