큐레이션

codex-vision-proxy

텍스트 전용 모델이 Codex의 이미지 보기 흐름을 활용하도록 만들고 OCR·시각적 위치 찾기까지 연결하는 로컬 비전 프록시

Python277+
codex-vision-proxy 대표 이미지

요약

codex-vision-proxy는 텍스트 전용 모델이 Codex의 view_image 흐름을 호출할 때 이미지를 비전 모델로 설명해 다시 전달하는 로컬 프록시입니다. Codex뿐 아니라 Claude Code·Pi·Oh My Pi·OpenCode 연결과 glance, ground, detect, trace 선택 도구를 제공합니다.

도구 소개

이 프로젝트는 단순한 이미지 캡션 대신 현재 사용자의 질문이나 에이전트가 이미지를 보려는 이유를 focus hint로 전달합니다. 그래서 UI 스크린샷에서 스타일·필드명·버튼 위치처럼 현재 작업에 필요한 부분을 우선 설명할 수 있습니다. 여러 이미지 요청은 병렬 처리하고, 이미지와 프롬프트 조합별 결과를 프록시 안에서 캐시합니다.

glance는 이미지 질문과 OCR, ground는 자연어 대상의 원본 픽셀 좌표, detect는 화면 요소 목록, trace는 로컬 SVG 추적을 담당합니다. 다만 비전 토큰을 직접 넘기는 방식이 아니라 이미지 설명으로 변환하는 구조이며 결과 품질은 지정한 비전 모델에 좌우됩니다.

사용 포인트

  • 텍스트 모델 기반 Codex에 화면·문서·UI 이미지를 읽히는 실험
  • OCR과 자연어 좌표 찾기를 붙인 브라우저·GUI 자동화 프로토타입
  • 스크린샷의 버튼·필드·레이아웃을 분석하는 교육 실습
  • Codex·Claude Code·OpenCode에서 같은 비전 설명 계층을 비교

설치와 시작

공식 README는 현재 Codex 에이전트에 저장소 링크와 설치 가이드를 전달하는 방식을 권장합니다.

I've already got a text-only model working in Codex. Please read this repository's README first, then follow AGENT_INSTALL.md to deploy and verify view_image on the current system.

비전 API는 다음 환경 변수를 사용합니다.

export VISION_API_KEY=...
export VISION_BASE_URL=https://your-openai-compatible-endpoint/v1
export VISION_MODEL=your-vision-model

선택 도구 예시는 다음과 같습니다.

glance screenshot.png --ocr
ground screenshot.png "Send button"
detect page.png "buttons"

선정 사유

GitHub API에서 277 stars와 2026-08-05 최신 push를 확인했고, 공식 README의 지원 에이전트·환경 변수·실제 명령과 이미지 예시를 직접 검증했습니다. 500 stars 미만이지만 최근 활동이 있고, 텍스트 전용 모델에 이미지 이해를 붙이는 명확한 문제와 Codex·Claude Code·OpenCode용 실제 설치 경로가 있어 실사용·교육 가치가 높습니다.

참고

  • GitHub 저장소
  • 공식 README
  • 이미지는 공식 README의 실제 UI 분석 예시 화면을 사용했습니다.
  • Reddit과 국내 사용자·개발자 커뮤니티를 각각 실제 검색했으나 양쪽 모두 HTTP 202 챌린지와 0 링크로 후보 특정 반응을 검증하지 못했습니다. 익명 반응 요약은 생략했습니다. 정확한 쿼리와 응답은 internal/run-notes/2026-08-05-picks-curation-batch.md에 기록했습니다.