큐레이션

MinerU

PDF와 오피스 문서를 LLM이 다룰 수 있는 Markdown·JSON 구조로 바꾸는 문서 파서

Python78.9k+

요약

MinerU는 PDF·이미지·DOCX·PPTX·XLSX 문서를 분석해 Markdown과 JSON으로 변환하는 오픈소스 문서 파서입니다. 문서 검색이나 에이전트에 넣기 전, 레이아웃과 표 구조를 보존하는 전처리 단계에 사용할 수 있습니다.

도구 소개

공식 README는 복잡한 레이아웃, 스캔 문서, 수식, 표와 이미지가 포함된 문서를 대상으로 구조화된 결과를 만드는 흐름을 설명합니다. CLI·API·WebUI·mineru-router 표면을 제공하며, 로컬 설치와 온라인 데모를 구분해 안내합니다.

사용 포인트

  • PDF·이미지·DOCX·PPTX·XLSX를 Markdown·JSON으로 변환
  • 제목·표·수식·페이지 정보를 후속 검색 단위로 활용
  • CLI로 소량 문서를 먼저 변환한 뒤 결과 검수
  • 변환 결과를 RAG나 문서 에이전트의 입력 단계에 연결

설치와 시작

공식 저장소는 uv를 이용한 설치와 CLI 실행을 안내합니다.

uv pip install -U "mineru[all]"
mineru -p <input_path> -o <output_path>

GPU 환경이 없을 때는 pipeline 백엔드를 지정할 수 있습니다.

mineru -p <input_path> -o <output_path> -b pipeline

처음에는 표·각주·다단 편집이 포함된 실제 문서 몇 개를 골라 원문과 결과 Markdown을 비교하는 편이 안전합니다.

적용 판단

문서 기반 AI의 품질은 답변 모델뿐 아니라 입력 문서의 구조에 좌우됩니다. MinerU는 문서 수집과 답변 생성 사이를 분리해, 변환 결과의 제목·표·페이지 경계를 먼저 점검할 수 있게 합니다.

다만 공식 README도 복잡한 레이아웃·스캔·손글씨 문서에서 결과가 달라질 수 있다고 안내합니다. 중요한 답변에는 변환 전 원문 페이지를 함께 추적하고, 대량 처리 전 대표 문서로 누락과 순서 오류를 확인해야 합니다.

참고