실습 노트

MinerU: PDF와 오피스 문서를 LLM용 구조로 바꾸는 문서 파서

OpenDataLab MinerU가 PDF·이미지·DOCX·PPTX·XLSX를 Markdown과 JSON으로 바꾸는 처리 흐름을 정리합니다.

보일러플레이트문서 자동화 · RAG · 오픈소스

문서 기반 AI의 품질은 모델보다 먼저 문서가 어떤 구조로 들어가는지에 좌우됩니다. MinerU는 PDF와 이미지뿐 아니라 DOCX·PPTX·XLSX를 읽어 LLM과 에이전트가 다루기 쉬운 Markdown·JSON으로 변환하는 오픈소스 문서 파서입니다.

문서의 모양을 보존하는 전처리

단순 텍스트 추출은 제목, 표, 수식, 이미지와 본문 사이의 관계를 잃기 쉽습니다. MinerU는 공식 README에서 복잡한 문서의 레이아웃과 구조를 분석해 후속 검색·질의·에이전트 작업에 사용할 수 있는 형태로 바꾸는 흐름을 설명합니다.

현재 로컬 입력으로 PDF, 이미지, DOCX, PPTX, XLSX 파일과 디렉터리를 지원하며 CLI·API·WebUI·mineru-router 표면을 제공합니다.

CLI로 먼저 확인하기

공식 저장소는 uv 기반 설치와 간단한 CLI 실행 예를 제공합니다.

uv pip install -U "mineru[all]"
mineru -p <input_path> -o <output_path>

GPU 환경이 준비되지 않았다면 pipeline 백엔드를 지정할 수 있습니다.

mineru -p <input_path> -o <output_path> -b pipeline

처음에는 표와 각주가 포함된 실제 문서 몇 개를 골라 원문과 결과 Markdown을 나란히 비교하는 것이 좋습니다. 변환 결과를 바로 검색 인덱스에 넣기보다 제목·표·페이지 경계가 유지됐는지 먼저 확인합니다.

RAG 앞단에 놓는 구조

MinerU는 답변을 생성하는 모델이 아닙니다. 문서 파일을 검색 가능한 텍스트와 구조 데이터로 바꾸는 전처리 층입니다. 따라서 일반적인 흐름은 다음과 같습니다.

  1. PDF·오피스 파일 수집
  2. MinerU로 Markdown·JSON 변환
  3. 표·제목·페이지 단위 구조 점검
  4. 검색 인덱스 또는 벡터 저장소에 적재
  5. 원문 위치를 포함해 답변 생성

이렇게 전처리와 답변 생성을 분리하면 모델을 교체해도 문서 처리 결과와 검색 품질을 따로 검증할 수 있습니다.

환경 조건과 한계

공식 문서는 GPU 가속 요구사항과 운영체제별 설치 방법을 구분합니다. Docker 배포는 Linux와 WSL2 지원 Windows를 대상으로 하며, macOS는 pip·uv 설치 방식을 안내합니다. CPU pipeline도 제공되지만 대량 문서 처리에서는 속도와 메모리를 별도로 측정해야 합니다.

표·수식·다단 편집처럼 시각적 배치가 중요한 문서는 어떤 파서도 완벽한 복원을 보장하지 않습니다. 검색에 넣기 전 대표 문서로 표 셀 순서, 누락 이미지, 페이지 연결을 검사하고, 중요한 답변에는 변환 전 원문 페이지를 함께 추적하는 구성이 필요합니다.

적용 판단

MinerU는 RAG나 사내 문서 에이전트를 만들 때 모델 선택보다 앞에 놓을 수 있는 문서 구조화 도구입니다. PDF와 오피스 문서가 섞인 업무라면 먼저 소량을 Markdown·JSON으로 변환해 검색 단위와 검수 기준을 정한 뒤 전체 파이프라인으로 넓히는 접근이 맞습니다.