큐레이션

Docling: PDF·Office 문서를 AI가 읽을 수 있는 구조로 바꾸는 방법

PDF·DOCX·PPTX·XLSX 문서의 표·레이아웃·읽기 순서를 하나의 구조로 바꾸고 Markdown·JSON·MCP·RAG로 연결하는 오픈소스 문서 처리 도구

Python66,207 (2026-09-10 GitHub API 확인)
Docling: PDF·Office 문서를 AI가 읽을 수 있는 구조로 바꾸는 방법 대표 이미지

PDF와 Office 문서를 AI에 넣을 때 글자만 뽑으면 표와 읽는 순서가 무너질 수 있습니다. Docling은 PDF·DOCX·PPTX·XLSX 같은 파일을 문서 구조와 출처 정보가 남는 DoclingDocument로 바꾸고, 그 결과를 Markdown·JSON·RAG·MCP 작업에 연결하려는 팀이 비교해 볼 만한 오픈소스 도구입니다.

이 Pick의 핵심 질문은 “어떤 모델이 더 좋은가”가 아니라 “문서 구조를 어디까지 보존한 뒤 다음 단계로 넘길 것인가”입니다. HWP·HWPX를 바로 처리하는 도구로 가정하지 않고, 대표 문서 몇 개의 변환 결과를 원문과 대조하는 순서로 살펴보는 편이 좋습니다.

문서에서 무엇을 보존해야 하나요?

보고서나 규정집, 회의 자료를 검색·요약·추출에 쓰려면 본문만으로 충분하지 않은 경우가 많습니다. 제목의 계층, 표의 행과 열, 여러 단의 읽기 순서, 각 요소의 페이지 위치와 원문 연결 정보가 후속 검수에 필요합니다.

Docling은 공식 문서에서 텍스트·표·그림, 문서 계층, 머리말·꼬리말 구분, 위치 정보와 provenance(어떤 원문 요소에서 나왔는지에 대한 정보)를 표현하는 DoclingDocument를 설명합니다. 이 공통 표현을 Markdown·HTML·JSON·DocTags 등으로 내보낼 수 있어, 변환과 검색·추출 단계를 분리해 비교하기 좋습니다.

어떤 업무에 먼저 맞나요?

  • PDF·DOCX·PPTX·XLSX·HTML·이미지처럼 형식이 섞인 자료를 하나의 입력 흐름으로 정리할 때
  • 표와 다단 편집, 스캔 페이지를 AI 검색이나 문서 요약에 넣기 전에 구조를 확인할 때
  • 변환 결과를 Markdown으로 사람이 읽거나 손실이 적은 JSON으로 저장하고 싶을 때
  • LangChain·LlamaIndex·Haystack 같은 도구나 MCP를 통해 문서 처리를 에이전트에 연결할 때

문서가 단순한 텍스트 파일이고 표·레이아웃·OCR이 중요하지 않다면 더 가벼운 변환기가 관리하기 쉽습니다. HWP·HWPX가 중심인 업무라면 Docling 공식 지원 형식 목록에 해당 확장자가 있는지 먼저 확인하고, 한글 문서의 구조·서식 검수는 HWP·HWPX 공공문서 AI 실무교육의 범위처럼 별도로 설계해야 합니다.

도입 전에 어떤 기준을 정해야 하나요?

결과를 Markdown과 구조화 데이터로 나눕니다

사람이 빠르게 읽을 결과는 Markdown이 편합니다. 원문 요소와 위치, 표·그림 정보를 후속 시스템에서 다시 다뤄야 한다면 DoclingDocument를 JSON으로 보존하는 편이 낫습니다.

처음부터 답변 모델에 결과를 넣기보다 원문 파일 → 변환 결과 → 표·제목·페이지 대조 → 검색 또는 추출의 네 단계를 따로 기록하세요. 변환 오류와 검색 오류를 구분할 수 있어야 다음 개선 지점을 찾을 수 있습니다.

로컬 처리와 원격 서비스를 구분합니다

공식 문서는 Docling을 로컬에서 실행할 수 있고, 사전 모델을 내려받아 네트워크가 분리된 환경에서 사용할 수 있다고 안내합니다. 동시에 docling-serve API 서버를 통해 여러 언어의 애플리케이션에서 변환 서비스를 공유하는 경로도 제공합니다.

로컬 실행은 파일이 자동으로 안전해진다는 뜻이 아닙니다. 모델 캐시, 입력·출력 폴더, 로그와 API 키의 보관 위치를 조직의 문서 등급과 함께 정해야 합니다.

에이전트 연결은 도구와 지식을 나눕니다

Docling의 공식 MCP 문서는 docling-mcp-server를 MCP 클라이언트에 연결해 문서 변환을 도구 호출로 실행하는 구성을 보여 줍니다. 2026년 9월 1일 공식 deep dive는 MCP가 실행 표면을 제공하고, Docling Skills가 CLI·Python·OCR·청킹을 언제 선택할지 알려 주는 지식 층이라고 설명합니다.

이 구분은 문서 자동화에서 유용합니다. 에이전트가 파일을 읽고 표를 추출할 권한과, 그 결과를 업무 문서로 확정하거나 외부에 보내도 되는 권한은 같은 것으로 두지 않는 편이 좋습니다.

공식 원문에서 확인한 범위는 무엇인가요?

Docling 공식 README는 PDF, DOCX, PPTX, XLSX, HTML, EPUB, Apple Pages, 이미지, 오디오와 여러 XML 형식의 입력을 안내합니다. PDF에서는 페이지 레이아웃, 읽기 순서, 표, 코드, 수식과 이미지 분류를 다루며 OCR과 일부 비전 언어 모델도 연결할 수 있다고 설명합니다.

공식 시작점은 Python 3.10 이상에서 pip install docling을 실행하는 방식입니다. CLI 문서는 docling convert report.pdf --to md --output /tmp/ 같은 변환 흐름을, Python 문서는 DocumentConverterexport_to_markdown()을 안내합니다.

GitHub API에서 2026년 9월 10일 확인한 저장소는 별 66,207개, Python, MIT 라이선스였습니다. 최신 커밋은 2026년 9월 9일의 EPUB 경로 수정이며, 최신 정식 릴리스는 2026년 9월 4일 공개된 v2.126.0입니다. 별 수와 릴리스 기록은 공개 활동과 사용 조건을 보여 줄 뿐 정확도·처리 속도·조직 적합성을 보증하지 않습니다.

한계와 주의사항은 무엇인가요?

  • 표, 다단 문서, 스캔 이미지와 수식은 파일마다 변환 결과가 달라질 수 있습니다. 대량 처리 전에 실제 대표 문서와 변환 결과를 페이지 단위로 대조해야 합니다.
  • OCR·비전 언어 모델·표 인식은 모델과 하드웨어, 설정에 따라 처리 시간과 설치 크기가 달라집니다. 공식 문서도 PyTorch 배포판과 CPU 전용 설치 경로를 따로 안내합니다.
  • 로컬·오프라인 실행이 가능해도 입력 자료의 접근 권한, 모델 파일, 결과 저장소와 검수 로그는 별도로 관리해야 합니다.
  • 공식 형식 목록만으로 HWP·HWPX의 내용·서식 보존을 보장할 수 없습니다. 한글 문서가 핵심이면 전용 변환 경로와 한글 프로그램에서의 시각 검수를 따로 준비해야 합니다.
  • 이 저장소에서 Docling을 직접 설치하거나 문서별 정확도·비용·처리 시간을 측정한 것은 아닙니다.

처음에는 무엇을 시험할까요?

비식별 자료에서 텍스트 PDF, 표가 있는 PDF, 스캔 페이지와 DOCX 또는 XLSX를 각각 하나씩 고르세요. docling convert로 Markdown과 JSON을 만든 뒤 제목·표·페이지 경계·누락을 원문과 비교하고, 오류 목록을 남긴 다음에만 검색·요약·MCP 연결로 넘어가는 순서가 적합합니다.

문서 입력부터 사람 검수와 결과물 정리까지 업무 절차를 함께 설계하려면 기업 AI 업무자동화 실무교육에서 자료 준비, 결과 확인과 승인 단계를 비교해 볼 수 있습니다. HWP·HWPX 문서의 구조와 서식을 다루는 경우에는 위의 문서 AI 과정이 더 직접적인 출발점입니다.

참고한 공식 자료