Tutorial

스캔한 PDF를 OCR로 검색 가능하게 만드는 방법

OCR의 작동 원리와 정확도에 영향을 주는 요소를 알아보고, 스캔한 PDF를 텍스트 검색과 복사가 가능한 문서로 브라우저에서 바로 변환하는 법을 소개합니다. LuraPDF 사용법, 다른 작업 전 OCR을 실행할 시점, 브라우저 기반 OCR의 한계까지 담았습니다.

LuraPDF Team
LuraPDF Team

편집 및 기술 팀 · 2026년 5월 4일 · 13분 읽기

스캔된 PDF는 문서의 디지털 사진입니다. 페이지는 이미지입니다. 텍스트를 선택하거나, 단어를 검색하거나, 문장을 복사하거나, 텍스트 처리 도구에 내용을 입력할 수 없습니다. 정보 검색 측면에서 스캔된 PDF는 사실상 불투명한 파일입니다.

OCR(광학 문자 인식)은 이러한 이미지를 분석하고 시각적 콘텐츠 위에 겹쳐지는 텍스트 레이어를 구성함으로써 이 문제를 해결합니다. 결과: 원본 스캔과 동일하게 보이지만, 모든 내용을 선택·검색·복사할 수 있게 해주는 보이지 않는 텍스트 레이어가 포함된 PDF입니다.

OCR 작동 원리

LuraPDF는 Tesseract.js를 사용합니다. 이는 Google이 유지 관리하고 HP Labs에서 원래 개발한 가장 정확한 오픈 소스 OCR 엔진 중 하나인 Tesseract의 브라우저 컴파일 버전입니다. Tesseract는 수십 개 언어에 걸친 수백만 장의 문서 페이지로 훈련된 신경망 모델(LSTM 기반)을 사용합니다.

OCR 파이프라인:

  1. 페이지 렌더링: 각 PDF 페이지를 높은 해상도(최상의 정확도를 위해 300+ DPI)로 캔버스 이미지로 렌더링합니다
  2. 전처리: 이미지 향상 — 이진화, 노이즈 감소, 기울기 보정(회전된 스캔 교정)
  3. 레이아웃 분석: 텍스트 영역, 열, 표, 비텍스트 요소 감지
  4. 문자 인식: 신경망이 분할된 텍스트 영역에서 각 문자를 분류합니다
  5. 후처리: 유사한 문자를 구분하기 위한 언어 모델 점수 계산(예: "l" vs "1", "O" vs "0")
  6. PDF 작성: 인식된 텍스트가 해당하는 시각적 문자 위에 정확하게 배치된 보이지 않는 텍스트 레이어로 삽입됩니다

보이지 않는 텍스트 레이어가 결과를 검색 가능하게 만드는 핵심입니다. 시각적 페이지 모양은 원본 스캔 이미지 그대로 유지됩니다 — 스캔한 내용이 그대로 보이지만, 그 아래의 텍스트는 이제 기계가 읽을 수 있습니다.

OCR 정확도에 영향을 미치는 요소

정확도는 입력 품질에 따라 크게 달라집니다:

스캔 해상도

안정적인 정확도를 위한 최소 해상도는 300 DPI입니다. 200 DPI 미만에서는 문자 인식이 크게 저하됩니다. OCR을 위해 문서를 스캔하는 경우, 항상 300 DPI 이상으로 스캔하세요.

150 DPI 이하로 스캔된 문서는 OCR 전에 더 높은 해상도로 다시 스캔해야 합니다. 낮은 해상도의 스캔에 OCR을 실행하면 엔진이 아무리 좋아도 결과가 좋지 않습니다.

폰트 및 인쇄 품질

  • 인쇄된 텍스트(레이저 프린터 출력, 조판 책): 깨끗한 원본의 경우 98–99% 정확도
  • 명확한 문자의 고품질 손글씨: 85–95%
  • 흐릿하거나 바랜 텍스트: 대비에 따라 80–95%
  • 카본 복사지: 60–85%
  • 오래된 신문 / 타자기: 깨끗한 스캔의 경우 90–95%
  • 필기체 손글씨: 40–70% — 신경망 OCR은 필기체 처리에 어려움을 겪습니다

페이지 방향

심하게 기울어지거나 회전된 페이지는 정확도를 떨어뜨립니다. Tesseract를 포함한 대부분의 OCR 엔진은 약간의 회전(최대 약 10도)을 자동으로 감지하고 보정합니다. 심하게 회전된 페이지는 PDF 회전을 사용하여 먼저 수동으로 교정해야 합니다.

언어

Tesseract는 100개 이상의 언어를 지원합니다. LuraPDF의 OCR 도구는 영어를 자동으로 감지합니다. 비 라틴 문자나 영어 이외의 문서의 경우 언어 선택을 통해 정확도를 크게 높일 수 있습니다.

LuraPDF로 PDF OCR 처리하는 방법

  1. OCR 도구 열기: LuraPDF OCR PDF로 이동합니다
  2. 스캔된 PDF 업로드: 파일을 드래그 앤 드롭합니다
  3. 언어 선택(영어가 아닌 경우): 문서의 주 언어를 선택합니다
  4. "OCR 실행" 클릭: 처리가 브라우저에서 페이지별로 진행됩니다. 소요 시간은 문서 길이에 따라 다르며 — 20페이지 스캔은 일반적으로 최신 컴퓨터에서 30–90초 정도 걸립니다.
  5. 검색 가능한 PDF 다운로드: 출력 파일은 원본 스캔 이미지에 임베디드 텍스트 레이어가 추가된 PDF입니다

결과 확인

OCR 후 정확도를 검증하세요:

  • 페이지에서 텍스트를 선택 — 인쇄된 문자 위에서 정확하게 선택되어야 합니다
  • 일반적인 단어를 검색(Ctrl+F / Cmd+F) — 검색이 되어야 합니다
  • 단락을 복사하여 텍스트 편집기에 붙여넣기 — 출력 내용이 읽을 수 있어야 합니다

정확도가 낮다면, 다른 도구를 시도하기 전에 먼저 입력 스캔 품질을 확인하세요.

다른 작업 전에 OCR을 실행해야 하는 경우

OCR은 순수 이미지 PDF에서 작동하지 않는 추가 LuraPDF 작업을 가능하게 합니다:

  • OCR 후 PDF 압축: 텍스트가 추출되면 이미지 영역을 더 적극적으로 압축할 수 있는 경우가 있습니다
  • OCR 후 PDF를 Word로: OCR 처리된 PDF를 Word로 변환하면 편집 가능한 텍스트가 생성되지만, 원본 스캔을 변환하면 이미지가 삽입된 Word 파일이 생성됩니다
  • OCR 후 PDF 편집: 텍스트 기반 편집은 OCR 처리된 문서에서 올바르게 작동합니다
  • 검색 및 추출: 다시 입력하지 않고도 특정 정보를 찾아 복사합니다

개인정보 보호: OCR은 브라우저에서 실행됩니다

Tesseract.js는 WebAssembly를 사용하여 전체 OCR 프로세스를 로컬에서 실행합니다. 의료 기록, 재무 명세서, 법적 문서, 개인 식별 정보가 포함된 경우가 많은 스캔 문서가 기기를 벗어나지 않습니다. 원격 서버가 파일을 처리하지 않습니다.

이는 처리하는 모든 내용의 사본을 필연적으로 수신하는 클라우드 OCR 서비스에 비해 상당한 장점입니다.

브라우저 기반 OCR의 한계

처리 시간

Tesseract.js는 네이티브 데스크톱 Tesseract나 클라우드 OCR API보다 느립니다. 하드웨어에 따라 페이지당 약 3–8초가 소요됩니다. 50페이지 문서는 몇 분이 걸릴 수 있습니다.

표

Tesseract는 표 내용을 인식하지만 PDF 텍스트 레이어에서 표 구조를 재구성하지는 않습니다 — 텍스트는 읽는 순서대로 배치되지만 셀 구조는 보존되지 않습니다. 구조화된 표 추출을 위해서는 OCR 처리된 PDF를 Word로 변환한 후 표를 수동으로 다시 서식 지정하세요.

수학 표기법

LaTeX 스타일의 방정식과 수학 기호는 정확도가 낮습니다. Tesseract 모델은 자연어 텍스트에 최적화되어 있습니다.

손글씨

앞서 언급했듯이, 필기체 손글씨 정확도는 제한적입니다. 인쇄체 손글씨는 더 나은 결과를 보입니다. 중요한 손글씨 문서의 경우 각 페이지를 수동으로 확인하세요.

자주 묻는 질문

OCR 처리된 텍스트가 문자와 정렬되지 않습니다 — 버그인가요? 심하게 기울어진 스캔에서 이런 현상이 발생할 수 있습니다. 텍스트 위치는 감지된 문자 위치를 기반으로 계산되지만, 페이지 형상이 표준과 다른 경우 정렬이 어긋날 수 있습니다. OCR 실행 전에 PDF 회전을 사용하여 기울기를 보정해 보세요.

특정 페이지만 OCR 처리할 수 있나요? LuraPDF는 모든 페이지를 처리합니다. 특정 페이지만 OCR이 필요한 경우, PDF 페이지 추출을 사용하여 해당 페이지를 먼저 추출하고, OCR을 실행한 후 필요에 따라 결과를 병합하세요.

OCR이 스캔 문서의 시각적 모양을 변경하나요? 아니요. 원본 스캔 이미지는 정확히 그대로 보존됩니다. 보이지 않는 텍스트 레이어만 추가됩니다.

일부 텍스트 페이지와 일부 스캔 페이지가 혼합된 PDF에 OCR을 실행할 수 있나요? 네 — Tesseract는 이미지 기반 페이지를 처리하여 텍스트 레이어를 추가합니다. 이미 텍스트 레이어가 있는 페이지는 영향을 받지 않습니다.

문서가 아랍어 / 중국어 / 일본어입니다 — OCR이 작동하나요? 네, 하지만 실행 전에 도구에서 올바른 언어를 선택하세요. CJK 및 오른쪽에서 왼쪽으로 쓰는 언어에 대한 Tesseract의 정확도는 양호하지만 라틴 문자 문서보다 스캔 품질에 따른 편차가 더 큽니다.

OCR은 잠겨 있던 스캔 문서 보관소를 접근 가능하고, 검색 가능하며, 처리 가능한 정보로 변환합니다. 스캔된 계약서로 가득 찬 캐비닛이 검색 가능한 데이터베이스가 됩니다. 의료 기록 더미가 실제로 탐색할 수 있는 문서가 됩니다. 처리 과정은 수 초에서 수 분이 걸리며 전적으로 사용자의 기기에서 실행됩니다.

저자 소개

LuraPDF Team
LuraPDF Team

편집 및 기술 팀 · 2026년 5월 4일 · 13분 읽기

LuraPDF 팀은 PDF 편집을 무료로, 안전하게, 누구나 쉽게 이용할 수 있도록 만드는 문서 처리 전문가, 소프트웨어 엔지니어, 기술 작가들로 구성되어 있습니다.