MUMULABFIELD GUIDE / 2026.09.08

ONE MISSING ZERO / MONDAY 09:12

PDF OCR의 0 하나가
회의 결론을 바꿉니다

오전 회의 직전 도착한 스캔 견적서. AI는 틀린 숫자도 망설임 없이 요약합니다. 문제를 알아차리는 순간부터 10칸 검수법까지 따라가 봅니다.

작성·검수 MUMULAB 편집팀·

월요일 오전 9시 12분, 팀 메신저에 “이 견적서 오전 회의 전에 요약해 주세요”라는 메시지가 올라옵니다. 첨부된 것은 복사도 검색도 안 되는 22페이지짜리 스캔 PDF입니다. 시간은 없고, PDF OCR을 돌린 뒤 텍스트를 AI에 넣는 것이 가장 빨라 보입니다.

오전 9시 18분, AI가 답합니다. “견적 총액은 18만 원입니다.” 항목별 요약도 매끄럽고 말투도 자신 있습니다. 지난 견적보다 싸다는 한 줄까지 붙어 있으니, 메신저에 그대로 옮기고 싶은 순간입니다.

그런데 회의 직전 원본을 확대해 보니 총액은 180만 원입니다. OCR 과정에서 0 하나가 빠졌습니다. AI는 계산을 틀린 것이 아니라, 들어온 18만 원을 충실하고 자연스럽게 설명했습니다. 서두르던 사람 눈에는 “잘 쓴 요약”만 보이고, 잘못 읽힌 입력은 뒤로 숨습니다.

사례 고지 — 이 장면은 특정 회사의 실제 사고를 옮긴 것이 아니라, 스캔 견적서를 급히 처리하는 업무 흐름을 설명하기 위해 인물 없이 재구성한 사례입니다. 금액과 시간은 성과 통계가 아닙니다.
이때 필요한 질문은 “어떤 AI가 더 잘 요약하나?”가 아닙니다. “이 문서에서 무엇이 틀리면 내 결정이 바뀌나?”입니다.

툴보다 먼저, 틀리면 곤란한 칸을 적었습니다

MUMULAB 편집팀도 이 글을 만들 때 처음에는 OCR 도구와 사용법부터 정리하려 했습니다. 하지만 검수표를 만드는 과정에서 순서를 바꿨습니다. 도구 이름보다 먼저 숫자·단위·날짜·고유명사·표 위치를 적었습니다. 모두 한 글자만 달라져도 결제, 신청, 일정, 담당자 판단이 바뀌는 항목입니다.

그래서 이 글의 출발점은 OCR 정확도 순위가 아닙니다. 먼저 위험한 다섯 종류를 원본과 대조하고, 어디에서 찾았는지 페이지와 구역을 남기고, 통과·수정·보류를 표시하는 것입니다. 그 기록을 실제로 쓸 수 있도록 10칸 CSV로 만들었습니다.

PDF OCR은 스캔된 글자를 검색 가능한 텍스트로 바꾸는 단계이고, AI 요약은 그다음입니다. 글자를 선택할 수 없는 문서는 OCR을 먼저 거치되, 판단을 바꿀 수 있는 항목을 확인한 범위만 AI에 넘깁니다.

먼저 확인할 것: 이 PDF는 글자인가, 사진인가

PDF 한 페이지를 열고 문장 한 줄을 마우스로 선택해 보세요. Ctrl+F 또는 Command+F로 눈에 보이는 단어를 검색해도 됩니다.

  • 글자가 선택되고 검색된다면 디지털 텍스트가 들어 있는 PDF일 가능성이 큽니다.
  • 페이지 전체가 한 장의 사진처럼 선택된다면 스캔 PDF일 가능성이 큽니다.
  • 본문만 검색되고 도장·서명·차트·표 안 글자는 검색되지 않는 혼합 문서도 있습니다.

Adobe는 종이를 스캔한 PDF가 이미지 데이터만 포함할 수 있다고 설명합니다. OCR은 이 이미지 속 문자를 선택·검색 가능한 텍스트로 바꾸지만, 변환 뒤에는 정확성과 완전성을 다시 검토해야 합니다. Adobe의 스캔 PDF 텍스트 인식 안내에서 원문을 확인할 수 있습니다.

왜 AI에게 바로 요약시키면 안 될까

ChatGPT의 PDF 처리는 사용 중인 플랜과 업로드 위치에 따라 다릅니다. OpenAI의 현재 안내에 따르면 Enterprise 대화 중 PDF 업로드는 텍스트와 시각 요소를 함께 해석할 수 있지만, GPT Knowledge나 Project Files에 넣은 PDF는 텍스트 기반으로 처리됩니다. 다른 플랜의 문서 처리도 텍스트 기반이며 PDF 속 이미지는 제외될 수 있습니다. OpenAI PDF 시각 검색 FAQ파일 업로드 FAQ를 함께 확인하세요.

따라서 스캔 PDF에 텍스트 레이어가 없거나 OCR이 틀렸다면, AI가 읽는 입력부터 비어 있거나 어긋날 수 있습니다. 이것은 요약 능력보다 요약 전에 들어간 텍스트의 문제입니다.

OCR 뒤 반드시 볼 10칸

긴 문서를 전부 다시 입력하기 위한 표가 아닙니다. 결론과 실행에 영향을 주는 부분을 원본과 대조하기 위한 기록입니다.

무엇을 적나왜 필요한가
페이지PDF 표시 페이지오류를 원본에서 다시 찾기 위해
구역제목·본문·각주·표같은 페이지 안 위치를 좁히기 위해
원본 문자이미지에 실제로 보이는 짧은 구절OCR 결과와 대조하기 위해
OCR 텍스트도구가 만든 텍스트차이를 드러내기 위해
숫자금액·수량·비율0/O, 1/I 혼동을 찾기 위해
단위원·명·kg·%숫자의 의미가 바뀌는 것을 막기 위해
날짜시행일·마감일·개정일현재성 판단 오류를 막기 위해
고유명사기관·제품·사람 이름비슷한 일반 단어로 바뀌는 오류를 찾기 위해
표 위치행·열·셀 위치값과 항목이 뒤섞이는 것을 찾기 위해
검수결과통과·수정·보류AI에 넘길 범위를 구분하기 위해
OCR 10칸 검수표Excel·Google Sheets에서 바로 여는 CSV
CSV 다운로드

원본부터 AI 입력까지, 6단계

원본 복사본을 남긴다

OCR 전 파일을 따로 보관해 설정이나 수정 결과가 어긋날 때 돌아갈 기준을 만듭니다.

언어와 페이지 범위를 확인한다

한국어가 포함된 올바른 언어를 고르고 제목·표·각주 페이지를 먼저 표본 처리합니다.

검색 단어 세 개를 고른다

기관명, 숫자 표현, 표 안 항목이 OCR 뒤 모두 검색되는지 확인합니다.

위험 부분만 CSV에 적는다

결론을 바꾸는 숫자·날짜·이름·표 연결을 우선 기록합니다.

의심 단어를 원본과 맞춘다

도구가 불확실하다고 표시한 단어를 원본 이미지와 비교해 수정합니다.

통과한 범위만 AI에 넘긴다

보류 항목은 사실처럼 쓰지 않고 확인 질문으로 남깁니다.

Adobe Acrobat은 인식이 불확실한 단어를 검토 대상으로 보여 주고 원본 이미지와 인식 텍스트를 비교해 수정할 수 있게 합니다. Adobe의 OCR 인식 오류 수정 안내를 참고하세요.

복사해서 쓰는 AI 요청문

아래 텍스트는 스캔 PDF를 OCR한 뒤 사람이 검수한 범위다.

목표:
- 문서의 핵심 주장과 실행 조건을 정리한다.

규칙:
1. 각 주장 뒤에 [PDF 페이지]를 붙인다.
2. 숫자·단위·날짜·기관명은 입력 표현을 그대로 쓴다.
3. 표 연결이 불명확하면 [표 확인 필요]라고 쓴다.
4. 근거가 없는 결론은 만들지 않는다.
5. 답을 확인된 내용 / 원본 재확인 / 문서에 없는 내용으로 나눈다.

검수된 OCR 텍스트:
[여기에 통과한 범위만 붙여 넣기]

특히 자주 놓치는 오류

  • 0과 O, 1과 I처럼 모양이 비슷한 문자
  • 천 단위 쉼표와 소수점, 마이너스 기호와 괄호 음수
  • 원·천 원·백만 원처럼 배율이 달라지는 단위
  • 표에서 왼쪽 항목과 오른쪽 값이 다른 행으로 이동한 경우
  • 머리말·꼬리말이 본문 중간에 반복 삽입된 경우
  • 각주 번호와 본문 숫자가 붙은 경우
  • 도장이나 형광펜 때문에 글자가 가려진 경우
  • 두 단 문서가 좌우 순서가 아니라 위아래로 섞인 경우
  • 개인정보를 가렸지만 OCR 텍스트에는 남아 있는 경우

이 조건이면 요약을 멈춘다

  • 핵심 숫자를 원본 이미지에서 판독할 수 없다.
  • 표의 행과 열 연결을 복원할 수 없다.
  • PDF 표시 번호와 인쇄 페이지 번호를 구분할 수 없다.
  • 문서의 일부 페이지가 누락됐다.
  • 주민등록번호·계좌번호·연락처 등 공유하면 안 되는 정보가 남아 있다.
  • 사용 중인 AI 서비스의 파일 처리·보관 조건을 확인하지 않았다.
민감한 업무 문서는 조직의 보안 규정과 서비스의 데이터 처리 정책을 먼저 확인하세요. 이 검수표는 보안 승인을 대신하지 않습니다.

MUMULAB의 AI PDF 팩트 추출 글은 긴 디지털 문서에서 주장과 근거를 뽑는 방법을 다룹니다. 이 글은 그 앞단인 스캔 이미지 → OCR 텍스트 → 사람 검수에 집중합니다.

완료 기준은 ‘텍스트가 생김’이 아닙니다

PDF OCR의 완료 기준은 결론을 바꿀 수 있는 숫자·단위·날짜·고유명사·표 위치를 원본과 대조했고, 보류 항목을 AI가 추정하지 않도록 분리한 상태입니다. 오늘은 PDF 전체보다 제목 한 페이지와 표 한 페이지부터 검수하세요. 두 구역이 통과하면 그 범위만 AI에 넘겨 페이지 근거가 붙은 요약을 만들면 됩니다.

확인한 공식 문서

공식 문서 확인일: 2026-09-08. AI 보조로 구조를 작성하고 MUMULAB 편집팀이 수요·중복·공식 출처·과장 표현을 검수했습니다. OCR 정확도나 시간 절감률을 직접 측정하지 않았으며 특정 도구의 정확도를 보장하지 않습니다.