월요일 오전 9시 12분, 팀 메신저에 “이 견적서 오전 회의 전에 요약해 주세요”라는 메시지가 올라옵니다. 첨부된 것은 복사도 검색도 안 되는 22페이지짜리 스캔 PDF입니다. 시간은 없고, PDF OCR을 돌린 뒤 텍스트를 AI에 넣는 것이 가장 빨라 보입니다.
오전 9시 18분, AI가 답합니다. “견적 총액은 18만 원입니다.” 항목별 요약도 매끄럽고 말투도 자신 있습니다. 지난 견적보다 싸다는 한 줄까지 붙어 있으니, 메신저에 그대로 옮기고 싶은 순간입니다.
그런데 회의 직전 원본을 확대해 보니 총액은 180만 원입니다. OCR 과정에서 0 하나가 빠졌습니다. AI는 계산을 틀린 것이 아니라, 들어온 18만 원을 충실하고 자연스럽게 설명했습니다. 서두르던 사람 눈에는 “잘 쓴 요약”만 보이고, 잘못 읽힌 입력은 뒤로 숨습니다.
툴보다 먼저, 틀리면 곤란한 칸을 적었습니다
MUMULAB 편집팀도 이 글을 만들 때 처음에는 OCR 도구와 사용법부터 정리하려 했습니다. 하지만 검수표를 만드는 과정에서 순서를 바꿨습니다. 도구 이름보다 먼저 숫자·단위·날짜·고유명사·표 위치를 적었습니다. 모두 한 글자만 달라져도 결제, 신청, 일정, 담당자 판단이 바뀌는 항목입니다.
그래서 이 글의 출발점은 OCR 정확도 순위가 아닙니다. 먼저 위험한 다섯 종류를 원본과 대조하고, 어디에서 찾았는지 페이지와 구역을 남기고, 통과·수정·보류를 표시하는 것입니다. 그 기록을 실제로 쓸 수 있도록 10칸 CSV로 만들었습니다.
PDF OCR은 스캔된 글자를 검색 가능한 텍스트로 바꾸는 단계이고, AI 요약은 그다음입니다. 글자를 선택할 수 없는 문서는 OCR을 먼저 거치되, 판단을 바꿀 수 있는 항목을 확인한 범위만 AI에 넘깁니다.
먼저 확인할 것: 이 PDF는 글자인가, 사진인가
PDF 한 페이지를 열고 문장 한 줄을 마우스로 선택해 보세요. Ctrl+F 또는 Command+F로 눈에 보이는 단어를 검색해도 됩니다.
- 글자가 선택되고 검색된다면 디지털 텍스트가 들어 있는 PDF일 가능성이 큽니다.
- 페이지 전체가 한 장의 사진처럼 선택된다면 스캔 PDF일 가능성이 큽니다.
- 본문만 검색되고 도장·서명·차트·표 안 글자는 검색되지 않는 혼합 문서도 있습니다.
Adobe는 종이를 스캔한 PDF가 이미지 데이터만 포함할 수 있다고 설명합니다. OCR은 이 이미지 속 문자를 선택·검색 가능한 텍스트로 바꾸지만, 변환 뒤에는 정확성과 완전성을 다시 검토해야 합니다. Adobe의 스캔 PDF 텍스트 인식 안내에서 원문을 확인할 수 있습니다.
왜 AI에게 바로 요약시키면 안 될까
ChatGPT의 PDF 처리는 사용 중인 플랜과 업로드 위치에 따라 다릅니다. OpenAI의 현재 안내에 따르면 Enterprise 대화 중 PDF 업로드는 텍스트와 시각 요소를 함께 해석할 수 있지만, GPT Knowledge나 Project Files에 넣은 PDF는 텍스트 기반으로 처리됩니다. 다른 플랜의 문서 처리도 텍스트 기반이며 PDF 속 이미지는 제외될 수 있습니다. OpenAI PDF 시각 검색 FAQ와 파일 업로드 FAQ를 함께 확인하세요.
따라서 스캔 PDF에 텍스트 레이어가 없거나 OCR이 틀렸다면, AI가 읽는 입력부터 비어 있거나 어긋날 수 있습니다. 이것은 요약 능력보다 요약 전에 들어간 텍스트의 문제입니다.
OCR 뒤 반드시 볼 10칸
긴 문서를 전부 다시 입력하기 위한 표가 아닙니다. 결론과 실행에 영향을 주는 부분을 원본과 대조하기 위한 기록입니다.
| 칸 | 무엇을 적나 | 왜 필요한가 |
|---|---|---|
| 페이지 | PDF 표시 페이지 | 오류를 원본에서 다시 찾기 위해 |
| 구역 | 제목·본문·각주·표 | 같은 페이지 안 위치를 좁히기 위해 |
| 원본 문자 | 이미지에 실제로 보이는 짧은 구절 | OCR 결과와 대조하기 위해 |
| OCR 텍스트 | 도구가 만든 텍스트 | 차이를 드러내기 위해 |
| 숫자 | 금액·수량·비율 | 0/O, 1/I 혼동을 찾기 위해 |
| 단위 | 원·명·kg·% | 숫자의 의미가 바뀌는 것을 막기 위해 |
| 날짜 | 시행일·마감일·개정일 | 현재성 판단 오류를 막기 위해 |
| 고유명사 | 기관·제품·사람 이름 | 비슷한 일반 단어로 바뀌는 오류를 찾기 위해 |
| 표 위치 | 행·열·셀 위치 | 값과 항목이 뒤섞이는 것을 찾기 위해 |
| 검수결과 | 통과·수정·보류 | AI에 넘길 범위를 구분하기 위해 |
원본부터 AI 입력까지, 6단계
OCR 전 파일을 따로 보관해 설정이나 수정 결과가 어긋날 때 돌아갈 기준을 만듭니다.
한국어가 포함된 올바른 언어를 고르고 제목·표·각주 페이지를 먼저 표본 처리합니다.
기관명, 숫자 표현, 표 안 항목이 OCR 뒤 모두 검색되는지 확인합니다.
결론을 바꾸는 숫자·날짜·이름·표 연결을 우선 기록합니다.
도구가 불확실하다고 표시한 단어를 원본 이미지와 비교해 수정합니다.
보류 항목은 사실처럼 쓰지 않고 확인 질문으로 남깁니다.
Adobe Acrobat은 인식이 불확실한 단어를 검토 대상으로 보여 주고 원본 이미지와 인식 텍스트를 비교해 수정할 수 있게 합니다. Adobe의 OCR 인식 오류 수정 안내를 참고하세요.
복사해서 쓰는 AI 요청문
아래 텍스트는 스캔 PDF를 OCR한 뒤 사람이 검수한 범위다. 목표: - 문서의 핵심 주장과 실행 조건을 정리한다. 규칙: 1. 각 주장 뒤에 [PDF 페이지]를 붙인다. 2. 숫자·단위·날짜·기관명은 입력 표현을 그대로 쓴다. 3. 표 연결이 불명확하면 [표 확인 필요]라고 쓴다. 4. 근거가 없는 결론은 만들지 않는다. 5. 답을 확인된 내용 / 원본 재확인 / 문서에 없는 내용으로 나눈다. 검수된 OCR 텍스트: [여기에 통과한 범위만 붙여 넣기]
특히 자주 놓치는 오류
- 0과 O, 1과 I처럼 모양이 비슷한 문자
- 천 단위 쉼표와 소수점, 마이너스 기호와 괄호 음수
- 원·천 원·백만 원처럼 배율이 달라지는 단위
- 표에서 왼쪽 항목과 오른쪽 값이 다른 행으로 이동한 경우
- 머리말·꼬리말이 본문 중간에 반복 삽입된 경우
- 각주 번호와 본문 숫자가 붙은 경우
- 도장이나 형광펜 때문에 글자가 가려진 경우
- 두 단 문서가 좌우 순서가 아니라 위아래로 섞인 경우
- 개인정보를 가렸지만 OCR 텍스트에는 남아 있는 경우
이 조건이면 요약을 멈춘다
- 핵심 숫자를 원본 이미지에서 판독할 수 없다.
- 표의 행과 열 연결을 복원할 수 없다.
- PDF 표시 번호와 인쇄 페이지 번호를 구분할 수 없다.
- 문서의 일부 페이지가 누락됐다.
- 주민등록번호·계좌번호·연락처 등 공유하면 안 되는 정보가 남아 있다.
- 사용 중인 AI 서비스의 파일 처리·보관 조건을 확인하지 않았다.
기존 PDF 요약 글과 무엇이 다른가
MUMULAB의 AI PDF 팩트 추출 글은 긴 디지털 문서에서 주장과 근거를 뽑는 방법을 다룹니다. 이 글은 그 앞단인 스캔 이미지 → OCR 텍스트 → 사람 검수에 집중합니다.
완료 기준은 ‘텍스트가 생김’이 아닙니다
PDF OCR의 완료 기준은 결론을 바꿀 수 있는 숫자·단위·날짜·고유명사·표 위치를 원본과 대조했고, 보류 항목을 AI가 추정하지 않도록 분리한 상태입니다. 오늘은 PDF 전체보다 제목 한 페이지와 표 한 페이지부터 검수하세요. 두 구역이 통과하면 그 범위만 AI에 넘겨 페이지 근거가 붙은 요약을 만들면 됩니다.
확인한 공식 문서
- OpenAI — Visual Retrieval with PDFs FAQ
- OpenAI — File Uploads FAQ
- Adobe — Recognize text in scanned documents
- Adobe — Correct recognized text in scanned documents
공식 문서 확인일: 2026-09-08. AI 보조로 구조를 작성하고 MUMULAB 편집팀이 수요·중복·공식 출처·과장 표현을 검수했습니다. OCR 정확도나 시간 절감률을 직접 측정하지 않았으며 특정 도구의 정확도를 보장하지 않습니다.