JJESTOCOST제스토코스트
#AI 활용법#ChatGPT 스캔 PDF 글자 못 읽음

ChatGPT가 스캔 PDF를 못 읽나요? OCR 전에 확인할 7단계

ChatGPT가 PDF를 올려받았다고 해서 그 안의 글자·표·도장을 모두 읽은 것은 아닙니다. 먼저 PDF에서 글자를 드래그할 수 있는지 확인하십시오. 드래그가 안 되면 이미지로 스캔된 문서일 가능성이 크므로 OCR로 검색 가능한 텍스트를 만든 뒤, 숫자·날짜·상호를 원본과 대조해야 합니다. 특히 견적서, 세금계산서, 신청서처럼 한 글자 오류가 돈이나 계약으로 이어지는 문서…

제코 12분 조회 3

ChatGPT가 PDF를 올려받았다고 해서 그 안의 글자·표·도장을 모두 읽은 것은 아닙니다. 먼저 PDF에서 글자를 드래그할 수 있는지 확인하십시오. 드래그가 안 되면 이미지로 스캔된 문서일 가능성이 크므로 OCR로 검색 가능한 텍스트를 만든 뒤, 숫자·날짜·상호를 원본과 대조해야 합니다.

특히 견적서, 세금계산서, 신청서처럼 한 글자 오류가 돈이나 계약으로 이어지는 문서는 ‘요약이 자연스럽다’는 이유로 통과시키면 안 됩니다. ChatGPT 플랜과 PDF를 넣은 위치에 따라 시각자료 처리 조건도 다르므로, 파일 진단 → 처리 경로 선택 → OCR → 추출 검수 → AI 분석 → 원본 대조 순서가 안전합니다.

업로드 성공과 판독 성공은 다른 일입니다

PDF는 겉모습이 같아도 내부 구조가 다릅니다. 워드나 한글 문서에서 내보낸 PDF에는 선택 가능한 텍스트 층이 있을 수 있습니다. 복합기나 휴대폰으로 찍은 문서를 묶은 PDF는 페이지 전체가 사진일 수 있습니다. 표는 글자 층이 있어도 셀의 행·열 관계가 깨질 수 있고, 도장·서명·손글씨는 별도 이미지로 남기도 합니다.

OpenAI의 PDF 시각 검색 FAQ는 2026년 9월 13일 확인 기준으로 PDF 안의 이미지·그래프·도표를 함께 해석하는 기능을 ChatGPT Enterprise에 한정해 설명합니다. 같은 Enterprise 안에서도 GPT의 Knowledge나 프로젝트 파일로 저장한 PDF는 텍스트 전용 검색으로 처리되고, 공개 GPT와의 대화 또는 프로젝트 대화 중 직접 첨부한 PDF는 시각 검색으로 처리된다고 안내합니다. 같은 파일이라도 플랜과 업로드 위치가 달라지면 보이는 정보가 달라질 수 있다는 뜻입니다.

OpenAI의 Enterprise 파일 업로드 최적화 가이드는 문서의 텍스트 추출, 이미지 판독, 시각 검색을 서로 다른 처리 경로로 구분합니다. 큰 문서는 일부 텍스트를 대화 문맥에 넣고 나머지를 검색 인덱스에서 찾을 수 있으므로, 업로드 아이콘에 체크가 떴다는 사실만으로 전체 페이지를 읽었다고 판단할 수 없습니다. 이 세부 구조는 Enterprise 설명이므로 다른 플랜의 내부 동작으로 일반화하지 마십시오.

1단계: 먼저 ‘못 읽음’의 종류를 나누십시오

아래 네 가지는 해결법이 다릅니다.

증상먼저 볼 것다음 행동
파일 자체가 첨부되지 않음파일 크기·사용량 한도·지원 형식·서비스 상태파일을 줄이거나 형식을 확인하고 새 대화에서 재시도
글자를 선택할 수 없음페이지 전체가 이미지인지OCR로 텍스트 층 생성
본문은 읽지만 표·그래프를 빠뜨림현재 플랜과 PDF 업로드 위치표 페이지만 이미지로 분리하거나 Enterprise 시각 검색 조건 확인
숫자·날짜가 엉뚱함OCR 언어·해상도·기울기·원본 품질OCR 재실행 후 핵심 필드를 원본과 대조

OpenAI 파일 업로드 FAQ는 문서별 크기와 토큰 한도, 사용자·조직별 사용량 제한을 따로 둡니다. 한도는 플랜과 시점에 따라 바뀔 수 있으므로 오늘 화면과 공식 FAQ를 기준으로 확인하십시오. 첨부 실패를 OCR 문제로 오해하면 파일을 계속 변환해도 해결되지 않습니다.

2단계: 30초 선택 테스트로 PDF 종류를 확인하십시오

PDF를 브라우저나 미리보기 앱으로 열고 본문 한 문장을 드래그해 복사합니다. 메모장에 붙여 넣어 다음을 확인하십시오.

  • 문장이 정상 순서로 붙는가?
  • `0/O`, `1/I/l`, `5/S`, 쉼표와 소수점이 바뀌지 않았는가?
  • 표의 한 행이 열 순서를 유지하는가?
  • 머리말·꼬리말이 본문 중간에 섞이지 않는가?

글자가 아예 선택되지 않으면 이미지 기반 PDF로 봅니다. 글자는 선택되지만 순서가 뒤섞이면 텍스트 층은 있어도 분석용 품질이 낮은 PDF입니다. 둘 다 ChatGPT에 바로 맡기기 전에 전처리가 필요합니다.

3단계: 민감도에 따라 처리 장소를 먼저 정하십시오

고객 이름, 전화번호, 주소, 주민등록번호, 계좌번호, 계약 단가, 비공개 제안서가 있다면 온라인 OCR 사이트부터 찾지 마십시오. 먼저 문서 소유자, 외부 AI 업로드 허용 여부, 보관 기간, 삭제 절차, 위탁처를 확인해야 합니다.

개인용 ChatGPT에서 `Improve the model for everyone`을 끄면 새 대화를 모델 개선에 쓰지 않도록 설정할 수 있지만, OpenAI Data Controls FAQ는 대화 기록이 계속 보일 수 있다고 설명합니다. 학습 차단과 저장 중단은 같은 기능이 아닙니다. OpenAI의 비즈니스 데이터 정책은 Business·Enterprise·Edu와 API의 조직 데이터를 기본적으로 모델 학습에 쓰지 않는다고 안내하지만, 이것도 회사의 업로드 승인과 보존 계약을 대신하지 않습니다. 확인일은 2026년 9월 13일입니다.

실무 기준은 간단합니다.

  1. 공개 안내문·상품 설명서: 온라인 OCR 또는 ChatGPT 시험 가능
  2. 이름을 지운 내부 양식: 조직 정책이 허용하면 최소 페이지만 시험
  3. 고객 원문·계약서·정산 원장: 조직 승인·계약·권한 확인 전 업로드 금지
  4. 비밀번호·인증코드·API 키: 가린 뒤에도 업무 목적상 필요하지 않으면 입력 금지

4단계: OCR로 ‘검색 가능한 사본’을 만드십시오

OCR은 사진 속 글자를 실제 텍스트 층으로 바꾸는 과정입니다. 원본을 덮어쓰지 말고 `원본.pdf`와 `OCR_작업본.pdf`를 분리하십시오.

macOS라면 Apple 미리보기의 PDF 텍스트 포함 안내를 따라 이미지 기반 PDF를 열고 파일 → 내보내기 → 텍스트 포함(Embed Text)을 선택할 수 있습니다. 이 항목은 텍스트가 아직 인식되지 않은 문서에서만 보일 수 있습니다. 회사 보안 정책이 로컬 처리를 요구한다면 우선 검토할 만한 경로입니다.

Acrobat을 쓰는 환경이라면 Adobe의 스캔 PDF 텍스트 인식 안내에 따라 모든 도구 → 스캔 및 OCR → 이 파일에서 → 페이지와 언어 선택 → 텍스트 인식 순서로 검색 가능한 텍스트 층을 만들 수 있습니다. Adobe도 OCR 뒤 정확성과 완전성을 확인하고 필요하면 수정하거나 설정을 바꿔 다시 실행하라고 안내합니다. 유료 제품 구매를 권하는 뜻이 아니라, 이미 사용하는 환경에서 공식 절차를 적용하라는 의미입니다.

5단계: 전체 문서 전에 대표 3페이지만 시험하십시오

100페이지를 한 번에 변환하기 전에 아래 세 페이지를 뽑습니다.

  • 일반 본문이 많은 페이지 1장
  • 표·금액·날짜가 많은 페이지 1장
  • 도장·손글씨·기울어진 스캔이 있는 가장 어려운 페이지 1장

OCR 뒤 각 페이지에서 10개 필드를 골라 원본과 비교합니다. 예를 들어 견적서라면 상호, 사업자번호, 품목명, 수량, 단가, 공급가액, 세액, 합계, 작성일, 유효기간입니다. 틀린 필드가 하나라도 결제·신청·계약 판단에 영향을 주면 자동 처리하지 마십시오.

가상 검수 예시원본OCR 결과판정
수량101O오류, O를 숫자 0으로 수정
단가89,000원89.000원오류, 구두점 수정
공급가액890,000원890,000원일치
납기2026-09-182026-09-16중대 오류, 원본 재확인

이 표는 실제 고객 데이터가 아닌 가상 예시입니다. OCR 성공률을 수치로 일반화하려는 표도 아닙니다.

6단계: ChatGPT에는 ‘먼저 추출, 나중에 판단’을 시키십시오

처음부터 “이 계약서 괜찮아?”라고 묻지 마십시오. 추출과 판단을 한 번에 시키면 누락된 글자를 모델이 자연스러운 문장으로 메울 수 있습니다. 아래 프롬프트는 OCR이 끝난 PDF 또는 허용된 대표 페이지만 첨부한 뒤 그대로 사용할 수 있습니다.

첨부 문서의 내용을 추측해서 보완하지 마십시오. 먼저 문서에서 실제로 확인되는 정보만 추출하십시오. 1. 페이지별 제목과 본문을 구분합니다. 2. 모든 금액·날짜·수량·사업자번호는 `값 | 페이지 | 주변 문구` 세 칸 표로 만듭니다. 3. 읽을 수 없거나 확신할 수 없는 글자는 `[판독불가]`로 표시하고 후보를 만들지 않습니다. 4. 표의 빈칸, 병합된 셀, 합계와 세부 금액의 불일치를 별도 목록으로 냅니다. 5. 마지막에만 계산 검산을 하며, 원문 추출값과 계산값을 분리합니다. 6. 답변 끝에 `확인한 페이지 / 확인하지 못한 페이지 / 사람이 원본에서 다시 볼 필드`를 적습니다.

이 프롬프트의 목적은 정답 보장이 아니라 모르는 부분을 드러내는 것입니다. 결과에 페이지 근거가 없으면 원문 대조 비용이 오히려 커집니다.

7단계: AI 답변이 아니라 원본으로 합격을 판정하십시오

최종 검수는 아래 순서로 끝냅니다.

  1. 페이지 수가 원본과 같은지 확인합니다.
  2. 금액·날짜·수량·고유번호를 모두 원본과 대조합니다.
  3. 세부 금액의 합계와 문서 합계가 맞는지 다시 계산합니다.
  4. 표의 빈칸을 `0`이나 ‘해당 없음’으로 임의 해석하지 않았는지 봅니다.
  5. 도장·서명·손글씨를 읽지 못했다면 결과에 명시했는지 확인합니다.
  6. 사용한 작업본과 온라인 서비스의 삭제·보관 상태를 확인합니다.
  7. 결제·제출·계약 같은 외부 행동은 승인자 검수 뒤 실행합니다.

Adobe의 OCR 오류 수정 안내는 인식이 불확실한 단어를 검토·수정하는 절차를 따로 둡니다. OCR도 완성 답안이 아니라 검수할 초안입니다. ChatGPT는 그 OCR 결과를 다시 해석하므로 오류가 한 단계 더 누적될 수 있습니다.

어떤 경우에 지금 중단해야 하나요?

다음 중 하나면 속도보다 중단이 이득입니다.

  • 원문에 개인정보·계약 기밀이 있는데 외부 업로드 승인이 없다.
  • OCR 결과에서 합계·날짜·계좌번호가 한 번이라도 바뀌었다.
  • 표가 두 페이지에 걸쳐 이어지는데 행 연결 근거가 없다.
  • ChatGPT가 `[판독불가]` 대신 그럴듯한 값을 채웠다.
  • 어떤 페이지를 읽었는지 답변에 표시하지 못한다.
  • 결과가 세금 신고, 계약 체결, 대출 신청, 의료·법률 판단에 바로 쓰인다.

이때는 필요한 페이지만 사람이 입력하고 이중 검수하거나, 승인된 사내 OCR·문서 처리 시스템을 사용하십시오. 외부 서비스에 같은 원문을 여러 번 올리는 재시도는 해결책이 아닙니다.

자주 묻는 질문

ChatGPT Plus나 Pro면 스캔 PDF의 이미지까지 항상 읽나요?

아닙니다. 2026년 9월 13일 확인한 OpenAI 공식 FAQ는 PDF 내 시각자료를 함께 읽는 Visual Retrieval을 Enterprise 전용으로 안내하며 Free·Pro·Team·Edu에는 지원되지 않는다고 설명합니다. 기능은 바뀔 수 있으므로 현재 플랜 화면과 공식 FAQ를 다시 확인하십시오.

프로젝트 파일로 올린 PDF와 대화에 첨부한 PDF가 다른가요?

Enterprise 공식 안내에서는 다릅니다. GPT Knowledge나 Project Files에 저장된 PDF는 텍스트 전용 검색으로 처리되고, 프로젝트 대화 중 사용자가 직접 첨부한 PDF는 시각 검색 대상입니다. 다른 플랜에는 같은 동작을 가정하면 안 됩니다.

글자를 드래그할 수 있으면 OCR이 필요 없나요?

항상 그렇지는 않습니다. 선택 가능한 텍스트가 있어도 글자 순서, 표의 열, 숫자와 특수기호가 깨질 수 있습니다. 한 문장을 복사해 보고, 대표 3페이지의 핵심 필드 10개를 원본과 비교하십시오.

PDF를 이미지로 바꿔 한 장씩 올리면 해결되나요?

표나 도표를 별도 이미지로 보여 주는 데 도움이 될 수 있지만, 페이지 순서·한도·개인정보·맥락 손실 문제는 남습니다. 문서 전체를 무조건 이미지로 쪼개기보다 어려운 대표 페이지와 핵심 표만 승인된 경로로 시험하십시오.

OCR 뒤 ChatGPT 요약만 확인하면 되나요?

아닙니다. 요약이 자연스러워도 금액 하나가 틀릴 수 있습니다. 숫자·날짜·고유번호를 `값 | 페이지 | 주변 문구`로 추출하고 원본에서 전수 대조해야 합니다.

무료 OCR 사이트에 계약서를 올려도 되나요?

서비스의 보관·삭제·재사용·처리 지역·위탁 조건과 회사 정책을 확인하기 전에는 올리지 마십시오. 공개 문서나 완전히 비식별화한 샘플로 기능을 먼저 시험하고, 기밀 문서는 승인된 로컬 또는 조직용 경로를 사용하십시오.

관련 글

오늘은 문서 전체를 올리지 말고 가장 어려운 3페이지만 복사·OCR·대조해 보십시오. 10개 핵심 필드가 맞지 않으면 도구를 바꾸기 전에 원본 품질과 처리 경로부터 바꾸는 것이 제코의 판단입니다.

---

이 글은 AI가 조사·구성·초안 작성을 보조했고, 공개 자료와 운영 데이터 대조 및 분리 검수를 거칩니다. 특정 플랜의 실제 파일을 업로드해 성공률을 측정한 실험 결과가 아니며, 기능·한도는 2026년 9월 13일 공식 안내를 기준으로 작성했습니다.

#AI 활용법#ChatGPT 스캔 PDF 글자 못 읽음

댓글 0

회원만 댓글을 남길 수 있어요.

작성된 댓글은 모두 공개됩니다. 비밀댓글은 지원하지 않습니다.

로그인하고 댓글 쓰기

아직 댓글이 없어요. 첫 공개 댓글을 남겨보세요.

이어서 볼 기록