PDF OCR

스캔한 PDF를 검색할 수 있는 PDF로 바꿉니다. 이 탭 안에서 끝나며 계정도, 업로드도, 쪽수 제한도 없습니다.

스캔한 PDF에 OCR이 필요한 이유

스캔한 PDF는 사진 더미입니다. 사람 눈에는 잘 읽히지만 컴퓨터가 보기에 그 쪽들에 있는 것은 색깔 있는 점뿐입니다. Ctrl+F로는 아무것도 찾지 못합니다. 한 줄도 복사할 수 없습니다. 색인에도 잡히지 않으니 나중에 어떻게 검색해도 다시 나오지 않습니다.

OCR, 즉 광학 문자 인식은 그것을 바꾸는 단계입니다. 각 쪽의 모양을 보고 그것이 어떤 글자인지 판단한 다음, 그 글자를 이미지 아래에 놓이는 보이지 않는 층으로 파일에 기록합니다. OCR을 거친 PDF는 겉보기에 완전히 같고, 달라지는 것은 아래에 글자가 생겼다는 점뿐입니다.

정작 중요한 순간은 대개 몇 달 뒤에 옵니다. 스캔해 둔 계약서, 청구서, 영수증, 책의 어느 한 쪽. 기억나는 것은 문장 하나뿐이고 나머지는 잊었습니다. 검색 가능한 PDF는 그 문장을 돌려줍니다. 사진 더미는 돌려주지 못합니다.

이 PDF OCR 도구는 전부 브라우저 안에서 돌아갑니다. 파일은 업로드되지 않고, 계정도 없으며, 쪽수 상한도 없습니다. 이 검색어에서 저희보다 위에 있는 페이지는 파일을 무료로 처리한 다음, 돌려주기 전에 로그인을 요구합니다.

업로드형 도구그쪽 서버?이 도구당신의 기기기기를 벗어나는 것이 없으니 지울 사본도 없습니다.
다른 변환기는 파일을 서버로 보냅니다. 이 도구는 파일이 이미 있는 자리에서 그립니다.

PDF에서 OCR이란 무엇인가

PDF에서 OCR이란 파일 안의 쪽 이미지에 문자 인식을 적용하고, 인식된 단어를 보이지 않는 텍스트 레이어로 같은 파일에 다시 기록하는 것입니다. 문서의 겉모습은 그대로이지만 검색과 선택, 복사가 가능해집니다.

화면에서는 구분되지 않는 두 종류의 PDF가 있습니다. 하나는 워드 프로그램에서 내보낸 것으로 진짜 글자를 담고 있고, 다른 하나는 스캐너나 휴대전화 카메라에서 온 것으로 글자의 이미지를 담고 있습니다. OCR이 필요한 쪽은 후자뿐입니다.

도구 없이 빠르게 구별하는 방법이 있습니다. 마우스로 한 줄을 선택해 보세요. 파란 선택 영역이 글자를 따라가면 글자는 이미 거기 있는 것입니다. 쪽 전체가 한 덩어리로 선택되거나 아무 일도 일어나지 않으면 스캔한 PDF입니다.

이 도구는 무언가를 실행하기 전에 그 확인을 대신 해 줍니다. 파일에 이미 텍스트 레이어가 있으면 그렇다고 알리고 대신 텍스트를 추출하도록 권합니다. OCR은 정확한 것을 대략적인 것으로 바꿔 놓는데, 쪽의 모습은 어느 쪽이든 같으니 나중에 알아챌 방법이 없기 때문입니다.

OCR이 만든 글자는 쪽 이미지 위가 아니라 아래에 놓입니다. 그래서 검색 가능한 PDF도 여전히 스캔처럼 보입니다. 보고 있는 것은 언제나 원래 이미지입니다. 보이지 않는 층은 검색창과 복사 명령, 그리고 그 파일을 색인하는 무언가를 위해서만 존재합니다.

그 층이 무엇인지는 분명히 말해 둘 가치가 있습니다. 그것은 추측입니다. 깔끔한 인쇄물에서는 아주 좋은 추측이고, 구겨진 영수증을 비스듬히 찍은 사진에서는 형편없는 추측입니다. 보이는 이미지는 언제나 맞습니다. 그 아래 글자는 아닐 수 있습니다.

이미지만InvoiceNo. 4471Total1,240.00+ 텍스트 층
OCR은 쪽의 겉모습을 바꾸지 않습니다. 이미지 아래에 텍스트 레이어를 넣고, 바로 그것이 PDF를 검색 가능하게 만듭니다.

PDF에 OCR 적용하기, 네 단계

모든 과정이 이 브라우저 탭 안에서 일어납니다. 파일은 기기를 떠나지 않으며, 결과를 내려받기 전에 계정을 만들라고 요구하는 일도 없습니다.

Lorem ipsumdolor sit ametconsectetur글자 있음OCR 불필요Lorem ipsum일부만건너뛰기이미지만OCR 대상
모든 PDF에 OCR이 필요하지는 않습니다. 이 도구는 무언가를 실행하기 전에 먼저 확인합니다. 이미 정확한 글자를 다시 읽어봐야 나빠지기만 하기 때문입니다.
1

스캔한 PDF를 넣으세요

위 상자로 파일을 끌어다 놓거나 눌러서 고르세요. 100MB까지는 문제없습니다. 아무 데도 전송되지 않습니다. 파일을 여는 주체는 이용자 본인의 브라우저에서 동작하는 이 페이지입니다.

2

판정을 확인하세요

도구는 작업을 시작하기 전에 각 쪽에 텍스트 레이어가 있는지 살핍니다. 그리고 이 PDF에 OCR이 필요한지, 일부 쪽에만 필요한지, 아예 필요 없는지를 알려 줍니다. 일부만 스캔이라면 나머지는 기본값으로 손대지 않습니다.

3

문서 언어를 고르세요

정확도는 이 선택에 가장 크게 좌우됩니다. 이 화면의 언어가 아니라 문서가 쓰인 언어를 고르세요. 언어 데이터는 한 번만 내려받습니다. 영어는 약 5.2MB, 힌디어는 약 1.7MB이고 그 뒤로는 캐시에 남습니다. 여러 언어를 함께 고를 수도 있지만 쪽마다 느려집니다.

4

실행하고 결과를 확인하세요

쪽은 한 장씩 처리되고 지금 읽고 있는 쪽의 미리보기가 표시되므로, 파일을 잘못 넣었다면 일찍 멈출 수 있습니다. 끝나면 미리보기에서 글자를 선택해 보세요. 그런 다음 검색 가능한 PDF를, 글자만 필요하다면 일반 텍스트를 내려받으세요.

글자만 필요하다면 PDF가 아니라 글자가 필요하고 파일에 이미 텍스트 레이어가 있다면, 추측이 전혀 끼어들지 않는 더 빠른 길이 있습니다. PDF에서 바로 텍스트 추출하기.

이 PDF OCR 도구가 하는 일

텍스트 레이어를 더할 뿐 다른 것은 바꾸지 않습니다. 원래 쪽은 그대로 남습니다. 이미지도, 해상도도, 쪽 테두리도 같습니다. 인식된 단어는 불투명도 0으로 위에 그려지므로 선택과 검색은 되지만 눈에는 보이지 않습니다. 원래 글자가 있던 쪽은 아예 다시 쓰지 않습니다.

쪽은 150DPI로 그립니다. 이것은 기본값이 아니라 측정해서 고른 값입니다. 어떤 시험 문서에서 100, 150, 200, 300DPI의 정확도는 0.5퍼센트포인트 안에서 같았고 300DPI는 네 배의 시간이 걸렸습니다. 100DPI 아래에는 절벽이 있어 72DPI에서는 정확도가 95.6%에서 79.3%로 떨어졌습니다. 600DPI로 스캔한다고 OCR이 더 정확해지지는 않습니다. 느려지기만 합니다.

100개가 넘는 언어를 다루며, 대부분의 변환기가 건너뛰는 문자들도 포함합니다. 꽤 알려진 온라인 OCR 도구 하나는 19개 언어를 내세우는데 그중 남아시아 문자는 하나도 없습니다. 여기에는 힌디어, 타밀어, 벵골어가 목록에 있고 그것도 위쪽에 있습니다. 이 말을 검색하는 사람 대부분이 실제로 그곳에 있기 때문입니다.

해내지 못한 것을 세어서 알려 줍니다. 어떤 쪽이 글자 없이 돌아오면, 빈 종이든 사진이든 손글씨든, 그 쪽은 손대지 않은 채 파일에 남고 그 사실이 보고됩니다. 조용히 버려지는 것은 없습니다.

로그인을 요구하는 일은 결코 없습니다. 400쪽짜리 문서를 처리하고 이어서 하나 더 처리할 수 있습니다. 하루 한도가 없는데, 작업을 대신하는 서버가 없으니 배분할 것도 없기 때문입니다.

사람들이 PDF OCR을 쓰는 경우:

  • 스캔한 계약서를 보관하기 전에 검색 가능하게 만들기
  • 한 쪽씩 찍어 둔 책의 장에서 원하는 한 줄 찾기
  • 스캔한 청구서 폴더를 훑어볼 수 있는 것으로 바꾸기
  • PDF로 도착한 팩스나 복사본에서 글자 꺼내기
  • 오래된 스캔 기록을 기억이 아니라 검색으로 찾을 수 있게 하기
  • 검색 색인이나 다른 도구가 읽을 수 있도록 스캔본 준비하기
  • 스캔본에서 문단을 다시 타이핑하지 않고 복사하기

어떤 기기에서나 됩니다

설치할 것이 없습니다. OCR은 이미 쓰고 있는 브라우저에서 돌아가므로 같은 도구가 어디서나 작동하고, 파일은 시작한 기기에 그대로 남습니다.

§ 01

Windows

Chrome, Edge, Firefox에서 됩니다. 내려받을 것도 없고, 스캔본을 검색 가능하게 만들려고 Acrobat 구독을 할 필요도 없습니다.

§ 02

Mac

Safari나 Chrome. 미리보기는 스캔 PDF를 보여 줄 수는 있지만 거기에 텍스트 레이어를 더하지는 못합니다.

§ 03

iPhone과 iPad

Safari에서 됩니다. 방금 찍은 사진이 스캔본일 때 편리한데, 바로 그때가 쪽을 똑바로 놓는 것이 가장 중요한 경우이기도 합니다.

§ 04

Android

Chrome에서 됩니다. 긴 문서는 시간이 걸리고 휴대전화를 계속 쓰게 되니 먼저 충전기에 꽂아 두세요.

§ 05

Chromebook

잘 맞습니다. 설치형 프로그램이 아니라 모든 것이 브라우저 안에서 로컬로 돌아가기 때문입니다.

§ 06

Linux

요즘 브라우저면 됩니다. 패키지도, 명령줄도, 대기열도 없습니다.

OCR이 맞히는 것과 틀리는 것

모든 OCR 도구는 틀리지만, 그 오류가 어떤 모습인지 알려 주는 곳은 거의 없습니다. 실제 결과를 보여 드립니다. 컴퓨터로 만든 깨끗한 청구서, 잡티도 기울기도 없이 전체 글자 단위 정확도 95.6%. 거기서 뽑은 열두 단어 가운데 검색으로 찾을 수 있었던 것은 다섯 개였습니다.

파일에는OCR이 읽은 것NorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis12개 중 5개 검색 가능
깨끗한 시험용 청구서에서, 글자 단위 정확도 95.6%. 회사명은 살아남았지만 합계는 아니었습니다. OCR이 숫자 한가운데에 공백을 끼워 넣었기 때문입니다.
문서에는OCR이 읽은 것이유
NorthwindNorthwind가변폭 글꼴의 평범한 본문은 가장 쉬운 경우입니다.
2089.802089. 80숫자 한가운데에 공백이 생겨 합계를 검색해도 걸리지 않습니다.
INV-2026-04471INV2026-04471붙임표 하나가 빠졌습니다. 참조 번호는 유난히 잘 깨집니다.
ReplacementRepl acenentm을 n으로 읽었고, 없던 공백까지 들어갔습니다.
Payment isPaymentis반대 방향의 실패로, 진짜 공백이 지워졌습니다.
1741.501741.50같은 표, 같은 글꼴, 위 합계와 같은 형식인데 이것은 제대로 읽혔습니다. 오류는 예측되지 않습니다.

스캔본을 정말로 망치는 것

압축도 해상도도 아닙니다. 품질 60의 JPEG는 무손실 렌더링과 소수점 이하 차이였습니다. 해를 끼친 것은 기울기였습니다. 2도 기운 쪽은 문제가 없었지만 7도에서는 정확도가 9.5포인트 떨어지고 신뢰도가 91에서 74로 내려갔습니다. 무언가를 스캔한다면 똑바로 놓으세요. DPI를 올리는 수고는 하지 않아도 됩니다.

검색 가능한 PDF, 일반 텍스트, 아니면 Word 파일?

검색 가능한 PDF는 이 페이지가 만드는 것입니다. 원래 스캔본에 보이지 않는 텍스트 레이어가 더해지고, 여전히 PDF입니다. 일반 텍스트는 편집 배치를 버린 단어들로, 다른 곳에 붙여 넣을 때 유용하며 여기서 두 번째 내려받기로 제공합니다. 편집 가능한 Word 문서는 단, 표, 제목 같은 배치를 다시 짜는 별개의 작업이고 이 도구는 하지 않습니다. PDF에 이미 글자가 있고 단어만 필요하다면 OCR을 건너뛰고 바로 추출하세요.

스캔본은 이 브라우저를 떠나지 않습니다

여기에 놓은 PDF는 이 페이지가 열고, 이용자 본인의 프로세서가 읽고, 이용자 본인의 브라우저가 다시 씁니다. 업로드되지 않고, 어떤 서버의 대기열에도 들어가지 않으며, 보관 기간 동안 어딘가에 남지도 않습니다. 애초에 이 작업에 서버가 끼어들지 않기 때문입니다.

이 점은 대부분의 변환보다 OCR에서 더 무겁습니다. 검색 가능하게 만들어야 하는 문서는 계약서, 진료 기록, 거래 내역서, 신분증처럼 원본을 남겨 둘 가치가 있었기에 존재하는 스캔본입니다. 주요 온라인 OCR 서비스는 모두 자사 장비에서 이를 처리하고 보통 한 시간에서 여덟 시간 뒤 예정대로 삭제합니다.

배분할 것이 없다는 뜻이기도 합니다. 자기 하드웨어로 작업하는 서비스는 무료 사용을 제한할 수밖에 없고, 그래서 하루 두 건이나 파일당 열 쪽에서 막습니다. 여기서는 작업이 이용자 기기에서 일어나므로 강제할 한도도, 수집할 가입 정보도 없습니다.

§ 01

아무것도 업로드되지 않습니다

파일은 로컬에서 읽힙니다. 어떤 서버에도 사본이 만들어지지 않습니다.

§ 02

계정은 끝까지 필요 없습니다

결과를 내려받는 데 로그인을 요구하지 않습니다. 다른 곳에서는 그것이 무료 OCR의 흔한 대가입니다.

§ 03

쪽수·파일 수 제한 없음

400쪽짜리 스캔본을 처리하고 또 하나 처리하세요. 하루 할당량이 없습니다.

§ 04

언어 데이터만

내려받는 것은 고른 언어의 인식 데이터뿐입니다. 이용자의 문서가 그 요청에 실리는 일은 없습니다.

자주 묻는 질문

이 PDF OCR 도구는 정말 무료인가요? 쪽수 제한이 있나요?
무료이고 쪽수 제한도 하루 할당량도 없습니다. OCR이 서버가 아니라 이용자 기기에서 돌아가므로 저희 쪽에 파일당 비용이 들지 않고 배분할 것도 없기 때문입니다. 큰 문서를 제한하는 것은 인내심과 배터리뿐입니다.
결과를 내려받으려면 가입해야 하나요?
아닙니다. 파일을 놓고 OCR을 돌리고 검색 가능한 PDF를 내려받기까지 계정도 이메일 주소도 필요 없습니다. 어떤 OCR 사이트든 파일을 올리기 전에 확인해 볼 만한 점입니다. 작업이 끝난 내려받기 단계에서야 계정을 요구하는 일이 흔하기 때문입니다.
내 PDF에 OCR이 필요한지 어떻게 아나요?
마우스로 글자 한 줄을 선택해 보세요. 선택 영역이 글자를 따라가면 그 파일에는 이미 텍스트 레이어가 있고 OCR은 오히려 나빠지게 만듭니다. 이 도구는 파일을 추가하는 순간 자동으로 확인하고, 세 가지 경우 중 어디에 해당하는지 실행 전에 알려 줍니다.
OCR 정확도는 어느 정도인가요?
쓸모 있을 만큼은 정확하고, 그대로 믿을 만큼은 아닙니다. 컴퓨터로 만든 깨끗한 시험용 청구서에서 글자 단위 정확도는 95.6%였습니다. 그러나 거기서 뽑은 12개 단어 가운데 실제로 검색해서 찾을 수 있었던 것은 5개였습니다. 공백이 숫자 안으로 들어가거나 붙임표가 사라졌기 때문입니다. 또렷한 인쇄물은 잘 됩니다. 구겨졌거나 흐리거나 기울어진 것은 나빠집니다.
어떤 언어를 지원하나요?
100개가 넘고, 익숙한 유럽 언어와 함께 힌디어, 타밀어, 벵골어, 태국어, 베트남어, 인도네시아어도 포함합니다. 이 페이지의 언어가 아니라 문서가 쓰인 언어를 고르세요. 다른 어떤 설정보다 정확도에 크게 작용합니다. 다만 데바나가리처럼 글자 모양을 다시 짜는 문자는 제대로 인식됐더라도 PDF 텍스트 레이어에 기록되는 과정에서 단어를 잃을 수 있습니다.
손글씨도 읽나요?
읽지 못한다고 보시면 됩니다. 이 엔진은 인쇄된 글자를 위해 만들어졌고, 손글씨는 그것을 위해 훈련되지 않은 다른 문제입니다. 손으로 쓴 쪽은 대개 비어 있거나 그에 가까운 상태로 돌아옵니다. 그런 경우 그 쪽은 있던 그대로 파일에 남고, 조용히 버려지는 대신 요약에 보고됩니다.
처리한 뒤 PDF 모습이 달라지나요?
달라지지 않습니다. 그것이 핵심입니다. 쪽 이미지는 있던 그대로 유지되고 인식된 글자는 불투명도 0으로 위에 그려집니다. 보고 있는 것은 여전히 원래 스캔본이고, 텍스트 레이어는 검색창과 복사 명령만을 위해 존재합니다.
DPI를 높여 스캔하면 OCR 결과가 좋아지나요?
대개 좋아지지 않습니다. 시험에서 100, 150, 200, 300DPI의 정확도는 0.5퍼센트포인트 안에서 같았고 300DPI는 네 배의 시간이 걸렸습니다. 바닥은 있어서 72DPI에서는 정확도가 79.3%까지 무너졌지만, 대략 150DPI를 넘어서면 시간만 치르고 얻는 것이 없습니다. 쪽을 똑바로 놓는 편이 훨씬 낫습니다.
얼마나 걸리나요?
표준 A4 쪽 기준으로 보통 노트북에서 쪽당 약 1초입니다. 그래서 50쪽 문서는 1분 안팎입니다. 휴대전화는 더 느립니다. 여러 언어를 고르면 작업량이 배로 늘어나니 실제로 문서에 있는 언어만 고르세요.
제 파일이 어딘가로 업로드되나요?
아닙니다. PDF는 이 탭 안에서 열리고 처리되며 서버로 전송되지 않습니다. 이 도구가 보내는 유일한 네트워크 요청은 고른 언어의 인식 데이터를 가져오는 것이고, 그것은 모두에게 같은 파일이며 이용자의 것은 전혀 담고 있지 않습니다.
'PDF 텍스트 변환'과는 무엇이 다른가요?
이 페이지는 이미지 속 글자를 추측해서 스캔본으로부터 검색 가능한 PDF를 만듭니다. 'PDF 텍스트 변환'은 파일에 이미 들어 있는 글자를 추측 없이 정확히 꺼냅니다. PDF에 텍스트 레이어가 있다면 그쪽이 원하시는 도구입니다. 더 빠르고, OCR이 저지르는 종류의 실수를 아예 할 수 없습니다.
편집 가능한 Word 문서로 받을 수 있나요?
이 도구로는 안 됩니다. 스캔본을 Word 파일로 바꾸는 것은 단, 표, 제목 같은 배치를 다시 짜는 일이고, 그것은 고유한 실패 방식을 지닌 별개의 작업입니다. 여기서 받는 것은 검색 가능하게 만든 원래 PDF, 그리고 단어만 필요할 때 쓰는 일반 텍스트 내려받기입니다.

스캔한 PDF를 검색 가능하게 만드세요

무료, 무제한, 이 탭 안에서 끝납니다. 업로드도 가입도 없고, 파일에 OCR이 필요 없다면 그렇게 알려 줍니다.

PDF에 OCR 적용하기