PDF OCR
스캔한 PDF를 검색할 수 있는 PDF로 바꿉니다. 이 탭 안에서 끝나며 계정도, 업로드도, 쪽수 제한도 없습니다.
스캔한 PDF를 여기에 놓거나 눌러서 고르세요
100MB까지 · 아무것도 업로드되지 않습니다
- 100% 브라우저 안에서
- 업로드 없음
- 가입 없이 내려받기
- 쪽수 제한 없음
스캔한 PDF에 OCR이 필요한 이유
스캔한 PDF는 사진 더미입니다. 사람 눈에는 잘 읽히지만 컴퓨터가 보기에 그 쪽들에 있는 것은 색깔 있는 점뿐입니다. Ctrl+F로는 아무것도 찾지 못합니다. 한 줄도 복사할 수 없습니다. 색인에도 잡히지 않으니 나중에 어떻게 검색해도 다시 나오지 않습니다.
OCR, 즉 광학 문자 인식은 그것을 바꾸는 단계입니다. 각 쪽의 모양을 보고 그것이 어떤 글자인지 판단한 다음, 그 글자를 이미지 아래에 놓이는 보이지 않는 층으로 파일에 기록합니다. OCR을 거친 PDF는 겉보기에 완전히 같고, 달라지는 것은 아래에 글자가 생겼다는 점뿐입니다.
정작 중요한 순간은 대개 몇 달 뒤에 옵니다. 스캔해 둔 계약서, 청구서, 영수증, 책의 어느 한 쪽. 기억나는 것은 문장 하나뿐이고 나머지는 잊었습니다. 검색 가능한 PDF는 그 문장을 돌려줍니다. 사진 더미는 돌려주지 못합니다.
이 PDF OCR 도구는 전부 브라우저 안에서 돌아갑니다. 파일은 업로드되지 않고, 계정도 없으며, 쪽수 상한도 없습니다. 이 검색어에서 저희보다 위에 있는 페이지는 파일을 무료로 처리한 다음, 돌려주기 전에 로그인을 요구합니다.
PDF에서 OCR이란 무엇인가
PDF에서 OCR이란 파일 안의 쪽 이미지에 문자 인식을 적용하고, 인식된 단어를 보이지 않는 텍스트 레이어로 같은 파일에 다시 기록하는 것입니다. 문서의 겉모습은 그대로이지만 검색과 선택, 복사가 가능해집니다.
화면에서는 구분되지 않는 두 종류의 PDF가 있습니다. 하나는 워드 프로그램에서 내보낸 것으로 진짜 글자를 담고 있고, 다른 하나는 스캐너나 휴대전화 카메라에서 온 것으로 글자의 이미지를 담고 있습니다. OCR이 필요한 쪽은 후자뿐입니다.
도구 없이 빠르게 구별하는 방법이 있습니다. 마우스로 한 줄을 선택해 보세요. 파란 선택 영역이 글자를 따라가면 글자는 이미 거기 있는 것입니다. 쪽 전체가 한 덩어리로 선택되거나 아무 일도 일어나지 않으면 스캔한 PDF입니다.
이 도구는 무언가를 실행하기 전에 그 확인을 대신 해 줍니다. 파일에 이미 텍스트 레이어가 있으면 그렇다고 알리고 대신 텍스트를 추출하도록 권합니다. OCR은 정확한 것을 대략적인 것으로 바꿔 놓는데, 쪽의 모습은 어느 쪽이든 같으니 나중에 알아챌 방법이 없기 때문입니다.
OCR이 만든 글자는 쪽 이미지 위가 아니라 아래에 놓입니다. 그래서 검색 가능한 PDF도 여전히 스캔처럼 보입니다. 보고 있는 것은 언제나 원래 이미지입니다. 보이지 않는 층은 검색창과 복사 명령, 그리고 그 파일을 색인하는 무언가를 위해서만 존재합니다.
그 층이 무엇인지는 분명히 말해 둘 가치가 있습니다. 그것은 추측입니다. 깔끔한 인쇄물에서는 아주 좋은 추측이고, 구겨진 영수증을 비스듬히 찍은 사진에서는 형편없는 추측입니다. 보이는 이미지는 언제나 맞습니다. 그 아래 글자는 아닐 수 있습니다.
PDF에 OCR 적용하기, 네 단계
모든 과정이 이 브라우저 탭 안에서 일어납니다. 파일은 기기를 떠나지 않으며, 결과를 내려받기 전에 계정을 만들라고 요구하는 일도 없습니다.
스캔한 PDF를 넣으세요
위 상자로 파일을 끌어다 놓거나 눌러서 고르세요. 100MB까지는 문제없습니다. 아무 데도 전송되지 않습니다. 파일을 여는 주체는 이용자 본인의 브라우저에서 동작하는 이 페이지입니다.
판정을 확인하세요
도구는 작업을 시작하기 전에 각 쪽에 텍스트 레이어가 있는지 살핍니다. 그리고 이 PDF에 OCR이 필요한지, 일부 쪽에만 필요한지, 아예 필요 없는지를 알려 줍니다. 일부만 스캔이라면 나머지는 기본값으로 손대지 않습니다.
문서 언어를 고르세요
정확도는 이 선택에 가장 크게 좌우됩니다. 이 화면의 언어가 아니라 문서가 쓰인 언어를 고르세요. 언어 데이터는 한 번만 내려받습니다. 영어는 약 5.2MB, 힌디어는 약 1.7MB이고 그 뒤로는 캐시에 남습니다. 여러 언어를 함께 고를 수도 있지만 쪽마다 느려집니다.
실행하고 결과를 확인하세요
쪽은 한 장씩 처리되고 지금 읽고 있는 쪽의 미리보기가 표시되므로, 파일을 잘못 넣었다면 일찍 멈출 수 있습니다. 끝나면 미리보기에서 글자를 선택해 보세요. 그런 다음 검색 가능한 PDF를, 글자만 필요하다면 일반 텍스트를 내려받으세요.
글자만 필요하다면 PDF가 아니라 글자가 필요하고 파일에 이미 텍스트 레이어가 있다면, 추측이 전혀 끼어들지 않는 더 빠른 길이 있습니다. PDF에서 바로 텍스트 추출하기.
이 PDF OCR 도구가 하는 일
텍스트 레이어를 더할 뿐 다른 것은 바꾸지 않습니다. 원래 쪽은 그대로 남습니다. 이미지도, 해상도도, 쪽 테두리도 같습니다. 인식된 단어는 불투명도 0으로 위에 그려지므로 선택과 검색은 되지만 눈에는 보이지 않습니다. 원래 글자가 있던 쪽은 아예 다시 쓰지 않습니다.
쪽은 150DPI로 그립니다. 이것은 기본값이 아니라 측정해서 고른 값입니다. 어떤 시험 문서에서 100, 150, 200, 300DPI의 정확도는 0.5퍼센트포인트 안에서 같았고 300DPI는 네 배의 시간이 걸렸습니다. 100DPI 아래에는 절벽이 있어 72DPI에서는 정확도가 95.6%에서 79.3%로 떨어졌습니다. 600DPI로 스캔한다고 OCR이 더 정확해지지는 않습니다. 느려지기만 합니다.
100개가 넘는 언어를 다루며, 대부분의 변환기가 건너뛰는 문자들도 포함합니다. 꽤 알려진 온라인 OCR 도구 하나는 19개 언어를 내세우는데 그중 남아시아 문자는 하나도 없습니다. 여기에는 힌디어, 타밀어, 벵골어가 목록에 있고 그것도 위쪽에 있습니다. 이 말을 검색하는 사람 대부분이 실제로 그곳에 있기 때문입니다.
해내지 못한 것을 세어서 알려 줍니다. 어떤 쪽이 글자 없이 돌아오면, 빈 종이든 사진이든 손글씨든, 그 쪽은 손대지 않은 채 파일에 남고 그 사실이 보고됩니다. 조용히 버려지는 것은 없습니다.
로그인을 요구하는 일은 결코 없습니다. 400쪽짜리 문서를 처리하고 이어서 하나 더 처리할 수 있습니다. 하루 한도가 없는데, 작업을 대신하는 서버가 없으니 배분할 것도 없기 때문입니다.
사람들이 PDF OCR을 쓰는 경우:
- 스캔한 계약서를 보관하기 전에 검색 가능하게 만들기
- 한 쪽씩 찍어 둔 책의 장에서 원하는 한 줄 찾기
- 스캔한 청구서 폴더를 훑어볼 수 있는 것으로 바꾸기
- PDF로 도착한 팩스나 복사본에서 글자 꺼내기
- 오래된 스캔 기록을 기억이 아니라 검색으로 찾을 수 있게 하기
- 검색 색인이나 다른 도구가 읽을 수 있도록 스캔본 준비하기
- 스캔본에서 문단을 다시 타이핑하지 않고 복사하기
어떤 기기에서나 됩니다
설치할 것이 없습니다. OCR은 이미 쓰고 있는 브라우저에서 돌아가므로 같은 도구가 어디서나 작동하고, 파일은 시작한 기기에 그대로 남습니다.
Windows
Chrome, Edge, Firefox에서 됩니다. 내려받을 것도 없고, 스캔본을 검색 가능하게 만들려고 Acrobat 구독을 할 필요도 없습니다.
Mac
Safari나 Chrome. 미리보기는 스캔 PDF를 보여 줄 수는 있지만 거기에 텍스트 레이어를 더하지는 못합니다.
iPhone과 iPad
Safari에서 됩니다. 방금 찍은 사진이 스캔본일 때 편리한데, 바로 그때가 쪽을 똑바로 놓는 것이 가장 중요한 경우이기도 합니다.
Android
Chrome에서 됩니다. 긴 문서는 시간이 걸리고 휴대전화를 계속 쓰게 되니 먼저 충전기에 꽂아 두세요.
Chromebook
잘 맞습니다. 설치형 프로그램이 아니라 모든 것이 브라우저 안에서 로컬로 돌아가기 때문입니다.
Linux
요즘 브라우저면 됩니다. 패키지도, 명령줄도, 대기열도 없습니다.
OCR이 맞히는 것과 틀리는 것
모든 OCR 도구는 틀리지만, 그 오류가 어떤 모습인지 알려 주는 곳은 거의 없습니다. 실제 결과를 보여 드립니다. 컴퓨터로 만든 깨끗한 청구서, 잡티도 기울기도 없이 전체 글자 단위 정확도 95.6%. 거기서 뽑은 열두 단어 가운데 검색으로 찾을 수 있었던 것은 다섯 개였습니다.
| 문서에는 | OCR이 읽은 것 | 이유 |
|---|---|---|
| Northwind | Northwind | 가변폭 글꼴의 평범한 본문은 가장 쉬운 경우입니다. |
| 2089.80 | 2089. 80 | 숫자 한가운데에 공백이 생겨 합계를 검색해도 걸리지 않습니다. |
| INV-2026-04471 | INV2026-04471 | 붙임표 하나가 빠졌습니다. 참조 번호는 유난히 잘 깨집니다. |
| Replacement | Repl acenent | m을 n으로 읽었고, 없던 공백까지 들어갔습니다. |
| Payment is | Paymentis | 반대 방향의 실패로, 진짜 공백이 지워졌습니다. |
| 1741.50 | 1741.50 | 같은 표, 같은 글꼴, 위 합계와 같은 형식인데 이것은 제대로 읽혔습니다. 오류는 예측되지 않습니다. |
스캔본을 정말로 망치는 것
압축도 해상도도 아닙니다. 품질 60의 JPEG는 무손실 렌더링과 소수점 이하 차이였습니다. 해를 끼친 것은 기울기였습니다. 2도 기운 쪽은 문제가 없었지만 7도에서는 정확도가 9.5포인트 떨어지고 신뢰도가 91에서 74로 내려갔습니다. 무언가를 스캔한다면 똑바로 놓으세요. DPI를 올리는 수고는 하지 않아도 됩니다.
검색 가능한 PDF, 일반 텍스트, 아니면 Word 파일?
검색 가능한 PDF는 이 페이지가 만드는 것입니다. 원래 스캔본에 보이지 않는 텍스트 레이어가 더해지고, 여전히 PDF입니다. 일반 텍스트는 편집 배치를 버린 단어들로, 다른 곳에 붙여 넣을 때 유용하며 여기서 두 번째 내려받기로 제공합니다. 편집 가능한 Word 문서는 단, 표, 제목 같은 배치를 다시 짜는 별개의 작업이고 이 도구는 하지 않습니다. PDF에 이미 글자가 있고 단어만 필요하다면 OCR을 건너뛰고 바로 추출하세요.
스캔본은 이 브라우저를 떠나지 않습니다
여기에 놓은 PDF는 이 페이지가 열고, 이용자 본인의 프로세서가 읽고, 이용자 본인의 브라우저가 다시 씁니다. 업로드되지 않고, 어떤 서버의 대기열에도 들어가지 않으며, 보관 기간 동안 어딘가에 남지도 않습니다. 애초에 이 작업에 서버가 끼어들지 않기 때문입니다.
이 점은 대부분의 변환보다 OCR에서 더 무겁습니다. 검색 가능하게 만들어야 하는 문서는 계약서, 진료 기록, 거래 내역서, 신분증처럼 원본을 남겨 둘 가치가 있었기에 존재하는 스캔본입니다. 주요 온라인 OCR 서비스는 모두 자사 장비에서 이를 처리하고 보통 한 시간에서 여덟 시간 뒤 예정대로 삭제합니다.
배분할 것이 없다는 뜻이기도 합니다. 자기 하드웨어로 작업하는 서비스는 무료 사용을 제한할 수밖에 없고, 그래서 하루 두 건이나 파일당 열 쪽에서 막습니다. 여기서는 작업이 이용자 기기에서 일어나므로 강제할 한도도, 수집할 가입 정보도 없습니다.
아무것도 업로드되지 않습니다
파일은 로컬에서 읽힙니다. 어떤 서버에도 사본이 만들어지지 않습니다.
계정은 끝까지 필요 없습니다
결과를 내려받는 데 로그인을 요구하지 않습니다. 다른 곳에서는 그것이 무료 OCR의 흔한 대가입니다.
쪽수·파일 수 제한 없음
400쪽짜리 스캔본을 처리하고 또 하나 처리하세요. 하루 할당량이 없습니다.
언어 데이터만
내려받는 것은 고른 언어의 인식 데이터뿐입니다. 이용자의 문서가 그 요청에 실리는 일은 없습니다.