PDF OCR

Mach aus einem gescannten PDF eins, in dem du suchen kannst. Läuft in diesem Browser-Tab — ohne Konto, ohne Upload, ohne Seitenlimit.

Warum ein gescanntes PDF OCR braucht

Ein gescanntes PDF ist ein Stapel Fotos. Deine Augen lesen es problemlos, für den Rechner stehen auf diesen Seiten aber nur farbige Punkte. Strg+F findet nichts. Eine Zeile herauskopieren geht nicht. Kein Index erfasst die Datei, also taucht sie später bei keiner Suche wieder auf.

OCR — optische Zeichenerkennung — ist der Schritt, der das ändert. Sie sieht sich die Formen auf jeder Seite an, entscheidet, welche Buchstaben das sind, und schreibt diese Buchstaben als unsichtbare Ebene unter das Bild in die Datei. Nach der Texterkennung sieht ein PDF exakt gleich aus; der Unterschied ist, dass jetzt Text darunter liegt.

Der Moment, auf den es ankommt, liegt meist Monate später. Ein Vertrag, den du eingescannt hast, eine Rechnung, ein Beleg, eine Buchseite — du erinnerst dich an einen Satz und sonst an nichts. Ein durchsuchbares PDF gibt dir diesen Satz zurück. Ein Stapel Fotos nicht.

Dieses PDF-OCR-Werkzeug läuft vollständig in deinem Browser. Die Datei wird nicht hochgeladen, es gibt kein Konto und keine Obergrenze für die Seitenzahl. Die Seite, die bei diesem Suchbegriff über uns steht, verarbeitet deine Datei gratis und verlangt dann eine Anmeldung, bevor sie sie wieder herausrückt.

Upload-ToolsIhr Server?Dieses ToolIhr GerätNichts verlässt Ihr Gerät, keine Kopie zu löschen.
Andere Konverter laden Ihre Datei auf einen Server. Dieser zeichnet sie dort, wo sie schon ist.

Was ist OCR bei einem PDF?

OCR bei einem PDF ist Zeichenerkennung auf den Seitenbildern darin, wobei die erkannten Wörter als unsichtbare Textebene zurück in dieselbe Datei geschrieben werden — das Dokument sieht unverändert aus, wird aber durchsuchbar, markierbar und kopierbar.

Zwei Arten von PDF sehen auf dem Bildschirm gleich aus. Das eine kam aus einer Textverarbeitung und trägt echten Text; das andere stammt aus einem Scanner oder einer Handykamera und trägt Bilder von Text. Nur das zweite braucht OCR.

Es gibt einen schnellen Weg, sie ohne Werkzeug zu unterscheiden: Versuch, eine Zeile mit der Maus zu markieren. Läuft eine blaue Markierung den Wörtern entlang, ist der Text schon da. Wird die ganze Seite als ein Block markiert oder passiert gar nichts, hast du ein gescanntes PDF.

Dieses Werkzeug macht diese Prüfung für dich, bevor irgendetwas läuft. Hat die Datei bereits eine Textebene, sagt es das und schlägt vor, den Text stattdessen zu extrahieren — denn OCR würde etwas Exaktes durch etwas Ungefähres ersetzen, und du hättest hinterher keine Möglichkeit, das zu bemerken, weil die Seite so oder so gleich aussieht.

Der Text, den OCR erzeugt, liegt unter dem Seitenbild, nicht darüber. Deshalb sieht ein durchsuchbares PDF immer noch aus wie ein Scan: Du schaust stets auf das ursprüngliche Bild. Die unsichtbare Ebene ist nur für dein Suchfeld da, für deinen Kopierbefehl und für alles, was die Datei indexiert.

Es lohnt sich, klar zu sagen, was diese Ebene ist. Sie ist eine Vermutung — eine sehr gute bei sauberem Druck, eine schlechte bei einem zerknitterten Beleg, schräg abfotografiert. Das Bild, das du siehst, stimmt immer. Der Text darunter vielleicht nicht.

Nur BildInvoiceNo. 4471Total1,240.00+ Textebene
OCR ändert nichts daran, wie die Seite aussieht. Es legt eine Textebene unter das Bild — und genau die macht das PDF durchsuchbar.

PDF mit OCR durchsuchbar machen — in vier Schritten

Alles passiert in diesem Browser-Tab. Die Datei verlässt dein Gerät nicht, und niemand verlangt ein Konto von dir, bevor du das Ergebnis herunterladen darfst.

Lorem ipsumdolor sit ametconsecteturHat TextKein OCRLorem ipsumTeils TextÜberspringenNur BildOCR läuft
Nicht jedes PDF braucht OCR. Dieses Werkzeug prüft das vorher, denn exakten Text noch einmal zu raten macht ihn nur schlechter.
1

Gescanntes PDF hineinziehen

Zieh die Datei auf das Feld oben oder klick darauf, um sie auszuwählen. Dateien bis 100 MB sind in Ordnung. Nichts wird irgendwohin geschickt — die Datei wird von dieser Seite geöffnet, in deinem Browser.

2

Den Befund lesen

Das Werkzeug prüft jede Seite auf eine vorhandene Textebene, bevor es irgendetwas tut. Es sagt dir, ob dein PDF überhaupt OCR braucht, es nur auf manchen Seiten braucht oder gar nicht. Sind nur einzelne Seiten Scans, bleiben die übrigen standardmäßig unangetastet.

3

Sprache des Dokuments wählen

Die Genauigkeit hängt davon stärker ab als von allem anderen, was du einstellen kannst. Wähl die Sprache, in der das Dokument geschrieben ist, nicht die Sprache dieser Oberfläche. Die Sprachdaten werden einmal geladen — rund 5,2 MB für Englisch, 1,7 MB für Hindi — und dann zwischengespeichert. Mehrere Sprachen gleichzeitig gehen, machen aber jede Seite langsamer.

4

Laufen lassen und nachsehen

Die Seiten werden nacheinander verarbeitet, mit einer Vorschau der Seite, die gerade gelesen wird — du kannst also früh abbrechen, wenn du die falsche Datei erwischt hast. Am Ende versuch, in der Vorschau Text zu markieren. Dann lad das durchsuchbare PDF herunter — oder den reinen Text, falls du nur den wolltest.

Nur die Wörter gebraucht? Wenn du den Text willst und nicht das PDF, und deine Datei schon eine Textebene hat, gibt es einen schnelleren Weg, bei dem überhaupt nichts geraten wird: den Text direkt aus dem PDF extrahieren.

Was dieses PDF-OCR-Werkzeug macht

Es fügt eine Textebene hinzu und ändert sonst nichts. Deine Originalseiten bleiben genau so, wie sie sind — dieselben Bilder, dieselbe Auflösung, dieselben Seitenrahmen. Die erkannten Wörter werden mit null Deckkraft darübergezeichnet, sind also markierbar und durchsuchbar, aber nie sichtbar. Seiten, die schon Text hatten, werden überhaupt nicht angefasst.

Es rendert Seiten mit 150 DPI, und das ist eine gemessene Entscheidung, keine Voreinstellung. Bei einem Testdokument lag die Genauigkeit bei 100, 150, 200 und 300 DPI innerhalb eines halben Prozentpunkts gleichauf, während 300 DPI viermal so lange brauchte. Unter 100 DPI gibt es eine Klippe: Bei 72 DPI fiel die Genauigkeit von 95,6 % auf 79,3 %. Mit 600 DPI zu scannen macht OCR nicht genauer. Es macht es nur langsamer.

Es beherrscht über 100 Sprachen, darunter Schriften, die die meisten Konverter auslassen. Eines der bekannteren Online-OCR-Werkzeuge führt 19 Sprachen, und nicht eine davon ist eine südasiatische Schrift. Hindi, Tamil und Bengali stehen hier in der Liste, und zwar weit oben — denn dort sind die meisten Leute, die danach suchen, tatsächlich zu Hause.

Es zählt, was es nicht geschafft hat. Kommt eine Seite ohne Text zurück — ein leeres Blatt, ein Foto, Handschrift —, bleibt sie unangetastet in der Datei und wird gemeldet. Nichts verschwindet stillschweigend.

Es verlangt nie eine Anmeldung. Du kannst ein Dokument mit 400 Seiten laufen lassen und danach noch eins. Es gibt kein Tageslimit, weil kein Server die Arbeit macht und es folglich nichts zu rationieren gibt.

Wofür Leute PDF-OCR benutzen:

  • Gescannte Verträge durchsuchbar machen, bevor sie abgelegt werden
  • Eine Zeile in einem Buchkapitel finden, das Seite für Seite abfotografiert wurde
  • Einen Ordner gescannter Rechnungen in etwas verwandeln, das sich durchsuchen lässt
  • Text aus einem Fax oder einer Kopie holen, die als PDF ankam
  • Alte gescannte Unterlagen per Suche auffindbar machen statt per Erinnerung
  • Scans so vorbereiten, dass ein Suchindex oder ein anderes Programm sie lesen kann
  • Einen Absatz aus einem Scan kopieren, statt ihn abzutippen

Läuft auf jedem Gerät

Es gibt nichts zu installieren. Die Texterkennung läuft in dem Browser, den du ohnehin hast — dasselbe Werkzeug funktioniert also überall, und deine Datei bleibt auf dem Gerät, auf dem sie angefangen hat.

§ 01

Windows

Chrome, Edge oder Firefox. Nichts herunterzuladen, und kein Acrobat-Abo nötig, um einen Scan durchsuchbar zu machen.

§ 02

Mac

Safari oder Chrome. Die Vorschau zeigt dir ein gescanntes PDF, kann ihm aber keine Textebene hinzufügen.

§ 03

iPhone und iPad

Läuft in Safari. Praktisch, wenn der Scan ein Foto ist, das du gerade gemacht hast — wobei genau dann geradehalten am meisten bringt.

§ 04

Android

Läuft in Chrome. Lange Dokumente dauern und halten das Telefon beschäftigt, also häng es vorher an den Strom.

§ 05

Chromebook

Passt gut, weil alles lokal im Browser läuft statt in einem installierten Programm.

§ 06

Linux

Jeder moderne Browser. Keine Pakete, keine Kommandozeile, keine Warteschlange.

Was OCR richtig macht — und was nicht

Jedes OCR-Werkzeug macht Fehler, und fast keines sagt dir, wie diese Fehler aussehen. Hier ein echtes Ergebnis: eine saubere, am Rechner erzeugte Rechnung, kein Rauschen, nicht schief, 95,6 % Zeichengenauigkeit insgesamt. Von zwölf daraus geprüften Wörtern waren fünf per Suche auffindbar.

In der DateiOCR lasNorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis5 von 12 Wörtern auffindbar
Aus einer sauberen Testrechnung mit 95,6 % Zeichengenauigkeit. Der Firmenname kam durch, die Summe nicht — OCR hat ein Leerzeichen mitten in die Zahl gesetzt.
Im DokumentOCR lasWarum
NorthwindNorthwindNormaler Fließtext in einer Proportionalschrift ist der leichte Fall.
2089.802089. 80Mitten in der Zahl tauchte ein Leerzeichen auf — die Suche nach der Summe geht ins Leere.
INV-2026-04471INV2026-04471Ein Bindestrich fiel weg. Belegnummern sind ungewöhnlich empfindlich.
ReplacementRepl acenentEin m als n gelesen, dazu ein Leerzeichen, das dort nicht hingehört.
Payment isPaymentisDer umgekehrte Fehler: ein echtes Leerzeichen wurde entfernt.
1741.501741.50Dieselbe Tabelle, dieselbe Schrift wie bei der Summe darüber — und hier stimmte es. Die Fehler sind nicht vorhersehbar.

Was einen Scan wirklich ruiniert

Es ist nicht die Kompression und nicht die Auflösung. Ein JPEG mit Qualität 60 lag nur den Bruchteil eines Punkts hinter einer verlustfreien Ausgabe. Weh tat die Schräglage: Eine um zwei Grad gekippte Seite war unproblematisch, bei sieben Grad fiel die Genauigkeit um neuneinhalb Punkte und die Konfidenz von 91 auf 74. Wenn du etwas einscannst, leg es gerade hin. Die DPI hochzudrehen lohnt sich nicht.

Durchsuchbares PDF, reiner Text oder eine Word-Datei?

Ein durchsuchbares PDF ist das, was diese Seite erzeugt: der Scan, den du hattest, plus eine unsichtbare Textebene, weiterhin ein PDF. Reiner Text sind die Wörter ohne das Layout — praktisch, wenn du sie irgendwo einfügen willst, und hier als zweiter Download dabei. Ein bearbeitbares Word-Dokument ist eine andere Aufgabe, bei der das Layout neu gebaut wird, und die übernimmt dieses Werkzeug nicht. Hat dein PDF schon Text und willst du nur die Wörter, überspring OCR ganz und extrahier sie direkt.

Dein Scan verlässt diesen Browser nicht

Das PDF, das du hier ablegst, wird von dieser Seite geöffnet, von deinem eigenen Prozessor gelesen und von deinem eigenen Browser wieder herausgeschrieben. Es wird nicht hochgeladen, nicht auf einem Server eingereiht und nirgends für eine Aufbewahrungsfrist gehalten — weil an der Arbeit überhaupt kein Server beteiligt ist.

Bei OCR wiegt das schwerer als bei den meisten Umwandlungen. Was Leute durchsuchbar machen müssen, sind Verträge, Arztunterlagen, Kontoauszüge und Ausweispapiere — also genau die Scans, die es gibt, weil das Original es wert war, aufgehoben zu werden. Jeder große Online-OCR-Dienst verarbeitet sie auf eigenen Rechnern und löscht sie nach Plan, meist nach einer bis acht Stunden.

Es heißt außerdem, dass es nichts zu rationieren gibt. Dienste, die die Arbeit auf eigener Hardware erledigen, müssen die kostenlose Nutzung begrenzen — deshalb deckeln sie dich bei ein paar Aufgaben am Tag oder zehn Seiten pro Datei. Hier passiert die Arbeit auf deinem Gerät, also gibt es keine Grenze durchzusetzen und keine Anmeldung einzusammeln.

§ 01

Nichts wird hochgeladen

Die Datei wird lokal gelesen. Auf keinem Server entsteht eine Kopie davon.

§ 02

Nie ein Konto

Du wirst nicht zur Anmeldung aufgefordert, um das Ergebnis herunterzuladen — anderswo ist genau das der übliche Preis für kostenloses OCR.

§ 03

Kein Seiten- oder Dateilimit

Lass einen Scan mit 400 Seiten laufen und danach noch einen. Es gibt kein Tageskontingent.

§ 04

Nur Sprachdaten

Das Einzige, was geladen wird, sind die Erkennungsdaten für die Sprache, die du wählst. Dein Dokument ist an dieser Anfrage nie beteiligt.

Häufige Fragen

Ist dieses PDF-OCR-Werkzeug wirklich kostenlos, und gibt es ein Seitenlimit?
Es ist kostenlos, ohne Seitenlimit und ohne Tageskontingent. Die Texterkennung läuft auf deinem eigenen Gerät statt auf einem Server, es entstehen uns also keine Kosten pro Datei und es gibt nichts zu rationieren. Große Dokumente begrenzen nur deine Geduld und dein Akku.
Muss ich mich anmelden, um das Ergebnis herunterzuladen?
Nein. Du kannst eine Datei ablegen, OCR laufen lassen und das durchsuchbare PDF ohne Konto und ohne E-Mail-Adresse herunterladen. Das lohnt sich auf jeder OCR-Seite zu prüfen, bevor du etwas hochlädst: Es ist verbreitet, erst beim Download nach einem Konto gefragt zu werden, wenn die Arbeit längst getan ist.
Woran erkenne ich, ob mein PDF überhaupt OCR braucht?
Versuch, eine Textzeile mit der Maus zu markieren. Läuft eine Markierung den Wörtern entlang, hat die Datei bereits eine Textebene und OCR würde sie nur verschlechtern. Dieses Werkzeug prüft das automatisch, sobald du eine Datei hinzufügst, und sagt dir vor dem Start, welcher der drei Fälle vorliegt.
Wie genau ist die Texterkennung?
Genau genug, um nützlich zu sein, und nicht genau genug, um ihr blind zu vertrauen. Auf einer sauberen, am Rechner erzeugten Testrechnung lag die Zeichengenauigkeit bei 95,6 % — aber nur 5 von 12 geprüften Wörtern ließen sich tatsächlich über die Suche finden, weil ein Leerzeichen mitten in einer Zahl landete oder ein Bindestrich verschwand. Klarer Druck läuft gut. Alles Zerknitterte, Blasse oder Schiefe läuft schlechter.
Welche Sprachen werden unterstützt?
Über 100, darunter Hindi, Tamil, Bengali, Thai, Vietnamesisch und Indonesisch neben den üblichen europäischen Sprachen. Wähl die Sprache, in der das Dokument geschrieben ist, nicht die Sprache dieser Seite — sie wirkt sich stärker auf die Genauigkeit aus als jede andere Einstellung. Beachte: Schriften, die ihre Zeichen umformen, etwa Devanagari, können beim Schreiben in die PDF-Textebene gelegentlich ein Wort verlieren, obwohl es richtig erkannt wurde.
Erkennt es Handschrift?
Geh nicht davon aus. Diese Engine ist für gedruckte Zeichen gebaut, und Handschrift ist ein anderes Problem, für das sie nicht trainiert wurde. Eine handgeschriebene Seite kommt meist leer oder fast leer zurück. Passiert das, bleibt die Seite genau so in deiner Datei, wie sie war, und wird in der Zusammenfassung gemeldet statt stillschweigend verworfen.
Sieht das PDF danach anders aus?
Nein, und das ist der Punkt. Deine Seitenbilder bleiben exakt so, wie sie waren, und der erkannte Text wird mit null Deckkraft darübergezeichnet. Du schaust weiterhin auf den ursprünglichen Scan; die Textebene ist nur für dein Suchfeld und deinen Kopierbefehl da.
Liefert ein Scan mit höherer DPI bessere OCR-Ergebnisse?
Meistens nicht. Im Test lag die Genauigkeit bei 100, 150, 200 und 300 DPI innerhalb eines halben Prozentpunkts gleichauf, während 300 DPI viermal so lange brauchte. Es gibt eine Untergrenze — bei 72 DPI brach die Genauigkeit auf 79,3 % ein —, aber oberhalb von etwa 150 DPI zahlst du Zeit für nichts. Die Seite geradezulegen bringt weit mehr.
Wie lange dauert es?
Auf einem normalen Laptop rund eine Sekunde pro Seite bei einer üblichen A4-Seite, ein Dokument mit 50 Seiten landet also bei etwa einer Minute. Telefone sind langsamer. Mehrere Sprachen gleichzeitig vervielfachen die Arbeit, wähl also nur die, die wirklich im Dokument vorkommen.
Wird meine Datei irgendwohin hochgeladen?
Nein. Das PDF wird in diesem Browser-Tab geöffnet und verarbeitet und nie an einen Server geschickt. Die einzige Netzanfrage des Werkzeugs gilt den Erkennungsdaten der Sprache, die du gewählt hast — dieselbe Datei für alle, und nichts von dir steckt darin.
Was ist der Unterschied zu „PDF in Text umwandeln“?
Diese Seite macht aus einem Scan ein durchsuchbares PDF, indem sie die Zeichen in den Bildern errät. „PDF in Text umwandeln“ holt Text heraus, der ohnehin schon in der Datei steht, exakt und ohne Raten. Hat dein PDF eine Textebene, ist das das Werkzeug, das du willst — es ist schneller und kann die Art von Fehlern, die OCR macht, gar nicht erst machen.
Bekomme ich stattdessen ein bearbeitbares Word-Dokument?
Nicht aus diesem Werkzeug. Einen Scan in eine Word-Datei zu verwandeln heißt, das Layout neu zu bauen — Spalten, Tabellen, Überschriften —, und das ist eine andere Aufgabe mit eigenen Fehlerquellen. Was du hier bekommst, ist das ursprüngliche PDF, durchsuchbar gemacht, plus einen Download als reinen Text, wenn du die Wörter für sich willst.

Mach dein gescanntes PDF durchsuchbar

Kostenlos, unbegrenzt, und es läuft in diesem Tab. Kein Upload, keine Anmeldung — und es sagt dir, wenn deine Datei gar kein OCR braucht.

PDF mit OCR bearbeiten