PDF zu Text
Hol den Text aus einem PDF heraus und kopiere ihn oder speichere ihn als .txt-Datei. Läuft komplett in deinem Browser — die Datei wird nicht hochgeladen.
PDF ablegen, um den Text zu extrahieren
oder klicken, um eine Datei zu wählen
- 100 % im Browser
- Kein Upload, keine Anmeldung
- Keine Seiten- oder Größenbegrenzung
- Dateien verlassen dein Gerät nie
Wenn dein PDF ein Scan ist, steckt darin kein Text zum Extrahieren. Wir prüfen jede Seite und sagen es dir, bevor du irgendetwas herunterlädst.
Warum Leute den Text aus einem PDF holen
Ein PDF ist die Beschreibung einer gedruckten Seite. Es weiß, wo jedes Zeichen sitzt, wie groß es ist und welche Schrift es zeichnet — aber es weiß nicht, dass diese Zeichen einen Satz, eine Überschrift oder einen Absatz ergeben. Zum Lesen der Seite reicht das. In dem Moment, in dem du mit dem Gesagten etwas anderes anfangen willst, wird es zum Problem.
Also greifen Leute zu reinem Text. Jemand hat einen langen Bericht und will ihn richtig durchsuchen oder zwischen den Abschnitten springen, statt durch neunzig Seiten zu scrollen. Jemand zitiert einen Absatz in einer E-Mail und will nicht, dass Schriftart, Zeilenumbrüche und unsichtbare Formatierung mitkommen. Jemand fügt ein Dokument in einen KI-Assistenten ein, der Wörter braucht und kein Seitenmobiliar. Jemand archiviert einen Vertrag in einem Format, das sich in zwanzig Jahren noch ohne bestimmte Software öffnen lässt.
Dazu kommt die Barrierefreiheit, und die ist häufiger relevant, als es aussieht. Mehrspaltige Layouts sind auf dem Handy schwer zu lesen, und ein Screenreader, der der falschen Reihenfolge folgt, liest eine zweispaltige Seite als Unsinn vor. Ein Dokument auf seine Wörter in der richtigen Reihenfolge zu reduzieren, macht es auf Wegen nutzbar, die das ursprüngliche Layout verhindert.
Zwei Arten von PDF, und nur eine enthält Text
Text aus einem PDF zu extrahieren heißt, die Zeichen zu lesen, die in der Datei gespeichert sind. Das funktioniert, wenn das PDF eine Textebene hat — die eigentlichen Buchstaben, aufbewahrt neben den Anweisungen, die sie zeichnen. Ein gescanntes PDF hat keine Textebene: Es ist ein Bild einer Seite, und darin steht kein einziges Zeichen.
Die meisten PDFs, die von Software erzeugt werden — aus einer Textverarbeitung exportiert, aus dem Browser als PDF gedruckt, von einem Rechnungssystem generiert — tragen eine Textebene. Du erkennst es, indem du die Datei öffnest und versuchst, einen Satz mit dem Cursor zu markieren. Folgt die Hervorhebung den Wörtern, sind die Zeichen wirklich da, und jedes Werkzeug kann sie lesen.
Ein PDF aus einem Scanner oder einer Handykamera ist anders. Jede Seite ist ein Bild. Du siehst die Wörter, weil deine Augen das Erkennen übernehmen, aber für die Datei enthält die Seite eine Fotografie und sonst nichts. Markieren bringt nichts, Suchen findet nichts, und Extrahieren liefert nichts — nicht weil das Werkzeug versagt hat, sondern weil es dort nichts zu liefern gibt.
Aus einem Bild von Wörtern wieder Wörter zu machen, ist eine eigene Aufgabe namens OCR, und sie ist ein Erkennungs- und kein Leseproblem: Software rät bei jeder Form und liegt manchmal daneben. Wir machen das hier nicht. Wir prüfen stattdessen jede Seite und sagen, in welche Kategorie sie fällt, bevor du irgendetwas herunterlädst. Ein Werkzeug, das dir eine leere Datei gibt oder stillschweigend auf OCR umschaltet, nimmt dir die Möglichkeit zu erkennen, welche Art Dokument du hattest.
Diese Prüfung ist keine Schätzung. Eine Seite mit Textebene meldet ihre Zeichen, eine ohne meldet gar nichts. Dazwischen gibt es nichts, was man falsch machen könnte. Deshalb steht das Ergebnis über dem Text und nicht in irgendeinem Hinweis weiter unten.
So extrahierst du Text aus einem PDF
Nichts wird installiert und nichts hochgeladen. Datei hineinziehen, ansehen, was wir gefunden haben, und den Text so mitnehmen, wie du ihn brauchst.
PDF hineinziehen
Wähle eine Datei oder zieh sie auf das Feld. Gelesen wird sie von deinem eigenen Browser — sie geht nirgendwohin, und es gibt keine Seiten- oder Größenbegrenzung außer der, die dein Gerät setzt.
Zuerst die Zusammenfassung lesen
Bevor Text erscheint, erfährst du, wie viele Seiten eine Textebene haben, welche Seiten Scans sind, ob das Dokument ausgefüllte Formularfelder enthält und ob ein zweispaltiges Layout erkannt und neu geordnet wurde.
Bei Bedarf die Lesart anpassen
Standardmäßig folgt der Text der Seite, wie du sie siehst, und lose Zeilen werden wieder zu Absätzen zusammengefügt. Beides lässt sich umschalten: Die Dokumentreihenfolge behält die im PDF gespeicherte Abfolge, und „jede Zeile so lassen“ behält die ursprünglichen Umbrüche.
Kopieren oder speichern
Kopieren legt den Text direkt in die Zwischenablage — meistens genau das, was man beim Einfügen in ein Dokument oder einen KI-Assistenten will. Der Download schreibt denselben Inhalt als UTF-8-.txt-Datei.
Verwandt: Wenn du nur den Text einiger Seiten brauchst, geht es schneller, wenn du diese Seiten zuerst extrahierst.
Was dieser PDF-zu-Text-Konverter anders macht
Der naive Weg ist, die Liste der Textstücke, die pdf.js herausgibt, einfach aneinanderzuhängen. Das ist eine Zeile Code und ergibt etwas, das fast richtig aussieht — deshalb machen es so viele Werkzeuge so. Bei einem zweiseitigen Steuerformular klebt dieser Ansatz Wörter über 76 Zeilenumbrüche hinweg zusammen. Bei acht Seiten einer Forschungsarbeit sind es 293. Du bekommst „permission toreproduce“ und „neural networksin particular“, verstreut über das Dokument, wo sie dir nicht zwangsläufig auffallen, bevor du den Text benutzt.
Das tiefer liegende Problem ist die Reihenfolge. Ein PDF speichert Text in der Reihenfolge, in der er auf die Seite gemalt wird, und die ist nicht die, in der du liest. Auf einem Formular kann ein Datumsfeld als „MM DD YYYY/ /“ herauskommen, weil die Trennzeichen zuletzt gezeichnet werden. Auf einer zweispaltigen Seite verschränken sich die Spalten, Zeile für Zeile — genau das passiert, wenn du in einem PDF-Reader eine ganze Seite markierst und einfügst. Wir bauen die Lesereihenfolge daraus auf, wo die Zeichen tatsächlich sitzen. Das gibt „MM / DD / YYYY“ zurück und hält jede Spalte zusammen.
Dann gibt es Dinge, die man leicht komplett übersieht. Wenn du ein PDF-Formular ausgefüllt hast, steht keine deiner Antworten im Seitentext — sie leben in den Formularfeldern, und ein Extraktor, der nur die Seite liest, gibt dir eine leere Vorlage und sieht dabei aus, als hätte er funktioniert. Wir sammeln sie ein und hängen sie ans Ende. Und manche PDF-Erzeuger geben Zeichen aus, die richtig aussehen, aber keine sind: Ein chinesisches Dokument kann voller Kangxi-Radikale sein, auf dem Bildschirm nicht zu unterscheiden, für eine Suche unsichtbar, beim Einfügen falsch. Jede Zeichenfolge, die wir herausgeben, wird normalisiert, sodass sie auf die Zeichen zurückfallen, als die sie gezeichnet sind.
Wofür Leute es benutzen:
- Einen langen Bericht richtig durchsuchen oder zwischen Abschnitten springen
- Ein Dokument ohne Seitenmobiliar in einen KI-Assistenten einfügen
- Aus einer Arbeit zitieren, ohne die Formatierung mitzuschleppen
- Die Antworten aus einem ausgefüllt zurückgeschickten Formular wieder herausholen
- Ein Dokument als reinen Text archivieren, der sich überall öffnen lässt
- Ein mehrspaltiges Layout auf dem Handy in einer lesbaren Spalte lesen
Funktioniert da, wo du ohnehin bist
Die Arbeit passiert in deinem Browser, also gibt es nichts zu installieren und kein Konto anzulegen. Jeder aktuelle Browser auf jedem Betriebssystem genügt.
Windows
Chrome, Edge oder Firefox. Kein Reader, kein Acrobat-Abo, nichts herunterzuladen.
macOS
Safari, Chrome oder Firefox. Schneller, als die Datei in der Vorschau zu öffnen und Seite für Seite zu markieren.
Linux
Jeder moderne Browser. Dasselbe Ergebnis wie mit pdftotext auf der Kommandozeile, ohne die Seite zu verlassen.
iPhone und iPad
Safari oder Chrome. Praktisch, wenn ein PDF per Mail kommt und du den Text in einer Nachricht brauchst.
Android
Chrome, Firefox oder Samsung Internet. Gut geeignet, um ein zweispaltiges Dokument in einer Spalte zu lesen.
Chromebook
Läuft nach dem Laden der Seite vollständig offline, was zu einem verwalteten Schulgerät passt.
Warum kopierter Text aus einem PDF meistens falsch herauskommt
Wenn du je eine Seite in einem PDF-Reader markiert, eingefügt und die Sätze durcheinander vorgefunden hast: Das ist der Grund — und aus demselben Grund produzieren die meisten Konvertierungswerkzeuge dasselbe Durcheinander.
Was das PDF speichert
Die Reihenfolge, in der die Seite gemalt wird. Text landet in der Abfolge, die dem Erzeuger der Datei gerade passte: eine Überschrift, dann eine Fußzeile, dann der Fließtext, dann die Trennzeichen zwischen den Feldern. Kopieren folgt dieser Abfolge, also bekommst du auf einer zweispaltigen Seite eine Zeile der linken Spalte, eine der rechten, und so weiter bis unten.
Was wir rekonstruieren
Die Reihenfolge, in der du lesen würdest. Zeichen werden nach ihrer Position zu Zeilen gruppiert, Zeilen zu Spalten, und die Spalten werden nacheinander gelesen. Die Umbrüche kommen zurück, die Spalten bleiben ganz, und Trennzeichen kehren in die Mitte der Felder zurück, zu denen sie gehören.
Wo es weiterhin Grenzen gibt
Ein Bild einer Seite lässt sich gar nicht lesen, und eine Tabelle hört auf, eine Tabelle zu sein, sobald sie reiner Text ist — die Zeilen überleben, das Raster nicht. Eine Zeile, die beide Spalten überspannt, ohne dass ein Teil den Mittelsteg kreuzt, etwa eine Reihe von Autorennamen, ist von je einer Zeile pro Spalte nicht zu unterscheiden; ein Titelblock kann deshalb in einer merkwürdigen Reihenfolge herauskommen. Adobes eigene Community sagt dasselbe über Acrobat: Bei Seitenleisten und eingeschobenem Text sei es „nahezu unmöglich“ zu wissen, welcher Zeile zu folgen ist. Wenn unsere Lesart falsch aussieht, wechsle zur Dokumentreihenfolge und vergleiche.
Text oder Word?
Reiner Text ist die richtige Antwort, wenn du die Wörter willst und sonst nichts — suchen, zitieren, in einen Assistenten einfügen, archivieren. Er ist die falsche Antwort, wenn du das Dokument als Dokument zurückbrauchst, mit Überschriften, Tabellen und Bildern; das ist die Aufgabe einer PDF-zu-Word-Umwandlung, und keine .txt-Datei leistet das. Es lohnt sich zu wissen, weswegen du hergekommen bist, bevor du das Ergebnis beurteilst.
Dein Dokument bleibt auf deinem Gerät
Die Dateien, die Leute zu so einem Werkzeug bringen, sind selten belanglos. Es sind Verträge, Rechnungen, Lebensläufe, Arztbriefe, ausgefüllte Anträge — Dokumente, bei denen der gesamte Inhalt das Heikle ist. Darüber nachzudenken lohnt sich, bevor man so etwas irgendwo hochlädt.
Dieses Werkzeug lädt nichts hoch. Dein Browser öffnet das PDF, liest es und setzt den Text auf deinem eigenen Rechner zusammen. Es gibt keine Anfrage, die deine Datei trägt, keine Warteschlange auf einem Server, nichts, was irgendwo zwischengespeichert wird, und keine Kopie, die jemand später löschen müsste. Tab zu, und es ist weg.
Damit entfallen auch die üblichen Grenzen. Keine Seitenobergrenze, keine Dateigrößenobergrenze, kein Tageskontingent — weil dahinter keine Serverrechnung steht, sondern nur das, was dein eigenes Gerät bequem schafft.
Kein Upload
Das PDF wird dort gelesen, wo es schon liegt. Es reist nie.
Kein Konto
Keine Anmeldung, keine E-Mail, kein Wasserzeichen im Ergebnis.
Nichts aufbewahrt
Auf unserer Seite gibt es keine Kopie zum Speichern, Protokollieren oder Löschen.
Fragen zum Extrahieren von Text aus PDFs
Warum ist mein extrahierter Text leer?⌄
Was ist eine Textebene?⌄
Führt ihr OCR bei gescannten PDFs durch?⌄
Warum kommt kopierter Text aus einem PDF durcheinander?⌄
Warum stimmt die Reihenfolge in meinem zweispaltigen Dokument trotzdem nicht?⌄
Ich habe ein PDF-Formular ausgefüllt — warum fehlt mein Text?⌄
Bleibt das Layout von Tabellen erhalten?⌄
Soll ich in Text oder in Word umwandeln?⌄
Werden meine Dateien hochgeladen?⌄
Gibt es eine Dateigrößenbeschränkung?⌄
Funktioniert es mit chinesischen, japanischen, koreanischen oder arabischen PDFs?⌄
Welche Kodierung hat die .txt-Datei?⌄
Hol den Text aus deinem PDF
Kostenlos, unbegrenzt und vollständig im Browser verarbeitet — mit einer ehrlichen Auskunft darüber, was wirklich in deiner Datei steckt.
Text aus einem PDF extrahierenVerwandte Artikel
Vertiefe dein Wissen über die PDF-zu-PNG-Konvertierung mit unseren neuesten Guides und Reviews
PDF online in PNG umwandeln (kostenlose & schnelle Methoden)
Kompletter Leitfaden, um PDF kostenlos online in PNG umzuwandeln. Vergleich der 5 besten Konverter, Schritt-für-Schritt-Abläufe, fortgeschrittene Tipps und Fehlerbehebung.
Artikel lesenPDF unter Windows, Mac und mobil in PNG umwandeln
Plattformspezifischer Leitfaden, um PDFs auf jedem Gerät in PNG umzuwandeln. Native Tools, Software-Empfehlungen und mobile Apps werden behandelt.
Artikel lesenPDF zu PNG vs. PDF zu JPG: Welches Format solltest du wählen?
Detaillierter Vergleich der Formate PNG und JPG für die PDF-Umwandlung. Dateigrößen, Qualitätsunterschiede, Anwendungsfälle und Entscheidungshilfe.
Artikel lesenVerwandte Konvertierungs-Tools
Entdecke weitere Tools in unserer umfassenden Sammlung zur Dateikonvertierung
PDF-Seiten extrahieren
Hol die gewünschten Seiten in ein neues PDF – oder eine Datei je Seite. Dein Original bleibt unberührt. Kein Upload.
PDF reduzieren
Ausgefüllte Formularfelder und Kommentare fest in die Seite einbetten. Text bleibt Text, und was sich nicht zusammenführen lässt, wird gemeldet statt gelöscht.
PDF entsperren
Entferne ein Passwort, das du kennst, oder hebe Druck- und Kopiersperren auf, die gar keins brauchen. Nichts wird hochgeladen.