PDF zu Text

Hol den Text aus einem PDF heraus und kopiere ihn oder speichere ihn als .txt-Datei. Läuft komplett in deinem Browser — die Datei wird nicht hochgeladen.

  • 100 % im Browser
  • Kein Upload, keine Anmeldung
  • Keine Seiten- oder Größenbegrenzung
  • Dateien verlassen dein Gerät nie

Wenn dein PDF ein Scan ist, steckt darin kein Text zum Extrahieren. Wir prüfen jede Seite und sagen es dir, bevor du irgendetwas herunterlädst.

Warum Leute den Text aus einem PDF holen

Ein PDF ist die Beschreibung einer gedruckten Seite. Es weiß, wo jedes Zeichen sitzt, wie groß es ist und welche Schrift es zeichnet — aber es weiß nicht, dass diese Zeichen einen Satz, eine Überschrift oder einen Absatz ergeben. Zum Lesen der Seite reicht das. In dem Moment, in dem du mit dem Gesagten etwas anderes anfangen willst, wird es zum Problem.

Also greifen Leute zu reinem Text. Jemand hat einen langen Bericht und will ihn richtig durchsuchen oder zwischen den Abschnitten springen, statt durch neunzig Seiten zu scrollen. Jemand zitiert einen Absatz in einer E-Mail und will nicht, dass Schriftart, Zeilenumbrüche und unsichtbare Formatierung mitkommen. Jemand fügt ein Dokument in einen KI-Assistenten ein, der Wörter braucht und kein Seitenmobiliar. Jemand archiviert einen Vertrag in einem Format, das sich in zwanzig Jahren noch ohne bestimmte Software öffnen lässt.

Dazu kommt die Barrierefreiheit, und die ist häufiger relevant, als es aussieht. Mehrspaltige Layouts sind auf dem Handy schwer zu lesen, und ein Screenreader, der der falschen Reihenfolge folgt, liest eine zweispaltige Seite als Unsinn vor. Ein Dokument auf seine Wörter in der richtigen Reihenfolge zu reduzieren, macht es auf Wegen nutzbar, die das ursprüngliche Layout verhindert.

Upload-ToolsDeren Server?Dieses ToolDein GerätNichts verlässt dein Gerät, keine Kopie zu löschen.
Andere Konverter laden dein Dokument hoch. Dieser liest es dort, wo es liegt.

Zwei Arten von PDF, und nur eine enthält Text

Text aus einem PDF zu extrahieren heißt, die Zeichen zu lesen, die in der Datei gespeichert sind. Das funktioniert, wenn das PDF eine Textebene hat — die eigentlichen Buchstaben, aufbewahrt neben den Anweisungen, die sie zeichnen. Ein gescanntes PDF hat keine Textebene: Es ist ein Bild einer Seite, und darin steht kein einziges Zeichen.

Die meisten PDFs, die von Software erzeugt werden — aus einer Textverarbeitung exportiert, aus dem Browser als PDF gedruckt, von einem Rechnungssystem generiert — tragen eine Textebene. Du erkennst es, indem du die Datei öffnest und versuchst, einen Satz mit dem Cursor zu markieren. Folgt die Hervorhebung den Wörtern, sind die Zeichen wirklich da, und jedes Werkzeug kann sie lesen.

Ein PDF aus einem Scanner oder einer Handykamera ist anders. Jede Seite ist ein Bild. Du siehst die Wörter, weil deine Augen das Erkennen übernehmen, aber für die Datei enthält die Seite eine Fotografie und sonst nichts. Markieren bringt nichts, Suchen findet nichts, und Extrahieren liefert nichts — nicht weil das Werkzeug versagt hat, sondern weil es dort nichts zu liefern gibt.

Aus einem Bild von Wörtern wieder Wörter zu machen, ist eine eigene Aufgabe namens OCR, und sie ist ein Erkennungs- und kein Leseproblem: Software rät bei jeder Form und liegt manchmal daneben. Wir machen das hier nicht. Wir prüfen stattdessen jede Seite und sagen, in welche Kategorie sie fällt, bevor du irgendetwas herunterlädst. Ein Werkzeug, das dir eine leere Datei gibt oder stillschweigend auf OCR umschaltet, nimmt dir die Möglichkeit zu erkennen, welche Art Dokument du hattest.

Diese Prüfung ist keine Schätzung. Eine Seite mit Textebene meldet ihre Zeichen, eine ohne meldet gar nichts. Dazwischen gibt es nichts, was man falsch machen könnte. Deshalb steht das Ergebnis über dem Text und nicht in irgendeinem Hinweis weiter unten.

Invoice 2026Total 1,240.00Due 30 daysEchter TextNur Pixel
Zwei PDFs, die auf dem Bildschirm gleich aussehen: eines enthält Zeichen, das andere nur ein Bild davon — und Hineinzoomen macht aus einem Bild nie wieder Wörter.

So extrahierst du Text aus einem PDF

Nichts wird installiert und nichts hochgeladen. Datei hineinziehen, ansehen, was wir gefunden haben, und den Text so mitnehmen, wie du ihn brauchst.

PDF ablegenSeiten prüfenKopieren
Datei ablegen, unser Ergebnis lesen, Text kopieren oder speichern.
1

PDF hineinziehen

Wähle eine Datei oder zieh sie auf das Feld. Gelesen wird sie von deinem eigenen Browser — sie geht nirgendwohin, und es gibt keine Seiten- oder Größenbegrenzung außer der, die dein Gerät setzt.

2

Zuerst die Zusammenfassung lesen

Bevor Text erscheint, erfährst du, wie viele Seiten eine Textebene haben, welche Seiten Scans sind, ob das Dokument ausgefüllte Formularfelder enthält und ob ein zweispaltiges Layout erkannt und neu geordnet wurde.

3

Bei Bedarf die Lesart anpassen

Standardmäßig folgt der Text der Seite, wie du sie siehst, und lose Zeilen werden wieder zu Absätzen zusammengefügt. Beides lässt sich umschalten: Die Dokumentreihenfolge behält die im PDF gespeicherte Abfolge, und „jede Zeile so lassen“ behält die ursprünglichen Umbrüche.

4

Kopieren oder speichern

Kopieren legt den Text direkt in die Zwischenablage — meistens genau das, was man beim Einfügen in ein Dokument oder einen KI-Assistenten will. Der Download schreibt denselben Inhalt als UTF-8-.txt-Datei.

Verwandt: Wenn du nur den Text einiger Seiten brauchst, geht es schneller, wenn du diese Seiten zuerst extrahierst.

Was dieser PDF-zu-Text-Konverter anders macht

Der naive Weg ist, die Liste der Textstücke, die pdf.js herausgibt, einfach aneinanderzuhängen. Das ist eine Zeile Code und ergibt etwas, das fast richtig aussieht — deshalb machen es so viele Werkzeuge so. Bei einem zweiseitigen Steuerformular klebt dieser Ansatz Wörter über 76 Zeilenumbrüche hinweg zusammen. Bei acht Seiten einer Forschungsarbeit sind es 293. Du bekommst „permission toreproduce“ und „neural networksin particular“, verstreut über das Dokument, wo sie dir nicht zwangsläufig auffallen, bevor du den Text benutzt.

Das tiefer liegende Problem ist die Reihenfolge. Ein PDF speichert Text in der Reihenfolge, in der er auf die Seite gemalt wird, und die ist nicht die, in der du liest. Auf einem Formular kann ein Datumsfeld als „MM DD YYYY/ /“ herauskommen, weil die Trennzeichen zuletzt gezeichnet werden. Auf einer zweispaltigen Seite verschränken sich die Spalten, Zeile für Zeile — genau das passiert, wenn du in einem PDF-Reader eine ganze Seite markierst und einfügst. Wir bauen die Lesereihenfolge daraus auf, wo die Zeichen tatsächlich sitzen. Das gibt „MM / DD / YYYY“ zurück und hält jede Spalte zusammen.

Dann gibt es Dinge, die man leicht komplett übersieht. Wenn du ein PDF-Formular ausgefüllt hast, steht keine deiner Antworten im Seitentext — sie leben in den Formularfeldern, und ein Extraktor, der nur die Seite liest, gibt dir eine leere Vorlage und sieht dabei aus, als hätte er funktioniert. Wir sammeln sie ein und hängen sie ans Ende. Und manche PDF-Erzeuger geben Zeichen aus, die richtig aussehen, aber keine sind: Ein chinesisches Dokument kann voller Kangxi-Radikale sein, auf dem Bildschirm nicht zu unterscheiden, für eine Suche unsichtbar, beim Einfügen falsch. Jede Zeichenfolge, die wir herausgeben, wird normalisiert, sodass sie auf die Zeichen zurückfallen, als die sie gezeichnet sind.

Wofür Leute es benutzen:

  • Einen langen Bericht richtig durchsuchen oder zwischen Abschnitten springen
  • Ein Dokument ohne Seitenmobiliar in einen KI-Assistenten einfügen
  • Aus einer Arbeit zitieren, ohne die Formatierung mitzuschleppen
  • Die Antworten aus einem ausgefüllt zurückgeschickten Formular wieder herausholen
  • Ein Dokument als reinen Text archivieren, der sich überall öffnen lässt
  • Ein mehrspaltiges Layout auf dem Handy in einer lesbaren Spalte lesen

Funktioniert da, wo du ohnehin bist

Die Arbeit passiert in deinem Browser, also gibt es nichts zu installieren und kein Konto anzulegen. Jeder aktuelle Browser auf jedem Betriebssystem genügt.

§ 01

Windows

Chrome, Edge oder Firefox. Kein Reader, kein Acrobat-Abo, nichts herunterzuladen.

§ 02

macOS

Safari, Chrome oder Firefox. Schneller, als die Datei in der Vorschau zu öffnen und Seite für Seite zu markieren.

§ 03

Linux

Jeder moderne Browser. Dasselbe Ergebnis wie mit pdftotext auf der Kommandozeile, ohne die Seite zu verlassen.

§ 04

iPhone und iPad

Safari oder Chrome. Praktisch, wenn ein PDF per Mail kommt und du den Text in einer Nachricht brauchst.

§ 05

Android

Chrome, Firefox oder Samsung Internet. Gut geeignet, um ein zweispaltiges Dokument in einer Spalte zu lesen.

§ 06

Chromebook

Läuft nach dem Laden der Seite vollständig offline, was zu einem verwalteten Schulgerät passt.

Warum kopierter Text aus einem PDF meistens falsch herauskommt

Wenn du je eine Seite in einem PDF-Reader markiert, eingefügt und die Sätze durcheinander vorgefunden hast: Das ist der Grund — und aus demselben Grund produzieren die meisten Konvertierungswerkzeuge dasselbe Durcheinander.

ZeichenfolgeLesefolge
Ein PDF speichert Text in der Reihenfolge, in der er gemalt wird. Wir rekonstruieren die, in der du liest.

Was das PDF speichert

Die Reihenfolge, in der die Seite gemalt wird. Text landet in der Abfolge, die dem Erzeuger der Datei gerade passte: eine Überschrift, dann eine Fußzeile, dann der Fließtext, dann die Trennzeichen zwischen den Feldern. Kopieren folgt dieser Abfolge, also bekommst du auf einer zweispaltigen Seite eine Zeile der linken Spalte, eine der rechten, und so weiter bis unten.

Was wir rekonstruieren

Die Reihenfolge, in der du lesen würdest. Zeichen werden nach ihrer Position zu Zeilen gruppiert, Zeilen zu Spalten, und die Spalten werden nacheinander gelesen. Die Umbrüche kommen zurück, die Spalten bleiben ganz, und Trennzeichen kehren in die Mitte der Felder zurück, zu denen sie gehören.

Wo es weiterhin Grenzen gibt

Ein Bild einer Seite lässt sich gar nicht lesen, und eine Tabelle hört auf, eine Tabelle zu sein, sobald sie reiner Text ist — die Zeilen überleben, das Raster nicht. Eine Zeile, die beide Spalten überspannt, ohne dass ein Teil den Mittelsteg kreuzt, etwa eine Reihe von Autorennamen, ist von je einer Zeile pro Spalte nicht zu unterscheiden; ein Titelblock kann deshalb in einer merkwürdigen Reihenfolge herauskommen. Adobes eigene Community sagt dasselbe über Acrobat: Bei Seitenleisten und eingeschobenem Text sei es „nahezu unmöglich“ zu wissen, welcher Zeile zu folgen ist. Wenn unsere Lesart falsch aussieht, wechsle zur Dokumentreihenfolge und vergleiche.

Text oder Word?

Reiner Text ist die richtige Antwort, wenn du die Wörter willst und sonst nichts — suchen, zitieren, in einen Assistenten einfügen, archivieren. Er ist die falsche Antwort, wenn du das Dokument als Dokument zurückbrauchst, mit Überschriften, Tabellen und Bildern; das ist die Aufgabe einer PDF-zu-Word-Umwandlung, und keine .txt-Datei leistet das. Es lohnt sich zu wissen, weswegen du hergekommen bist, bevor du das Ergebnis beurteilst.

Dein Dokument bleibt auf deinem Gerät

Die Dateien, die Leute zu so einem Werkzeug bringen, sind selten belanglos. Es sind Verträge, Rechnungen, Lebensläufe, Arztbriefe, ausgefüllte Anträge — Dokumente, bei denen der gesamte Inhalt das Heikle ist. Darüber nachzudenken lohnt sich, bevor man so etwas irgendwo hochlädt.

Dieses Werkzeug lädt nichts hoch. Dein Browser öffnet das PDF, liest es und setzt den Text auf deinem eigenen Rechner zusammen. Es gibt keine Anfrage, die deine Datei trägt, keine Warteschlange auf einem Server, nichts, was irgendwo zwischengespeichert wird, und keine Kopie, die jemand später löschen müsste. Tab zu, und es ist weg.

Damit entfallen auch die üblichen Grenzen. Keine Seitenobergrenze, keine Dateigrößenobergrenze, kein Tageskontingent — weil dahinter keine Serverrechnung steht, sondern nur das, was dein eigenes Gerät bequem schafft.

§ 01

Kein Upload

Das PDF wird dort gelesen, wo es schon liegt. Es reist nie.

§ 02

Kein Konto

Keine Anmeldung, keine E-Mail, kein Wasserzeichen im Ergebnis.

§ 03

Nichts aufbewahrt

Auf unserer Seite gibt es keine Kopie zum Speichern, Protokollieren oder Löschen.

Fragen zum Extrahieren von Text aus PDFs

Warum ist mein extrahierter Text leer?
Ziemlich sicher, weil das PDF ein Scan ist. Eine gescannte Seite ist ein Bild, und darin stehen keine Zeichen zum Lesen — die Extraktion liefert nichts, weil dort nichts ist. Öffne die Datei und versuche, einen Satz zu markieren: Erscheint keine Hervorhebung, ist das der Grund. Wir sagen dir, welche Seiten betroffen sind, statt dir eine leere Datei zu geben.
Was ist eine Textebene?
Die Zeichen, die im PDF gespeichert sind, neben den Anweisungen, die sie auf dem Bildschirm zeichnen. Ein aus Software exportiertes PDF hat eine; ein von einem Scanner oder einer Kamera erzeugtes PDF nicht, weil es stattdessen eine Fotografie einer Seite enthält. Alles rund um das Extrahieren von Text folgt daraus, welches von beiden du hast.
Führt ihr OCR bei gescannten PDFs durch?
Nein. OCR erkennt Formen und rät Zeichen, das ist eine andere Aufgabe mit anderen Fehlerarten, und wir tun lieber nicht so, als wäre es dasselbe. Wenn deine Seiten Scans sind, sagen wir das und zeigen dir den Weg, sie in Bilder umzuwandeln, die du dann durch ein OCR-Werkzeug deiner Wahl schicken kannst. Was wir nicht tun: stillschweigend eine Schätzung an die Stelle dessen setzen, wonach du gefragt hast.
Warum kommt kopierter Text aus einem PDF durcheinander?
Weil ein PDF Text in der Reihenfolge speichert, in der er gezeichnet wird, nicht in der, in der du liest. Kopieren folgt der gespeicherten Reihenfolge, also kommt eine zweispaltige Seite Zeile für Zeile verschränkt heraus, und Felder, die in einer eigenwilligen Abfolge gezeichnet wurden, kommen verdreht heraus. Dieses Werkzeug rekonstruiert die Reihenfolge aus der Position der Zeichen auf der Seite, deshalb liest sich das Ergebnis meistens richtig, wo einfaches Kopieren es nicht tut.
Warum stimmt die Reihenfolge in meinem zweispaltigen Dokument trotzdem nicht?
Die Spaltenerkennung arbeitet mit dem Zwischenraum, der die Seite senkrecht teilt, und manche Layouts geben darauf keine saubere Antwort — eine breite Abbildung, eine Seitenleiste oder eine über die volle Breite verteilte Namensreihe. Kommt eine Seite in der falschen Reihenfolge heraus, stell die Lesereihenfolge auf „Dokumentreihenfolge“: Das liefert die im PDF gespeicherte Abfolge unverändert, und die ist manchmal die nützlichere von beiden.
Ich habe ein PDF-Formular ausgefüllt — warum fehlt mein Text?
Weil das Getippte nicht Teil der Seite ist. Formularwerte liegen in den Formularfeldern, getrennt vom Text, der bei der Erstellung des Dokuments schon da war. Ein Werkzeug, das nur die Seite liest, gibt dir daher eine leere Vorlage und keinen Hinweis. Wir lesen die Felder mit und hängen die Antworten unter einer eigenen Überschrift an den Text an. Wenn du nur die Seite selbst willst, kannst du das abschalten.
Bleibt das Layout von Tabellen erhalten?
Nein, und kein Werkzeug für reinen Text sollte etwas anderes versprechen. Eine .txt-Datei kennt keine Tabellen — die Zellen kommen als Text in Lesereihenfolge heraus, Zeile für Zeile, ohne das Raster. Spaltengrenzen überleben meist als Leerzeichen, was genügt, um zu sehen, wo ein Feld endet und das nächste beginnt. Brauchst du eine echte Tabelle, willst du stattdessen eine Tabellenkalkulation oder eine Word-Umwandlung.
Soll ich in Text oder in Word umwandeln?
Text, wenn du die Wörter willst: suchen, zitieren, in einen KI-Assistenten einfügen, etwas archivieren, das sich überall öffnen lässt. Word, wenn du das Dokument als Dokument zurückwillst, mit Überschriften, Tabellen, Bildern und Gestaltung. Das sind wirklich verschiedene Aufgaben, und eine .txt-Datei, welche die Formatierung weggeworfen hat, tut genau das, was sie soll.
Werden meine Dateien hochgeladen?
Nein. Das PDF wird von deinem eigenen Browser geöffnet und gelesen, und der Text wird auf deinem Gerät zusammengesetzt. Nichts geht an einen Server, also gibt es nirgendwo eine Kopie, die jemand aufbewahren oder löschen müsste. Für ein Werkzeug, dessen typische Eingabe ein Vertrag, ein Lebenslauf oder ein ausgefülltes Formular ist, ist das etwas wert.
Gibt es eine Dateigrößenbeschränkung?
Wir legen keine fest, weil kein Server beteiligt ist. Die praktische Grenze ist dein eigenes Gerät: Ein sehr großes Dokument braucht während des Lesens Arbeitsspeicher, und ein altes Handy tut sich schwer mit einer Datei, die ein Laptop mühelos schafft. Die Seiten werden einzeln verarbeitet, damit der Fortschritt auch bei großen Dokumenten weiterläuft.
Funktioniert es mit chinesischen, japanischen, koreanischen oder arabischen PDFs?
Ja. Text in jeder Schrift, die das PDF mitbringt, wird auf dieselbe Weise extrahiert, und die Ausgabe ist UTF-8. Bei ostasiatischen Dokumenten lohnt sich ein Detail: Manche PDF-Erzeuger geben Kangxi-Radikale statt gewöhnlicher Zeichen aus — sie sehen identisch aus, aber eine Suche nach dem normalen Zeichen findet sie nicht. Wir normalisieren sie zurück, bevor du den Text bekommst, und das tun die wenigsten Werkzeuge.
Welche Kodierung hat die .txt-Datei?
UTF-8, ohne Byte Order Mark. Das erwartet jeder aktuelle Editor, jedes Terminal und jede Programmiersprache, und es hält Text mit Akzenten sowie kyrillische, griechische und ostasiatische Schrift intakt. Wenn du pdftotext auf der Kommandozeile gewohnt bist: dieselbe Ausgabekonvention.

Hol den Text aus deinem PDF

Kostenlos, unbegrenzt und vollständig im Browser verarbeitet — mit einer ehrlichen Auskunft darüber, was wirklich in deiner Datei steckt.

Text aus einem PDF extrahieren