PDF en texte

Récupère le texte d'un PDF et copie-le ou enregistre-le en .txt. Tout se passe dans ton navigateur — le fichier n'est jamais envoyé.

  • 100 % dans votre navigateur
  • Sans envoi, sans inscription
  • Sans limite de pages ni de taille
  • Les fichiers ne quittent pas ton appareil

Si ton PDF est un scan, il ne contient aucun texte à extraire. Nous vérifions chaque page et te le disons avant que tu ne télécharges quoi que ce soit.

Pourquoi on extrait le texte d'un PDF

Un PDF est la description d'une page imprimée. Il sait où se place chaque caractère, quelle est sa taille et quelle police le dessine — mais il ne sait pas que ces caractères forment une phrase, un titre ou un paragraphe. Cela suffit tant que tu veux lire la page ; cela devient un problème dès que tu veux faire autre chose de ce qu'elle dit.

D'où le recours au texte brut. Quelqu'un a un long rapport et veut vraiment le chercher, ou passer d'une section à l'autre plutôt que de faire défiler quatre-vingt-dix pages. Quelqu'un cite un paragraphe dans un e-mail et ne veut pas que la police, les retours à la ligne et la mise en forme invisible suivent. Quelqu'un colle un document dans un assistant IA, qui veut des mots et non du mobilier de page. Quelqu'un archive un contrat dans un format qui s'ouvrira encore dans vingt ans sans logiciel particulier.

Il y a aussi l'accessibilité, plus souvent en jeu qu'on ne le croit. Les mises en page à plusieurs colonnes sont pénibles à lire sur un téléphone, et un lecteur d'écran qui suit le mauvais ordre lit une page à deux colonnes comme un charabia. Réduire un document à ses mots dans le bon ordre le rend utilisable là où la mise en page d'origine l'en empêchait.

Outils d'envoiLeur serveur?Cet outilTon appareilRien ne quitte ton appareil, donc aucune copie à supprimer.
Les autres convertisseurs envoient ton document. Celui-ci le lit sur place.

Deux sortes de PDF, et une seule contient du texte

Extraire le texte d'un PDF, c'est lire les caractères stockés à l'intérieur du fichier. Cela fonctionne quand le PDF possède une couche de texte — les lettres elles-mêmes, conservées à côté des instructions qui les dessinent. Un PDF scanné n'a pas de couche de texte : c'est une image de page, et il n'y a aucun caractère dedans.

La plupart des PDF produits par un logiciel — exportés d'un traitement de texte, imprimés en PDF depuis un navigateur, générés par un système de facturation — portent une couche de texte. Pour le vérifier, ouvre le fichier et essaie de sélectionner une phrase avec le curseur. Si la surbrillance suit les mots, les caractères sont bien là et n'importe quel outil peut les lire.

Un PDF issu d'un scanner ou d'un appareil photo de téléphone, c'est autre chose. Chaque page est une image. Tu vois les mots parce que ce sont tes yeux qui font la reconnaissance ; pour le fichier, la page contient une photographie et rien d'autre. La sélection ne donne rien, la recherche ne trouve rien, l'extraction ne renvoie rien — non parce que l'outil a échoué, mais parce qu'il n'y a rien à renvoyer.

Retransformer une image de mots en mots est un travail distinct qu'on appelle l'OCR, et c'est un problème de reconnaissance et non de lecture : le logiciel devine chaque forme et se trompe parfois. Nous ne le faisons pas ici. Ce que nous faisons, c'est vérifier chaque page et dire dans quelle catégorie elle tombe, avant que tu ne télécharges quoi que ce soit. Un outil qui te rend un fichier vide, ou qui bascule discrètement sur de l'OCR sans le dire, t'ôte le moyen de savoir quel type de document tu avais.

Cette vérification n'est pas une supposition. Une page avec couche de texte rend ses caractères ; une page sans n'en rend aucun. Il n'y a pas d'entre-deux où se tromper. C'est pourquoi le résultat apparaît au-dessus du texte, et non enfoui dans un avertissement quelque part.

Invoice 2026Total 1,240.00Due 30 daysVrai texteQue des pixels
Deux PDF identiques à l'écran : l'un contient des caractères, l'autre seulement une image de ceux-ci — et zoomer ne retransforme jamais une image en mots.

Comment extraire le texte d'un PDF

Rien à installer, rien à envoyer. Dépose le fichier, regarde ce que nous avons trouvé, puis emporte le texte comme tu en as besoin.

Dépose un PDFVois le bilanCopie ou garde
Dépose le fichier, lis ce que nous avons trouvé, puis copie ou enregistre le texte.
1

Dépose ton PDF

Choisis un fichier ou fais-le glisser sur la zone. Il est lu par ton propre navigateur — il n'est envoyé nulle part, et il n'y a pas d'autre limite de pages ou de taille que ce que ton appareil peut gérer.

2

Lis d'abord le récapitulatif

Avant qu'aucun texte n'apparaisse, tu sais combien de pages portent une couche de texte, lesquelles sont des scans, si le document contient des champs de formulaire remplis, et si une mise en page à deux colonnes a été détectée puis réordonnée.

3

Ajuste la lecture si besoin

Par défaut le texte suit la page telle que tu la vois, et les lignes éparses sont réunies en paragraphes. Les deux se règlent : l'ordre du document conserve la séquence enregistrée dans le PDF, et « garder chaque ligne » conserve les retours d'origine.

4

Copie ou enregistre

Copier place le texte directement dans le presse-papiers, ce que veulent la plupart des gens quand ils collent dans un document ou un assistant IA. Télécharger écrit le même contenu dans un fichier .txt en UTF-8.

À voir aussi : Si tu n'as besoin du texte que de quelques pages, il est plus rapide d' extraire ces pages d'abord.

Ce que ce convertisseur PDF en texte fait différemment

La façon naïve d'extraire, c'est de prendre la liste des fragments que pdf.js renvoie et de les coller bout à bout. Une ligne de code, et un résultat qui a presque l'air correct — c'est pour ça que tant d'outils font ainsi. Sur un formulaire fiscal de deux pages, cette approche colle des mots à travers soixante-seize retours à la ligne. Sur huit pages d'un article de recherche, deux cent quatre-vingt-treize. Tu obtiens « permission toreproduce » et « neural networksin particular », disséminés dans le document, là où tu ne les repéreras pas forcément avant de t'en servir.

Le problème de fond, c'est l'ordre. Un PDF stocke le texte dans l'ordre où il est peint sur la page, qui n'est pas celui dans lequel tu lis. Sur un formulaire, un champ de date peut ressortir en « MM DD YYYY/ / » parce que les séparateurs sont tracés en dernier. Sur une page à deux colonnes, les deux colonnes s'entrelacent, une ligne chacune — exactement ce qui arrive quand tu sélectionnes une page entière dans un lecteur PDF et que tu la colles ailleurs. Nous reconstruisons l'ordre de lecture à partir de l'endroit où les caractères se trouvent réellement, ce qui redonne « MM / DD / YYYY » et garde chaque colonne entière.

Et puis il y a ce qu'on peut manquer entièrement. Si tu as rempli un formulaire PDF, aucune de tes réponses n'est dans le texte de la page — elles vivent dans les champs de formulaire, et un extracteur qui ne lit que la page te rend un modèle vierge tout en ayant l'air d'avoir fonctionné. Nous les récupérons et les ajoutons à la fin. Enfin, certains générateurs de PDF produisent des caractères qui ont l'air justes sans l'être : un document chinois peut ressortir plein de radicaux Kangxi, indiscernables à l'écran, invisibles à une recherche, faux une fois collés. Toutes les chaînes que nous rendons sont normalisées pour qu'elles retrouvent les caractères qu'elles dessinent.

Ce que les gens en font :

  • Chercher vraiment dans un long rapport, ou sauter d'une section à l'autre
  • Coller un document dans un assistant IA sans le mobilier de page
  • Citer un article sans traîner la mise en forme avec soi
  • Récupérer les réponses d'un formulaire rempli et renvoyé
  • Archiver un document en texte brut qui s'ouvrira partout, toujours
  • Lire une mise en page à plusieurs colonnes sur un téléphone, en une seule colonne

Fonctionne là où tu es déjà

Le travail se fait dans ton navigateur : rien à installer, aucun compte à créer. N'importe quel navigateur récent, sur n'importe quel système, suffit.

§ 01

Windows

Chrome, Edge ou Firefox. Pas de lecteur, pas d'abonnement Acrobat, rien à télécharger.

§ 02

macOS

Safari, Chrome ou Firefox. Plus rapide que d'ouvrir le fichier dans Aperçu et de sélectionner page par page.

§ 03

Linux

N'importe quel navigateur moderne. Le même résultat que la commande pdftotext, sans quitter la page.

§ 04

iPhone et iPad

Safari ou Chrome. Pratique quand un PDF arrive par e-mail et qu'il te faut le texte dans un message.

§ 05

Android

Chrome, Firefox ou Samsung Internet. Commode pour lire un document à deux colonnes en une seule.

§ 06

Chromebook

Fonctionne entièrement hors ligne une fois la page chargée, ce qui convient à un appareil scolaire supervisé.

Pourquoi copier du texte depuis un PDF donne presque toujours n'importe quoi

Si tu as déjà sélectionné une page dans un lecteur PDF, collé le résultat et trouvé les phrases mélangées, voilà pourquoi — et c'est pour la même raison que la plupart des outils de conversion produisent la même bouillie.

Ordre de tracéOrdre de lecture
Un PDF enregistre le texte dans l'ordre où il est tracé. Nous reconstruisons celui dans lequel tu lis.

Ce que le PDF enregistre

L'ordre dans lequel la page est peinte. Le texte se pose dans la séquence qui arrangeait le logiciel qui a produit le fichier : un titre, puis un pied de page, puis le corps, puis les séparateurs qui tombent entre les champs. La copie suit cette séquence, donc sur une page à deux colonnes tu obtiens une ligne de la colonne de gauche, une de celle de droite, et ainsi de suite jusqu'en bas.

Ce que nous reconstruisons

L'ordre dans lequel tu lirais. Les caractères sont regroupés en lignes selon leur position, les lignes en colonnes, et les colonnes sont lues l'une après l'autre. Les retours à la ligne reviennent, les colonnes restent entières, et les séparateurs retrouvent le milieu des champs auxquels ils appartiennent.

Là où des limites subsistent

Une image de page ne peut pas être lue du tout, et un tableau cesse d'être un tableau une fois en texte brut : les lignes survivent, la grille non. Une ligne qui couvre les deux colonnes sans qu'aucune partie ne traverse la gouttière, comme une rangée de noms d'auteurs, est indiscernable d'une ligne de chaque colonne ; un bloc de titre peut donc ressortir dans un ordre bizarre. La communauté d'Adobe dit la même chose d'Acrobat : avec des encadrés et du texte inséré, il est « presque impossible » de savoir quelle ligne suivre. Quand notre lecture semble fausse, passe à l'ordre du document et compare.

Texte ou Word ?

Le texte brut est la bonne réponse quand tu veux les mots et rien d'autre : chercher, citer, coller dans un assistant, archiver. C'est la mauvaise réponse quand tu veux retrouver le document en tant que document, avec ses titres, ses tableaux et ses images ; c'est le travail d'une conversion PDF en Word, et aucun .txt ne le fera. Mieux vaut savoir pour lequel des deux tu es venu avant de juger le résultat.

Ton document reste sur ton appareil

Les fichiers qu'on apporte à ce genre d'outil sont rarement anodins. Ce sont des contrats, des factures, des CV, des courriers médicaux, des formulaires remplis — des documents dont tout le contenu est précisément ce qui est sensible. Cela vaut la peine d'y penser avant d'en envoyer un où que ce soit.

Cet outil n'envoie rien. Ton navigateur ouvre le PDF, le lit et assemble le texte sur ta propre machine. Aucune requête ne transporte ton fichier, aucune file d'attente sur un serveur, rien mis en cache nulle part, et aucune copie que quelqu'un devrait supprimer plus tard. Ferme l'onglet et c'est fini.

Cela veut dire aussi que les limites habituelles ne s'appliquent pas. Pas de plafond de pages, pas de plafond de taille, pas de quota quotidien, parce qu'il n'y a aucune facture de serveur derrière — seulement ce que ton appareil peut confortablement porter.

§ 01

Aucun envoi

Le PDF est lu là où il se trouve déjà. Il ne voyage jamais.

§ 02

Aucun compte

Pas d'inscription, pas d'e-mail, pas de filigrane sur le résultat.

§ 03

Rien de conservé

Il n'y a chez nous aucune copie à stocker, journaliser ou supprimer.

Questions sur l'extraction de texte des PDF

Pourquoi le texte extrait est-il vide ?
Presque certainement parce que le PDF est un scan. Une page scannée est une image, et il n'y a aucun caractère à lire dedans — l'extraction ne renvoie rien parce qu'il n'y a rien. Ouvre le fichier et essaie de sélectionner une phrase : si aucune surbrillance n'apparaît, c'est ça. Nous te disons quelles pages sont concernées plutôt que de te rendre un fichier vide.
Qu'est-ce qu'une couche de texte ?
Les caractères stockés dans le PDF, à côté des instructions qui les dessinent à l'écran. Un PDF exporté depuis un logiciel en a une ; un PDF fait par un scanner ou un appareil photo n'en a pas, parce qu'il contient une photographie de page à la place. Tout ce qui concerne l'extraction de texte découle de celui des deux que tu as.
Faites-vous de l'OCR sur les PDF scannés ?
Non. L'OCR reconnaît des formes et devine des caractères : c'est un autre métier, avec d'autres façons d'échouer, et nous préférons ne pas faire comme si c'était la même chose. Si tes pages sont des scans, nous le disons et nous t'orientons vers leur conversion en images, que tu pourras ensuite passer dans l'outil d'OCR de ton choix. Ce que nous ne ferons pas, c'est remplacer discrètement ce que tu as demandé par une supposition.
Pourquoi le copier-coller depuis un PDF est-il mélangé ?
Parce qu'un PDF stocke le texte dans l'ordre où il est tracé, pas dans celui où tu lis. La copie suit l'ordre stocké : une page à deux colonnes ressort entrelacée ligne par ligne, et des champs tracés dans un ordre inhabituel ressortent brouillés. Cet outil reconstruit l'ordre à partir de la position des caractères sur la page, c'est pourquoi le résultat se lit correctement là où une simple copie échoue.
Pourquoi l'ordre est-il encore faux dans mon document à deux colonnes ?
La détection des colonnes s'appuie sur la gouttière qui descend au milieu de la page, et certaines mises en page ne donnent pas de réponse nette — une figure large, un encadré, ou une rangée de noms étalée sur toute la largeur. Si une page ressort dans le mauvais ordre, bascule l'ordre de lecture sur « ordre du document » : tu obtiens la séquence enregistrée dans le PDF, sans modification, et c'est parfois la plus utile des deux.
J'ai rempli un formulaire PDF — pourquoi mon texte manque-t-il ?
Parce que ce que tu as saisi ne fait pas partie de la page. Les valeurs de formulaire vivent dans les champs de formulaire, séparément du texte présent à la création du document ; un outil qui ne lit que la page te donne donc un modèle vierge, sans avertissement. Nous lisons aussi les champs et ajoutons les réponses à la fin du texte, sous leur propre titre. Tu peux désactiver cela si tu ne veux que la page.
La mise en page des tableaux est-elle conservée ?
Non, et aucun outil de texte brut ne devrait promettre le contraire. Un fichier .txt n'a pas la notion de tableau : les cellules ressortent en texte, dans l'ordre de lecture, ligne par ligne, sans la grille. Les limites de colonnes survivent en général sous forme d'espaces, ce qui suffit à voir où finit un champ et où commence le suivant ; mais s'il te faut un vrai tableau, vise plutôt un tableur ou une conversion Word.
Dois-je convertir en texte ou en Word ?
En texte si tu veux les mots : chercher, citer, coller dans un assistant IA, archiver quelque chose qui s'ouvrira partout. En Word si tu veux retrouver le document en tant que document, avec titres, tableaux, images et mise en forme. Ce sont vraiment deux métiers différents, et un .txt qui a jeté la mise en forme fait exactement ce qu'il doit faire.
Mes fichiers sont-ils envoyés ?
Non. Le PDF est ouvert et lu par ton propre navigateur, et le texte est assemblé sur ton appareil. Rien n'est envoyé à un serveur, donc il n'existe nulle part de copie que quelqu'un pourrait conserver ou supprimer. Pour un outil dont l'entrée typique est un contrat, un CV ou un formulaire rempli, cela compte.
Y a-t-il une limite de taille de fichier ?
Aucune que nous imposions, puisqu'aucun serveur n'intervient. Le plafond réel, c'est ton appareil : un document très volumineux consomme de la mémoire pendant la lecture, et un vieux téléphone peinera là où un ordinateur portable ne bronchera pas. Les pages sont traitées une par une, pour que la progression continue d'avancer sur les gros documents.
Est-ce que ça marche avec des PDF en chinois, japonais, coréen ou arabe ?
Oui. Le texte, dans n'importe quelle écriture présente dans le PDF, est extrait de la même façon, et la sortie est en UTF-8. Un détail mérite d'être connu pour les documents d'Asie de l'Est : certains générateurs de PDF émettent des radicaux Kangxi à la place des caractères ordinaires — identiques à l'écran, mais une recherche sur le caractère normal ne les trouve pas. Nous les normalisons avant de te rendre le texte, ce que la plupart des outils ne font pas.
Quel est l'encodage du fichier .txt ?
UTF-8, sans marque d'ordre des octets. C'est ce qu'attendent tous les éditeurs, terminaux et langages actuels, et cela préserve les accents ainsi que le cyrillique, le grec et les écritures d'Asie de l'Est. Si tu as l'habitude de la commande pdftotext, c'est la même convention de sortie.

Récupère le texte de ton PDF

Gratuit, sans limite, traité entièrement dans ton navigateur — avec une réponse honnête sur ce que contient vraiment ton fichier.

Extraire le texte d'un PDF