PDF en texte
Récupère le texte d'un PDF et copie-le ou enregistre-le en .txt. Tout se passe dans ton navigateur — le fichier n'est jamais envoyé.
Dépose un PDF pour en extraire le texte
ou clique pour choisir un fichier
- 100 % dans votre navigateur
- Sans envoi, sans inscription
- Sans limite de pages ni de taille
- Les fichiers ne quittent pas ton appareil
Si ton PDF est un scan, il ne contient aucun texte à extraire. Nous vérifions chaque page et te le disons avant que tu ne télécharges quoi que ce soit.
Pourquoi on extrait le texte d'un PDF
Un PDF est la description d'une page imprimée. Il sait où se place chaque caractère, quelle est sa taille et quelle police le dessine — mais il ne sait pas que ces caractères forment une phrase, un titre ou un paragraphe. Cela suffit tant que tu veux lire la page ; cela devient un problème dès que tu veux faire autre chose de ce qu'elle dit.
D'où le recours au texte brut. Quelqu'un a un long rapport et veut vraiment le chercher, ou passer d'une section à l'autre plutôt que de faire défiler quatre-vingt-dix pages. Quelqu'un cite un paragraphe dans un e-mail et ne veut pas que la police, les retours à la ligne et la mise en forme invisible suivent. Quelqu'un colle un document dans un assistant IA, qui veut des mots et non du mobilier de page. Quelqu'un archive un contrat dans un format qui s'ouvrira encore dans vingt ans sans logiciel particulier.
Il y a aussi l'accessibilité, plus souvent en jeu qu'on ne le croit. Les mises en page à plusieurs colonnes sont pénibles à lire sur un téléphone, et un lecteur d'écran qui suit le mauvais ordre lit une page à deux colonnes comme un charabia. Réduire un document à ses mots dans le bon ordre le rend utilisable là où la mise en page d'origine l'en empêchait.
Deux sortes de PDF, et une seule contient du texte
Extraire le texte d'un PDF, c'est lire les caractères stockés à l'intérieur du fichier. Cela fonctionne quand le PDF possède une couche de texte — les lettres elles-mêmes, conservées à côté des instructions qui les dessinent. Un PDF scanné n'a pas de couche de texte : c'est une image de page, et il n'y a aucun caractère dedans.
La plupart des PDF produits par un logiciel — exportés d'un traitement de texte, imprimés en PDF depuis un navigateur, générés par un système de facturation — portent une couche de texte. Pour le vérifier, ouvre le fichier et essaie de sélectionner une phrase avec le curseur. Si la surbrillance suit les mots, les caractères sont bien là et n'importe quel outil peut les lire.
Un PDF issu d'un scanner ou d'un appareil photo de téléphone, c'est autre chose. Chaque page est une image. Tu vois les mots parce que ce sont tes yeux qui font la reconnaissance ; pour le fichier, la page contient une photographie et rien d'autre. La sélection ne donne rien, la recherche ne trouve rien, l'extraction ne renvoie rien — non parce que l'outil a échoué, mais parce qu'il n'y a rien à renvoyer.
Retransformer une image de mots en mots est un travail distinct qu'on appelle l'OCR, et c'est un problème de reconnaissance et non de lecture : le logiciel devine chaque forme et se trompe parfois. Nous ne le faisons pas ici. Ce que nous faisons, c'est vérifier chaque page et dire dans quelle catégorie elle tombe, avant que tu ne télécharges quoi que ce soit. Un outil qui te rend un fichier vide, ou qui bascule discrètement sur de l'OCR sans le dire, t'ôte le moyen de savoir quel type de document tu avais.
Cette vérification n'est pas une supposition. Une page avec couche de texte rend ses caractères ; une page sans n'en rend aucun. Il n'y a pas d'entre-deux où se tromper. C'est pourquoi le résultat apparaît au-dessus du texte, et non enfoui dans un avertissement quelque part.
Comment extraire le texte d'un PDF
Rien à installer, rien à envoyer. Dépose le fichier, regarde ce que nous avons trouvé, puis emporte le texte comme tu en as besoin.
Dépose ton PDF
Choisis un fichier ou fais-le glisser sur la zone. Il est lu par ton propre navigateur — il n'est envoyé nulle part, et il n'y a pas d'autre limite de pages ou de taille que ce que ton appareil peut gérer.
Lis d'abord le récapitulatif
Avant qu'aucun texte n'apparaisse, tu sais combien de pages portent une couche de texte, lesquelles sont des scans, si le document contient des champs de formulaire remplis, et si une mise en page à deux colonnes a été détectée puis réordonnée.
Ajuste la lecture si besoin
Par défaut le texte suit la page telle que tu la vois, et les lignes éparses sont réunies en paragraphes. Les deux se règlent : l'ordre du document conserve la séquence enregistrée dans le PDF, et « garder chaque ligne » conserve les retours d'origine.
Copie ou enregistre
Copier place le texte directement dans le presse-papiers, ce que veulent la plupart des gens quand ils collent dans un document ou un assistant IA. Télécharger écrit le même contenu dans un fichier .txt en UTF-8.
À voir aussi : Si tu n'as besoin du texte que de quelques pages, il est plus rapide d' extraire ces pages d'abord.
Ce que ce convertisseur PDF en texte fait différemment
La façon naïve d'extraire, c'est de prendre la liste des fragments que pdf.js renvoie et de les coller bout à bout. Une ligne de code, et un résultat qui a presque l'air correct — c'est pour ça que tant d'outils font ainsi. Sur un formulaire fiscal de deux pages, cette approche colle des mots à travers soixante-seize retours à la ligne. Sur huit pages d'un article de recherche, deux cent quatre-vingt-treize. Tu obtiens « permission toreproduce » et « neural networksin particular », disséminés dans le document, là où tu ne les repéreras pas forcément avant de t'en servir.
Le problème de fond, c'est l'ordre. Un PDF stocke le texte dans l'ordre où il est peint sur la page, qui n'est pas celui dans lequel tu lis. Sur un formulaire, un champ de date peut ressortir en « MM DD YYYY/ / » parce que les séparateurs sont tracés en dernier. Sur une page à deux colonnes, les deux colonnes s'entrelacent, une ligne chacune — exactement ce qui arrive quand tu sélectionnes une page entière dans un lecteur PDF et que tu la colles ailleurs. Nous reconstruisons l'ordre de lecture à partir de l'endroit où les caractères se trouvent réellement, ce qui redonne « MM / DD / YYYY » et garde chaque colonne entière.
Et puis il y a ce qu'on peut manquer entièrement. Si tu as rempli un formulaire PDF, aucune de tes réponses n'est dans le texte de la page — elles vivent dans les champs de formulaire, et un extracteur qui ne lit que la page te rend un modèle vierge tout en ayant l'air d'avoir fonctionné. Nous les récupérons et les ajoutons à la fin. Enfin, certains générateurs de PDF produisent des caractères qui ont l'air justes sans l'être : un document chinois peut ressortir plein de radicaux Kangxi, indiscernables à l'écran, invisibles à une recherche, faux une fois collés. Toutes les chaînes que nous rendons sont normalisées pour qu'elles retrouvent les caractères qu'elles dessinent.
Ce que les gens en font :
- Chercher vraiment dans un long rapport, ou sauter d'une section à l'autre
- Coller un document dans un assistant IA sans le mobilier de page
- Citer un article sans traîner la mise en forme avec soi
- Récupérer les réponses d'un formulaire rempli et renvoyé
- Archiver un document en texte brut qui s'ouvrira partout, toujours
- Lire une mise en page à plusieurs colonnes sur un téléphone, en une seule colonne
Fonctionne là où tu es déjà
Le travail se fait dans ton navigateur : rien à installer, aucun compte à créer. N'importe quel navigateur récent, sur n'importe quel système, suffit.
Windows
Chrome, Edge ou Firefox. Pas de lecteur, pas d'abonnement Acrobat, rien à télécharger.
macOS
Safari, Chrome ou Firefox. Plus rapide que d'ouvrir le fichier dans Aperçu et de sélectionner page par page.
Linux
N'importe quel navigateur moderne. Le même résultat que la commande pdftotext, sans quitter la page.
iPhone et iPad
Safari ou Chrome. Pratique quand un PDF arrive par e-mail et qu'il te faut le texte dans un message.
Android
Chrome, Firefox ou Samsung Internet. Commode pour lire un document à deux colonnes en une seule.
Chromebook
Fonctionne entièrement hors ligne une fois la page chargée, ce qui convient à un appareil scolaire supervisé.
Pourquoi copier du texte depuis un PDF donne presque toujours n'importe quoi
Si tu as déjà sélectionné une page dans un lecteur PDF, collé le résultat et trouvé les phrases mélangées, voilà pourquoi — et c'est pour la même raison que la plupart des outils de conversion produisent la même bouillie.
Ce que le PDF enregistre
L'ordre dans lequel la page est peinte. Le texte se pose dans la séquence qui arrangeait le logiciel qui a produit le fichier : un titre, puis un pied de page, puis le corps, puis les séparateurs qui tombent entre les champs. La copie suit cette séquence, donc sur une page à deux colonnes tu obtiens une ligne de la colonne de gauche, une de celle de droite, et ainsi de suite jusqu'en bas.
Ce que nous reconstruisons
L'ordre dans lequel tu lirais. Les caractères sont regroupés en lignes selon leur position, les lignes en colonnes, et les colonnes sont lues l'une après l'autre. Les retours à la ligne reviennent, les colonnes restent entières, et les séparateurs retrouvent le milieu des champs auxquels ils appartiennent.
Là où des limites subsistent
Une image de page ne peut pas être lue du tout, et un tableau cesse d'être un tableau une fois en texte brut : les lignes survivent, la grille non. Une ligne qui couvre les deux colonnes sans qu'aucune partie ne traverse la gouttière, comme une rangée de noms d'auteurs, est indiscernable d'une ligne de chaque colonne ; un bloc de titre peut donc ressortir dans un ordre bizarre. La communauté d'Adobe dit la même chose d'Acrobat : avec des encadrés et du texte inséré, il est « presque impossible » de savoir quelle ligne suivre. Quand notre lecture semble fausse, passe à l'ordre du document et compare.
Texte ou Word ?
Le texte brut est la bonne réponse quand tu veux les mots et rien d'autre : chercher, citer, coller dans un assistant, archiver. C'est la mauvaise réponse quand tu veux retrouver le document en tant que document, avec ses titres, ses tableaux et ses images ; c'est le travail d'une conversion PDF en Word, et aucun .txt ne le fera. Mieux vaut savoir pour lequel des deux tu es venu avant de juger le résultat.
Ton document reste sur ton appareil
Les fichiers qu'on apporte à ce genre d'outil sont rarement anodins. Ce sont des contrats, des factures, des CV, des courriers médicaux, des formulaires remplis — des documents dont tout le contenu est précisément ce qui est sensible. Cela vaut la peine d'y penser avant d'en envoyer un où que ce soit.
Cet outil n'envoie rien. Ton navigateur ouvre le PDF, le lit et assemble le texte sur ta propre machine. Aucune requête ne transporte ton fichier, aucune file d'attente sur un serveur, rien mis en cache nulle part, et aucune copie que quelqu'un devrait supprimer plus tard. Ferme l'onglet et c'est fini.
Cela veut dire aussi que les limites habituelles ne s'appliquent pas. Pas de plafond de pages, pas de plafond de taille, pas de quota quotidien, parce qu'il n'y a aucune facture de serveur derrière — seulement ce que ton appareil peut confortablement porter.
Aucun envoi
Le PDF est lu là où il se trouve déjà. Il ne voyage jamais.
Aucun compte
Pas d'inscription, pas d'e-mail, pas de filigrane sur le résultat.
Rien de conservé
Il n'y a chez nous aucune copie à stocker, journaliser ou supprimer.
Questions sur l'extraction de texte des PDF
Pourquoi le texte extrait est-il vide ?⌄
Qu'est-ce qu'une couche de texte ?⌄
Faites-vous de l'OCR sur les PDF scannés ?⌄
Pourquoi le copier-coller depuis un PDF est-il mélangé ?⌄
Pourquoi l'ordre est-il encore faux dans mon document à deux colonnes ?⌄
J'ai rempli un formulaire PDF — pourquoi mon texte manque-t-il ?⌄
La mise en page des tableaux est-elle conservée ?⌄
Dois-je convertir en texte ou en Word ?⌄
Mes fichiers sont-ils envoyés ?⌄
Y a-t-il une limite de taille de fichier ?⌄
Est-ce que ça marche avec des PDF en chinois, japonais, coréen ou arabe ?⌄
Quel est l'encodage du fichier .txt ?⌄
Récupère le texte de ton PDF
Gratuit, sans limite, traité entièrement dans ton navigateur — avec une réponse honnête sur ce que contient vraiment ton fichier.
Extraire le texte d'un PDFArticles associés
Approfondis tes connaissances sur la conversion de PDF en PNG grâce à nos derniers guides et tests
Comment convertir un PDF en PNG en ligne (méthodes gratuites et rapides)
Guide complet pour convertir un PDF en PNG en ligne gratuitement. Compare les 5 meilleurs convertisseurs, découvre les procédures pas à pas, des astuces avancées et du dépannage.
Lire l'articleComment transformer un PDF en PNG sous Windows, Mac et mobile
Guide spécifique à chaque plateforme pour convertir des PDF en PNG sur n'importe quel appareil. Outils natifs, recommandations de logiciels et applis mobiles couverts.
Lire l'articlePDF en PNG vs PDF en JPG : quel format choisir ?
Comparaison détaillée des formats PNG et JPG pour la conversion de PDF. Tailles de fichier, différences de qualité, cas d'usage et guide de décision.
Lire l'articleOutils de conversion associés
Découvre d'autres outils de notre suite complète de conversion de fichiers
Extraire des pages PDF
Sortez les pages voulues dans un nouveau PDF, ou un fichier par page. Votre original reste intact. Sans envoi.
Aplatir un PDF
Fusionne les champs de formulaire remplis et les commentaires dans la page. Le texte reste du texte, et ce qui ne peut pas être fusionné est signalé, pas supprimé.
Déverrouiller un PDF
Retirez un mot de passe que vous connaissez, ou levez les restrictions d'impression et de copie qui n'en demandent aucun. Rien n'est envoyé.