OCR PDF

Transforme un PDF scanné en un PDF dans lequel tu peux chercher. Tout se passe dans cet onglet — sans compte, sans envoi, sans limite de pages.

Pourquoi un PDF scanné a besoin d'OCR

Un PDF scanné est une pile de photographies. Tes yeux le lisent très bien, mais pour l'ordinateur il n'y a sur ces pages que des points colorés. Ctrl+F ne trouve rien. Impossible de copier une ligne. Rien ne l'indexe, donc il ne ressortira d'aucune recherche plus tard.

L'OCR — la reconnaissance optique de caractères — est l'étape qui change cela. Elle regarde les formes sur chaque page, décide de quelles lettres il s'agit, et écrit ces lettres dans le fichier sous forme de couche invisible placée sous l'image. Après l'OCR, un PDF a exactement la même apparence ; la différence, c'est qu'il y a maintenant du texte dessous.

Le moment qui compte arrive généralement des mois plus tard. Un contrat que tu as scanné, une facture, un reçu, une page de livre — tu te souviens d'une phrase et de rien d'autre. Un PDF consultable te rend cette phrase. Une pile de photographies non.

Cet outil d'OCR PDF fonctionne entièrement dans ton navigateur. Le fichier n'est pas envoyé, il n'y a pas de compte, et il n'y a aucun plafond sur le nombre de pages. La page qui nous devance sur ce mot-clé traite ton fichier gratuitement, puis te demande de créer un compte avant de te le rendre.

Outils à envoiLeur serveur?Cet outilVotre appareilRien ne quitte votre appareil, aucune copie à supprimer.
D'autres convertisseurs envoient votre fichier sur un serveur. Celui-ci le dessine là où il est déjà.

Qu'est-ce que l'OCR sur un PDF ?

L'OCR sur un PDF, c'est la reconnaissance de caractères appliquée aux images de pages qu'il contient, les mots reconnus étant réécrits dans ce même fichier sous forme de couche de texte invisible — le document reste identique à l'œil, mais devient consultable, sélectionnable et copiable.

Deux sortes de PDF se ressemblent à l'écran. L'un a été exporté depuis un traitement de texte et porte du vrai texte ; l'autre vient d'un scanner ou d'un appareil photo de téléphone et porte des images de texte. Seul le second a besoin d'OCR.

Il existe un moyen rapide de les distinguer sans aucun outil : essaie de sélectionner une ligne à la souris. Si un surlignage bleu suit les mots, le texte est déjà là. Si toute la page se surligne d'un bloc, ou si rien ne se passe, tu as un PDF scanné.

Cet outil fait cette vérification pour toi avant de lancer quoi que ce soit. Si le fichier a déjà une couche de texte, il le dit et te propose d'extraire le texte à la place, parce que l'OCR remplacerait quelque chose d'exact par quelque chose d'approximatif — et tu n'aurais ensuite aucun moyen de t'en apercevoir, puisque la page est identique dans les deux cas.

Le texte produit par l'OCR se place sous l'image de la page, pas au-dessus. C'est pour cela qu'un PDF consultable ressemble toujours à un scan : tu regardes toujours l'image d'origine. La couche invisible n'existe que pour ton champ de recherche, ta commande copier, et tout ce qui indexe le fichier.

Il vaut la peine d'être clair sur ce qu'est cette couche. C'est une supposition — très bonne sur de l'imprimé propre, mauvaise sur un reçu froissé photographié de travers. L'image que tu vois est toujours juste. Le texte en dessous, peut-être pas.

Image seuleInvoiceNo. 4471Total1,240.00+ couche texte
L'OCR ne change pas l'apparence de la page. Il ajoute une couche de texte sous l'image, et c'est elle qui rend le PDF consultable.

Faire un OCR sur un PDF en quatre étapes

Tout se passe dans cet onglet. Le fichier ne quitte pas ton appareil, et personne ne te demandera de créer un compte avant de te laisser télécharger le résultat.

Lorem ipsumdolor sit ametconsecteturA du textePas d'OCRLorem ipsumEn partieLes ignorerImage seuleLancer l'OCR
Tous les PDF n'ont pas besoin d'OCR. Cet outil vérifie avant de lancer quoi que ce soit, parce que relire un texte déjà exact ne fait que l'abîmer.
1

Dépose ton PDF scanné

Fais glisser le fichier sur la zone ci-dessus, ou clique dessus pour parcourir. Les fichiers jusqu'à 100 Mo conviennent. Rien n'est envoyé nulle part : le fichier est ouvert par cette page, dans ton navigateur.

2

Lis le verdict

L'outil examine chaque page à la recherche d'une couche de texte avant de travailler. Il te dit si ton PDF a besoin d'OCR, s'il en a besoin sur certaines pages seulement, ou s'il n'en a pas besoin du tout. Si seules quelques pages sont des scans, les autres sont laissées intactes par défaut.

3

Choisis la langue du document

La précision en dépend plus que de tout ce que tu peux régler par ailleurs. Choisis la langue dans laquelle le document est écrit, pas celle de cette interface. Les données linguistiques sont téléchargées une seule fois — environ 5,2 Mo pour l'anglais, 1,7 Mo pour le hindi — puis mises en cache. Sélectionner plusieurs langues fonctionne, mais ralentit chaque page.

4

Lance et vérifie

Les pages sont traitées une par une, avec un aperçu de celle qui est en cours de lecture : tu peux donc arrêter tôt si tu t'es trompé de fichier. À la fin, essaie de sélectionner du texte dans l'aperçu. Puis télécharge le PDF consultable — ou le texte brut, si c'est tout ce que tu voulais.

Tu ne veux que les mots ? Si tu veux le texte et non le PDF, et que ton fichier a déjà une couche de texte, il existe un chemin plus rapide où rien n'est deviné : extraire le texte directement du PDF.

Ce que fait cet outil d'OCR PDF

Il ajoute une couche de texte et ne change rien d'autre. Tes pages d'origine restent exactement telles quelles — mêmes images, même résolution, mêmes cadres de page. Les mots reconnus sont dessinés par-dessus avec une opacité nulle : sélectionnables et consultables, jamais visibles. Les pages qui avaient déjà du texte ne sont pas réécrites du tout.

Il rend les pages à 150 DPI, et c'est un choix mesuré, pas une valeur par défaut. Sur un document de test, la précision à 100, 150, 200 et 300 DPI était identique à un demi-point près, alors que 300 DPI prenait quatre fois plus de temps. En dessous de 100 DPI il y a une falaise : à 72 DPI la précision est tombée de 95,6 % à 79,3 %. Scanner à 600 DPI ne rendra pas l'OCR plus précis. Seulement plus lent.

Il gère plus de 100 langues, y compris des écritures que la plupart des convertisseurs laissent de côté. L'un des outils d'OCR en ligne les plus connus annonce 19 langues, et pas une seule n'est une écriture d'Asie du Sud. Le hindi, le tamoul et le bengali figurent ici dans la liste, et près du haut — parce que c'est là que se trouvent réellement la plupart des gens qui cherchent cet outil.

Il compte ce qu'il n'a pas réussi à faire. Si une page revient sans texte — une feuille blanche, une photographie, de l'écriture manuscrite —, elle reste intacte dans le fichier et elle est signalée. Rien n'est écarté en silence.

Il ne te demande jamais de compte. Tu peux traiter un document de 400 pages puis en traiter un autre. Il n'y a pas de limite quotidienne, parce qu'aucun serveur ne fait le travail et qu'il n'y a donc rien à rationner.

Ce pour quoi les gens utilisent l'OCR PDF :

  • Rendre des contrats scannés consultables avant de les classer
  • Retrouver une ligne dans un chapitre de livre photographié page par page
  • Transformer un dossier de factures scannées en quelque chose qui se fouille
  • Récupérer le texte d'un fax ou d'une photocopie arrivée en PDF
  • Rendre de vieux dossiers scannés retrouvables par recherche plutôt que de mémoire
  • Préparer des scans pour qu'un index de recherche ou un autre outil puisse les lire
  • Copier un paragraphe depuis un scan au lieu de le retaper

Fonctionne sur n'importe quel appareil

Il n'y a rien à installer. L'OCR tourne dans le navigateur que tu as déjà, donc le même outil fonctionne partout et ton fichier reste sur l'appareil où il a commencé.

§ 01

Windows

Chrome, Edge ou Firefox. Rien à télécharger, et aucun abonnement Acrobat nécessaire pour rendre un scan consultable.

§ 02

Mac

Safari ou Chrome. Aperçu sait afficher un PDF scanné, mais ne sait pas lui ajouter une couche de texte.

§ 03

iPhone et iPad

Fonctionne dans Safari. Pratique quand le scan est une photo que tu viens de prendre — même si c'est précisément le cas où redresser la page compte le plus.

§ 04

Android

Fonctionne dans Chrome. Les longs documents prennent du temps et occupent le téléphone, alors branche-le d'abord.

§ 05

Chromebook

Un bon terrain, puisque tout tourne localement dans le navigateur plutôt que dans une application installée.

§ 06

Linux

N'importe quel navigateur moderne. Pas de paquets, pas de ligne de commande, pas de file d'attente.

Ce que l'OCR réussit, et ce qu'il rate

Tout outil d'OCR fait des erreurs, et presque aucun ne te dit à quoi ces erreurs ressemblent. Voici un résultat réel : une facture propre, produite par ordinateur, sans bruit, sans inclinaison, 95,6 % de précision par caractère au total. Sur douze mots prélevés dedans, cinq étaient retrouvables par une recherche.

Dans le fichierLu par l'OCRNorthwindNorthwindSubtotalSubtotal1741.501741.502089.802089. 80INV-2026INV2026ReplacementRepl acenentPayment isPaymentis5 mots sur 12 retrouvables
Depuis une facture de test propre, à 95,6 % de précision par caractère. Le nom de l'entreprise est passé ; le total non, parce que l'OCR a glissé une espace au milieu du nombre.
Dans le documentLu par l'OCRPourquoi
NorthwindNorthwindDu texte courant dans une police proportionnelle, c'est le cas facile.
2089.802089. 80Une espace est apparue au milieu du nombre : chercher le total ne donne rien.
INV-2026-04471INV2026-04471Un trait d'union a sauté. Les numéros de référence sont particulièrement fragiles.
ReplacementRepl acenentUn m lu comme un n, plus une espace qui n'a rien à faire là.
Payment isPaymentisL'erreur inverse : une vraie espace a été supprimée.
1741.501741.50Même tableau, même police que le total au-dessus — et celui-ci est passé. Les erreurs ne sont pas prévisibles.

Ce qui abîme vraiment un scan

Ce n'est ni la compression ni la résolution. Un JPEG en qualité 60 est arrivé à une fraction de point d'un rendu sans perte. Ce qui fait mal, c'est l'inclinaison : une page penchée de deux degrés ne posait pas de problème, mais à sept degrés la précision a chuté de neuf points et demi et la confiance est passée de 91 à 74. Si tu scannes quelque chose, mets-le droit. Inutile de monter les DPI.

PDF consultable, texte brut ou fichier Word ?

Un PDF consultable, c'est ce que produit cette page : le scan que tu avais, plus une couche de texte invisible, toujours un PDF. Le texte brut, ce sont les mots sans la mise en page — pratique pour les coller ailleurs, et proposé ici en second téléchargement. Un document Word modifiable est un autre travail, qui consiste à reconstruire la mise en page, et cet outil ne le fait pas. Si ton PDF a déjà du texte et que tu ne veux que les mots, saute l'OCR et extrais-les directement.

Ton scan ne quitte pas ce navigateur

Le PDF que tu déposes ici est ouvert par cette page, lu par ton propre processeur, et réécrit par ton propre navigateur. Il n'est pas envoyé, pas mis en file sur un serveur, et conservé nulle part pendant une durée de rétention — parce qu'aucun serveur n'intervient dans le travail.

Cela pèse plus lourd pour l'OCR que pour la plupart des conversions. Les documents que les gens ont besoin de rendre consultables sont des contrats, des dossiers médicaux, des relevés bancaires et des papiers d'identité — exactement les scans qui existent parce que l'original valait la peine d'être gardé. Tous les grands services d'OCR en ligne les traitent sur leurs propres machines et les suppriment selon un calendrier, généralement au bout d'une à huit heures.

Cela veut aussi dire qu'il n'y a rien à rationner. Les services qui font le travail sur leur propre matériel doivent limiter l'usage gratuit, et c'est pour cela qu'ils te plafonnent à deux tâches par jour ou dix pages par fichier. Ici le travail se fait sur ton appareil, donc il n'y a pas de limite à faire respecter ni de compte à collecter.

§ 01

Rien n'est envoyé

Le fichier est lu localement. Aucune copie n'est créée sur un serveur.

§ 02

Jamais de compte

On ne te demande pas de créer un compte pour télécharger le résultat, ce qui est pourtant le prix habituel d'un OCR gratuit ailleurs.

§ 03

Aucune limite de pages ni de fichiers

Traite un scan de 400 pages, puis un autre. Il n'y a pas de quota quotidien.

§ 04

Seulement les données de langue

La seule chose téléchargée, ce sont les données de reconnaissance de la langue que tu choisis. Ton document ne fait jamais partie de cette requête.

Questions fréquentes

Cet outil d'OCR PDF est-il vraiment gratuit, et y a-t-il une limite de pages ?
Il est gratuit, sans limite de pages et sans quota quotidien. L'OCR tourne sur ton propre appareil plutôt que sur un serveur : il n'y a donc aucun coût par fichier de notre côté et rien à rationner. Les gros documents ne sont limités que par ta patience et ta batterie.
Dois-je créer un compte pour télécharger le résultat ?
Non. Tu peux déposer un fichier, lancer l'OCR et télécharger le PDF consultable sans compte ni adresse e-mail. Cela vaut la peine d'être vérifié sur n'importe quel site d'OCR avant d'envoyer quoi que ce soit : il est courant qu'on te demande un compte seulement à l'étape du téléchargement, une fois le travail fait.
Comment savoir si mon PDF a vraiment besoin d'OCR ?
Essaie de sélectionner une ligne de texte à la souris. Si un surlignage suit les mots, le fichier a déjà une couche de texte et l'OCR ne ferait que l'abîmer. Cet outil vérifie automatiquement dès que tu ajoutes un fichier et te dit dans lequel des trois cas tu te trouves avant de lancer quoi que ce soit.
Quelle est la précision de l'OCR ?
Assez précise pour être utile, pas assez pour lui faire confiance les yeux fermés. Sur une facture de test propre, générée par ordinateur, la précision par caractère atteignait 95,6 % — mais seulement 5 mots sur 12 prélevés étaient réellement retrouvables par une recherche, parce qu'une espace atterrissait au milieu d'un nombre ou qu'un trait d'union disparaissait. L'imprimé net s'en sort bien. Tout ce qui est froissé, pâle ou de travers s'en sort moins bien.
Quelles langues sont prises en charge ?
Plus de 100, dont le hindi, le tamoul, le bengali, le thaï, le vietnamien et l'indonésien, à côté des langues européennes habituelles. Choisis la langue dans laquelle le document est écrit, pas celle de cette page : c'est ce qui influence le plus la précision. À noter : les écritures qui remodèlent leurs caractères, comme la devanagari, peuvent perdre un mot de temps en temps au moment de l'écrire dans la couche de texte du PDF, même quand il a été correctement reconnu.
Est-ce que ça lit l'écriture manuscrite ?
Pars du principe que non. Ce moteur est conçu pour des caractères imprimés, et l'écriture manuscrite est un autre problème, pour lequel il n'a pas été entraîné. Une page manuscrite revient en général vide ou presque. Dans ce cas, la page reste dans ton fichier exactement comme elle était et elle est signalée dans le récapitulatif plutôt qu'écartée en silence.
Le PDF aura-t-il une apparence différente après ?
Non, et c'est bien l'idée. Les images de tes pages restent exactement telles qu'elles étaient, et le texte reconnu est dessiné par-dessus avec une opacité nulle. Tu continues de regarder le scan d'origine ; la couche de texte n'existe que pour ton champ de recherche et ta commande copier.
Un scan à plus haute résolution donne-t-il de meilleurs résultats ?
En général non. Lors des tests, la précision à 100, 150, 200 et 300 DPI était identique à un demi-point près, alors que 300 DPI prenait quatre fois plus de temps. Il y a un plancher — à 72 DPI la précision s'est effondrée à 79,3 % — mais au-delà d'environ 150 DPI tu paies du temps pour rien. Redresser la page aide bien davantage.
Combien de temps ça prend ?
Environ une seconde par page sur un ordinateur portable normal pour une page A4 standard, donc un document de 50 pages tombe autour d'une minute. Les téléphones sont plus lents. Sélectionner plusieurs langues multiplie le travail : ne choisis que celles qui sont réellement dans le document.
Mon fichier est-il envoyé quelque part ?
Non. Le PDF est ouvert et traité dans cet onglet et n'est jamais envoyé à un serveur. La seule requête réseau que fait l'outil concerne les données de reconnaissance de la langue que tu as choisie : c'est le même fichier pour tout le monde et il ne contient rien de toi.
Quelle est la différence avec « PDF en texte » ?
Cette page fabrique un PDF consultable à partir d'un scan en devinant les caractères présents dans les images. « PDF en texte » extrait le texte qui est déjà dans le fichier, exactement, sans rien deviner. Si ton PDF a une couche de texte, c'est cet outil-là qu'il te faut : il est plus rapide et il ne peut pas commettre le genre d'erreurs que commet l'OCR.
Puis-je obtenir un document Word modifiable à la place ?
Pas avec cet outil. Transformer un scan en fichier Word implique de reconstruire la mise en page — colonnes, tableaux, titres — et c'est un autre travail, avec ses propres façons d'échouer. Ce que tu obtiens ici, c'est le PDF d'origine rendu consultable, plus un téléchargement en texte brut si tu veux les mots tout seuls.

Rends ton PDF scanné consultable

Gratuit, illimité, et ça tourne dans cet onglet. Sans envoi, sans compte — et il te prévient si ton fichier n'a pas besoin d'OCR du tout.

Faire un OCR sur un PDF