EasyPDFLoad

OCR PDF : reconnaissance de texte

Transformez un document scanné en PDF consultable, ou extrayez son texte brut, avec un moteur OCR qui tourne entièrement sur votre appareil. La plupart des outils OCR gratuits envoient votre scan sur un serveur pour le lire : pas celui-ci.

Outil OCR PDF : choix entre PDF consultable et texte brut pour un document scanné

Votre fichier ne quitte pas votre appareil. Il n'est pas copié sur un serveur, ni mis en cache, ni supprimé au bout d'une heure. Chaque outil de ce site fonctionne en JavaScript, directement dans l'onglet que vous avez ouvert.

↑

Déposez votre fichier ici ou cliquez pour le choisir

Pourquoi utiliser « OCR PDF » plutôt qu'un logiciel de bureau ?

  • L'OCR s'exécute entièrement dans votre navigateur grâce à WebAssembly : votre document scanné n'est jamais envoyé sur un serveur pour être lu, contrairement à la plupart des outils OCR gratuits.
  • Choisissez un PDF consultable (l'image scannée d'origine est conservée, avec une couche de texte invisible que vous pouvez sélectionner et rechercher) ou un simple fichier .txt si seuls les mots vous intéressent.
  • Compromis assumé : l'OCR dans le navigateur est réellement plus lent qu'une ferme de serveurs, surtout sur des scans longs ou de mauvaise qualité, mais rien de votre document ne quitte votre appareil pour y arriver.
  • Gratuit, sans limite de pages imposée par nous et sans filigrane sur le résultat.

OCR PDF : mode d'emploi, étape par étape

  1. Colorful PDF files dropping onto a dashed upload area labeled drop PDFs — AI-generated illustration, EasyPDFLoad1

    Choisissez le PDF

    Déposez le PDF scanné dans l'outil, ou cliquez pour le choisir. Le scan reste sur votre appareil.

  2. Laptop browser processing PDF files on the device with an unused cloud icon in the background — AI-generated illustration, EasyPDFLoad2

    Choisissez le résultat

    Répondez à « Que voulez-vous faire du texte reconnu ? » : « En faire un PDF consultable » ou « Extraire uniquement le texte (.txt) ».

  3. A scanned paper page transforming into a searchable PDF with highlighted text — AI-generated illustration, EasyPDFLoad3

    Lancez l'OCR

    Cliquez sur « Lancer l'OCR » et patientez pendant la lecture de chaque page : plus de pages signifie plus de temps, puisque votre appareil fait le travail.

  4. Finished PDF with a green checkmark ready to download from the browser — AI-generated illustration, EasyPDFLoad4

    Téléchargez

    Téléchargez le résultat : un PDF consultable ou un fichier .txt, selon votre choix.

Dans quels cas c'est utile

Un chercheur ne possède qu'un PDF scanné à plat d'un article de revue de 15 pages, et doit citer un paragraphe de la page 9 sans le retaper à la main. Il lance l'OCR en choisissant « Extraire uniquement le texte (.txt) », puis copie le paragraphe directement depuis le fichier .txt obtenu au lieu de le transcrire mot à mot.

Comment la conversion fonctionne réellement

Cet outil charge Tesseract.js, un moteur OCR compilé en WebAssembly, directement dans l'onglet de votre navigateur, avec les données de langue dont il a besoin. Ces éléments sont téléchargés une seule fois (quelques mégaoctets) puis mis en cache localement. Chaque page de votre scan est dessinée sur un canevas, confiée au moteur WebAssembly et lue entièrement par le processeur de votre appareil : aucune image de page ni aucun texte reconnu n'est envoyé à un serveur. Selon votre choix, le résultat est soit les images de page d'origine avec une couche de texte invisible et sélectionnable (un PDF consultable), soit un fichier .txt de tout ce qui a été reconnu. Vous pouvez le vérifier vous-même : F12, onglet « Réseau », puis lancez l'OCR. Seul le moteur est téléchargé la première fois, jamais votre fichier.

À savoir avant de convertir

  • L'outil est nettement plus lent qu'un service OCR côté serveur, puisque c'est votre appareil, et non une ferme de serveurs, qui fait la reconnaissance : les scans longs ou de nombreuses pages peuvent prendre du temps.
  • La précision dépend de la qualité du scan : le texte imprimé net, droit et en haute résolution est bien lu, tandis que l'écriture manuscrite, les pages de travers ou les photos de téléphone en basse résolution donnent plus d'erreurs. C'est une limite de la technologie OCR en général, pas un dysfonctionnement de l'outil.
  • Au premier lancement, le moteur OCR et les données de langue (quelques mégaoctets) sont téléchargés avant que le traitement puisse commencer. Ensuite, ils sont mis en cache dans votre navigateur pour un usage plus rapide.
  • Un PDF protégé par mot de passe doit d'abord être déverrouillé, car le rendu des pages pour la reconnaissance exige d'ouvrir directement le fichier.
  • Avec « Extraire uniquement le texte (.txt) », vous obtenez un simple fichier texte sans la mise en page d'origine.

OCR PDF : ce que la reconnaissance de texte ne lit pas de façon fiable, vérifiez avant de faire confiance au résultat

  • Écriture manuscrite. Ce moteur est entraîné sur du texte imprimé. Une écriture cursive ou des notes manuscrites produiront une sortie illisible ou manquante, et non une transcription approximative.
  • Pages inclinées ou pivotées. Une page numérisée même légèrement de travers se lit moins bien qu'une page droite : faites-la d'abord pivoter avec Pivoter PDF si un scan est arrivé couché.
  • Photos à faible résolution ou à faible contraste. Une photo prise au téléphone en biais, avec une mauvaise lumière ou très compressée perd le détail des caractères dont l'OCR a besoin : un scan à plat se lit beaucoup plus précisément.
  • Langues autres que l'anglais. Cet outil ne charge actuellement que le modèle de langue anglais. Un texte dans une autre langue sera mal reconnu, voire pas du tout.
  • Tableaux complexes et mises en page à plusieurs colonnes. L'OCR lit bien le texte de gauche à droite et de haut en bas, mais la structure d'un tableau (quelle cellule appartient à quelle ligne) n'est pas conservée : attendez-vous à récupérer les mots, pas la mise en page.
  • Texte filigrané ou à faible contraste. Un texte qui chevauche un filigrane, un tampon ou une couleur de fond claire est plus difficile à séparer de la page qu'un texte noir net sur fond blanc.

Questions fréquentes

Mon fichier est-il envoyé quelque part pour lancer l'OCR ?+
Non. La reconnaissance s'exécute localement dans votre navigateur avec WebAssembly. Seuls le moteur OCR et le modèle de langue sont téléchargés (quelques mégaoctets, la première fois que vous utilisez l'outil), jamais votre document. Vous pouvez le vérifier dans l'onglet « Réseau » (F12).
Combien de temps prend la reconnaissance de texte ?+
La première fois, le moteur OCR est aussi téléchargé (quelques mégaoctets, une seule fois). Ensuite, la durée dépend du nombre de pages et de la qualité du scan : quelques pages passent vite, un scan long ou de mauvaise qualité peut prendre un moment. C'est le prix d'un traitement qui n'envoie jamais votre document.
La mise en page d'origine est-elle conservée ?+
Avec « En faire un PDF consultable », oui : les images de page restent inchangées et seule une couche de texte invisible est ajoutée derrière elles, pour sélectionner, rechercher et copier le texte. « Extraire uniquement le texte (.txt) » ignore le PDF et fournit un fichier texte brut.
Quelle est la fiabilité de la reconnaissance ?+
L'outil est conçu pour le texte imprimé et donne de très bons résultats sur des scans nets, bien éclairés et de résolution correcte. L'écriture manuscrite, les photos de travers ou le texte très petit dégradent le résultat : c'est une limite de l'OCR en général.
Puis-je récupérer seulement le texte brut ?+
Oui. Choisissez « Extraire uniquement le texte (.txt) » pour obtenir un fichier .txt de tout ce que le moteur OCR a pu lire, plutôt qu'un PDF consultable.
Faut-il utiliser OCR PDF ou PDF en texte ?+
Utilisez PDF en texte si vous pouvez déjà sélectionner et copier des mots dans un lecteur PDF : le fichier possède une vraie couche de texte et l'extraction est instantanée. Utilisez OCR PDF quand le PDF est un scan ou une photo de page et que vous ne pouvez pas surligner les mots.
OCR PDF gratuit en ligne : le fichier est-il envoyé ?+
Non. L'OCR est gratuit et tourne dans votre navigateur : le fichier n'est envoyé nulle part.

Outils associés