OCR PDF : reconnaissance de texte
Transformez un document scanné en PDF consultable, ou extrayez son texte brut, avec un moteur OCR qui tourne entièrement sur votre appareil. La plupart des outils OCR gratuits envoient votre scan sur un serveur pour le lire : pas celui-ci.

Votre fichier ne quitte pas votre appareil. Il n'est pas copié sur un serveur, ni mis en cache, ni supprimé au bout d'une heure. Chaque outil de ce site fonctionne en JavaScript, directement dans l'onglet que vous avez ouvert.
Déposez votre fichier ici ou cliquez pour le choisir
Pourquoi utiliser « OCR PDF » plutôt qu'un logiciel de bureau ?
- L'OCR s'exécute entièrement dans votre navigateur grâce à WebAssembly : votre document scanné n'est jamais envoyé sur un serveur pour être lu, contrairement à la plupart des outils OCR gratuits.
- Choisissez un PDF consultable (l'image scannée d'origine est conservée, avec une couche de texte invisible que vous pouvez sélectionner et rechercher) ou un simple fichier .txt si seuls les mots vous intéressent.
- Compromis assumé : l'OCR dans le navigateur est réellement plus lent qu'une ferme de serveurs, surtout sur des scans longs ou de mauvaise qualité, mais rien de votre document ne quitte votre appareil pour y arriver.
- Gratuit, sans limite de pages imposée par nous et sans filigrane sur le résultat.
OCR PDF : mode d'emploi, étape par étape
1Choisissez le PDF
Déposez le PDF scanné dans l'outil, ou cliquez pour le choisir. Le scan reste sur votre appareil.
2Choisissez le résultat
Répondez à « Que voulez-vous faire du texte reconnu ? » : « En faire un PDF consultable » ou « Extraire uniquement le texte (.txt) ».
3Lancez l'OCR
Cliquez sur « Lancer l'OCR » et patientez pendant la lecture de chaque page : plus de pages signifie plus de temps, puisque votre appareil fait le travail.
4Téléchargez
Téléchargez le résultat : un PDF consultable ou un fichier .txt, selon votre choix.
Dans quels cas c'est utile
Un chercheur ne possède qu'un PDF scanné à plat d'un article de revue de 15 pages, et doit citer un paragraphe de la page 9 sans le retaper à la main. Il lance l'OCR en choisissant « Extraire uniquement le texte (.txt) », puis copie le paragraphe directement depuis le fichier .txt obtenu au lieu de le transcrire mot à mot.
Comment la conversion fonctionne réellement
Cet outil charge Tesseract.js, un moteur OCR compilé en WebAssembly, directement dans l'onglet de votre navigateur, avec les données de langue dont il a besoin. Ces éléments sont téléchargés une seule fois (quelques mégaoctets) puis mis en cache localement. Chaque page de votre scan est dessinée sur un canevas, confiée au moteur WebAssembly et lue entièrement par le processeur de votre appareil : aucune image de page ni aucun texte reconnu n'est envoyé à un serveur. Selon votre choix, le résultat est soit les images de page d'origine avec une couche de texte invisible et sélectionnable (un PDF consultable), soit un fichier .txt de tout ce qui a été reconnu. Vous pouvez le vérifier vous-même : F12, onglet « Réseau », puis lancez l'OCR. Seul le moteur est téléchargé la première fois, jamais votre fichier.
À savoir avant de convertir
- L'outil est nettement plus lent qu'un service OCR côté serveur, puisque c'est votre appareil, et non une ferme de serveurs, qui fait la reconnaissance : les scans longs ou de nombreuses pages peuvent prendre du temps.
- La précision dépend de la qualité du scan : le texte imprimé net, droit et en haute résolution est bien lu, tandis que l'écriture manuscrite, les pages de travers ou les photos de téléphone en basse résolution donnent plus d'erreurs. C'est une limite de la technologie OCR en général, pas un dysfonctionnement de l'outil.
- Au premier lancement, le moteur OCR et les données de langue (quelques mégaoctets) sont téléchargés avant que le traitement puisse commencer. Ensuite, ils sont mis en cache dans votre navigateur pour un usage plus rapide.
- Un PDF protégé par mot de passe doit d'abord être déverrouillé, car le rendu des pages pour la reconnaissance exige d'ouvrir directement le fichier.
- Avec « Extraire uniquement le texte (.txt) », vous obtenez un simple fichier texte sans la mise en page d'origine.
OCR PDF : ce que la reconnaissance de texte ne lit pas de façon fiable, vérifiez avant de faire confiance au résultat
- Écriture manuscrite. Ce moteur est entraîné sur du texte imprimé. Une écriture cursive ou des notes manuscrites produiront une sortie illisible ou manquante, et non une transcription approximative.
- Pages inclinées ou pivotées. Une page numérisée même légèrement de travers se lit moins bien qu'une page droite : faites-la d'abord pivoter avec Pivoter PDF si un scan est arrivé couché.
- Photos à faible résolution ou à faible contraste. Une photo prise au téléphone en biais, avec une mauvaise lumière ou très compressée perd le détail des caractères dont l'OCR a besoin : un scan à plat se lit beaucoup plus précisément.
- Langues autres que l'anglais. Cet outil ne charge actuellement que le modèle de langue anglais. Un texte dans une autre langue sera mal reconnu, voire pas du tout.
- Tableaux complexes et mises en page à plusieurs colonnes. L'OCR lit bien le texte de gauche à droite et de haut en bas, mais la structure d'un tableau (quelle cellule appartient à quelle ligne) n'est pas conservée : attendez-vous à récupérer les mots, pas la mise en page.
- Texte filigrané ou à faible contraste. Un texte qui chevauche un filigrane, un tampon ou une couleur de fond claire est plus difficile à séparer de la page qu'un texte noir net sur fond blanc.