EasyPDFLoad

Convertir un PDF en texte

Récupérez le texte déjà sélectionnable d'un PDF dans un simple fichier .txt que vous pouvez copier, rechercher ou coller ailleurs. L'outil lit la couche de texte déjà présente dans le document : ce n'est pas de l'OCR, c'est donc rapide, et rien n'est envoyé.

Outil PDF en texte : texte extrait d'un PDF, avec les boutons Télécharger le .txt et Copier le texte

Votre fichier ne quitte pas votre appareil. Il n'est pas copié sur un serveur, ni mis en cache, ni supprimé au bout d'une heure. Chaque outil de ce site fonctionne en JavaScript, directement dans l'onglet que vous avez ouvert.

↑

Déposez votre fichier ici ou cliquez pour le choisir

Extrait le texte déjà sélectionnable du PDF. Pour un scan, utilisez plutôt OCR PDF.

Pourquoi utiliser « PDF en texte » plutôt qu'un logiciel de bureau ?

  • Convertissez un PDF en texte en ligne gratuitement, sans envoyer le fichier à un serveur de conversion.
  • Instantané pour les documents qui ont déjà une couche de texte (exports de Word ou de Google Docs) : pas d'attente d'OCR.
  • L'extraction se fait dans votre navigateur : un contrat ou un relevé n'est envoyé nulle part juste pour en copier les mots.
  • Gratuit, sans inscription, et sans filigrane (un texte brut n'en reçoit de toute façon pas).

PDF en texte : mode d'emploi, étape par étape

  1. Colorful PDF files dropping onto a dashed upload area labeled drop PDFs — AI-generated illustration, EasyPDFLoad1

    Choisissez le PDF

    Déposez dans l'outil un PDF dont le texte est déjà sélectionnable, ou cliquez pour le choisir. Il reste sur votre appareil.

  2. Laptop browser processing PDF files on the device with an unused cloud icon in the background — AI-generated illustration, EasyPDFLoad2

    Patientez

    Patientez un instant pendant que la couche de texte de chaque page est lue dans cet onglet.

  3. Text flowing out of a PDF document onto a plain text page — AI-generated illustration, EasyPDFLoad3

    Vérifiez

    Relisez le texte extrait. Modifiez-le dans le champ si vous voulez corriger une ligne avant l'enregistrement.

  4. Finished PDF with a green checkmark ready to download from the browser — AI-generated illustration, EasyPDFLoad4

    Téléchargez

    Cliquez sur « Télécharger le .txt », ou sur « Copier le texte » pour le placer dans le presse-papiers.

Dans quels cas c'est utile

Un chercheur possède un PDF de 40 pages de comptes rendus de réunion, exporté depuis Word, et a besoin du texte dans une application de notes qui n'ouvre pas les PDF. Il dépose le fichier, copie le texte extrait et le colle, ou télécharge le .txt si l'application préfère un fichier. Si le PDF avait été une photo de ces comptes rendus prise avec un téléphone, l'outil aurait renvoyé un résultat presque vide et OCR PDF aurait été la bonne étape suivante.

Comment la conversion fonctionne réellement

pdf.js ouvre le fichier dans cet onglet et lit la couche de texte existante de chaque page, c'est-à-dire le contenu qu'un lecteur PDF utilise quand vous sélectionnez et copiez. Les éléments sont regroupés en lignes selon leur position sur la page pour que le .txt garde un ordre de lecture approximatif, puis assemblés avec des séparateurs de page. Rien n'est converti en image et aucun moteur OCR n'est chargé : si le PDF n'a pas de couche de texte, le résultat est vide (ou presque) et l'outil vous oriente vers OCR PDF. Rien n'est envoyé à un serveur : F12, onglet « Réseau », puis extrayez, aucune requête ne part avec votre fichier. Fermez l'onglet, et le texte extrait disparaît de la mémoire avec le fichier.

À savoir avant de convertir

  • L'outil ne lit pas les scans ni les photos de pages. Si vous ne pouvez pas sélectionner de texte dans un lecteur PDF normal, utilisez OCR PDF.
  • Les mises en page complexes (articles en colonnes, tableaux, notes de bas de page) sont aplaties en lignes dans l'ordre de lecture : l'ordre des colonnes peut parfois se mélanger si les objets texte d'origine ne sont pas stockés de gauche à droite.
  • Un texte masqué ou rogné qu'un lecteur PDF n'afficherait pas peut tout de même apparaître s'il existe dans la couche de texte.
  • Un fichier protégé par mot de passe doit d'abord être déverrouillé, car l'extraction exige d'ouvrir le document.
  • Le style du texte (gras, taille, couleur) n'est pas conservé : le résultat est du texte brut.

Questions fréquentes

Quelle différence entre PDF en texte et OCR ?+
PDF en texte copie les mots déjà stockés dans le fichier, sous forme de couche de texte. L'OCR regarde la page comme une image et essaie de la lire. Si vous pouvez surligner du texte dans un lecteur PDF, utilisez cet outil. Sinon (scan, photo), utilisez OCR PDF.
Mon fichier est-il envoyé quelque part ?+
Non. pdf.js lit la couche de texte entièrement dans votre navigateur : le fichier ne quitte pas votre appareil. Vous pouvez le vérifier dans l'onglet « Réseau » des outils de développement (F12) pendant l'extraction.
Pourquoi le résultat est-il vide ou presque vide pour certains PDF ?+
Le PDF est probablement un scan : il n'a pas de couche de texte, donc il n'y a rien à extraire, et ce n'est pas un bug. Lancez OCR PDF pour lire les images de page et obtenir du texte (ou un PDF consultable).
Puis-je modifier le texte avant de l'enregistrer ?+
Oui, le résultat extrait apparaît dans un champ modifiable : corrigez une ligne si besoin, puis téléchargez ou copiez.
Sous quel format est-ce que je récupère le texte ?+
Sous forme de fichier .txt, ou vous pouvez le copier directement dans le presse-papiers avec « Copier le texte ».
Le .txt conserve-t-il les numéros de page et les titres ?+
Chaque page est marquée d'un séparateur « --- Page N --- » pour repérer les changements de page. Les titres sont inclus s'ils étaient du vrai texte dans le PDF, mais le style (gras, taille, couleur) n'est pas conservé.

Outils associés

Guides associés