Extracteur de Texte PDF
Extrayez le texte brut d'un PDF directement dans votre navigateur — lit la couche de texte intégrée du document, aucun envoi, aucun OCR.
233 vues
Traitement en cours…
Impossible de lire le PDF — le fichier est peut-être corrompu ou protégé par mot de passe.
Aucun texte trouvé — ce PDF est peut-être une image numérisée sans couche de texte intégrée (cet outil n'effectue pas d'OCR).
Ce Qu'est Réellement la Couche de Texte d'un PDF
Un PDF n'est pas une image d'une page - du moins, pas habituellement. Lorsqu'un PDF est produit à partir d'un traitement de texte, d'une page web ou d'un logiciel de composition, le contenu de la page est stocké comme une séquence d'instructions de dessin : « placer le glyphe G à la position (x, y) avec la police F à la taille S », répétée pour chaque caractère de la page. Chacune de ces instructions de placement de glyphe porte une référence vers la table d'encodage des caractères d'une police, ce qui permet au logiciel de faire correspondre la forme dessinée à un véritable caractère Unicode plutôt qu'à une simple image de celui-ci. Cet outil fonctionne en chargeant le PDF avec la bibliothèque open source pdf.js de Mozilla et en appelant son API getTextContent() sur chaque page - point essentiel, cela lit directement ce flux d'instructions, sans jamais restituer la page en pixels, ce qui fonctionne même sur un appareil sans accélération graphique et s'exécute presque instantanément comparé au rendu.
Ceci est fondamentalement différent d'un PDF numérisé, ce que vous obtenez lorsqu'un document papier est photographié ou passé au scanner puis enregistré en PDF - dans ce cas, la « page » n'est qu'une image JPEG ou TIFF pleine page sans aucune instruction de glyphe derrière elle, car aucun logiciel n'a jamais su ce que disait le texte ; il n'a capturé que des pixels. Appeler getTextContent() sur une page numérisée ne renvoie rien, ou presque rien, car il n'y a pas de couche de texte à lire - l'information n'est réellement pas présente dans le fichier, de la même manière que vous ne pouvez pas sélectionner de texte sur une page numérisée dans une visionneuse PDF normale. Récupérer du texte à partir d'un document numérisé nécessite une technique complètement différente, l'OCR (reconnaissance optique de caractères), qui analyse les formes des pixels et devine les caractères ; c'est un processus fondamentalement différent, bien plus sujet aux erreurs, que cet outil n'effectue pas. Si votre PDF est une numérisation, cherchez plutôt un outil dédié image-vers-texte (OCR) - un tel outil est prévu séparément sur ce site.
Pourquoi le Texte Extrait Peut Sortir dans le Désordre
Un problème plus subtil affecte même les PDF qui possèdent une véritable couche de texte : getTextContent() renvoie les éléments de placement de glyphe dans l'ordre où ils ont été originellement dessinés lors de la génération du PDF - pas nécessairement l'ordre dans lequel un humain les lirait. La plupart des documents simples à colonne unique sont dessinés de haut en bas, de gauche à droite, correspondant à l'ordre de lecture naturel, donc l'extraction semble correcte. Mais un exportateur PDF est libre de dessiner le contenu dans n'importe quel ordre qu'il choisit, et beaucoup ne préservent pas l'ordre visuel : un article académique à deux colonnes, une mise en page de magazine, un tableau, ou un PDF avec des zones de texte et des légendes peuvent facilement avoir leur ordre de dessin entrelacé ou complètement inversé par rapport à la façon dont l'œil d'un lecteur se déplacerait sur la page, car la spécification définit la position, pas la séquence de lecture. Cet outil concatène les éléments de chaque page dans l'ordre où pdf.js les rapporte et sépare les pages avec un marqueur clair --- Page N --- afin que vous puissiez voir exactement de quelle page provient chaque bloc et réordonner manuellement un résultat multi-colonnes si nécessaire.
- Rien n'est téléversé : le PDF est analysé entièrement côté client à l'aide de pdf.js s'exécutant dans votre navigateur ; le fichier n'atteint jamais le serveur de ce site.
- Les PDF protégés par mot de passe ne pourront pas s'ouvrir - cet outil ne tente pas de contourner le chiffrement ou les permissions du PDF.
- L'espacement extrait peut différer de la mise en page visuelle - les tableaux en particulier sont souvent extraits comme une séquence plate de valeurs de cellules plutôt qu'une grille formatée, car le PDF n'a pas de concept natif de « tableau » comme le fait le HTML.
- Les documents multi-pages reçoivent des marqueurs de page afin que vous puissiez distinguer où se termine le contenu d'une page et où commence la suivante, car les pages PDF sont sinon des flux de contenu indépendants sans saut de paragraphe inhérent entre elles.
Questions fréquentes
Pourquoi ai-je obtenu un résultat vide ou presque vide ?
Votre PDF est très probablement une image numérisée - une photographie ou un scan d'une page papier enregistrée en PDF sans texte intégré, juste une image. Cet outil lit directement la couche de texte du PDF et n'effectue pas d'OCR (reconnaissance optique de caractères), donc une page numérisée sans couche de texte ne renvoie rien à lire.
Pourquoi le texte extrait est-il dans le désordre dans un PDF à deux colonnes ?
Le PDF stocke le contenu comme des instructions de dessin dans l'ordre choisi par le logiciel exportateur, ce qui n'est pas garanti de correspondre à l'ordre de lecture visuel. Une mise en page à deux colonnes, un tableau, ou une page de type magazine peuvent entrelacer le texte des deux colonnes car le format de fichier définit des positions de glyphes, pas une séquence de lecture.
Cet outil effectue-t-il de l'OCR sur les documents numérisés ?
Non. Cet outil lit uniquement la couche de texte intégrée déjà existante d'un PDF via l'API getTextContent() de pdf.js - il n'analyse pas les pixels ni ne reconnaît les caractères dans une image. Pour les documents numérisés sans couche de texte, un outil image-vers-texte (OCR) est une technologie séparée et différente.
Mon PDF est-il téléversé sur un serveur ?
Non - l'extraction entière se déroule dans votre navigateur à l'aide de la bibliothèque open source pdf.js. Le fichier est lu localement via l'API File et n'est jamais transmis nulle part.
Pourquoi la sortie comporte-t-elle des marqueurs « --- Page N --- » ?
Chaque page PDF est un flux de contenu distinct avec ses propres éléments de texte et aucune connexion inhérente avec la page suivante. Les marqueurs de page indiquent clairement où se termine le texte extrait d'une page et où commence le suivant, ce qui compte pour les documents où des paragraphes ou des phrases se poursuivent au-delà d'un saut de page.
Outils similaires
Signaler un problème
Extracteur de Texte PDF
Commentaires
Pas encore de commentaires — soyez le premier à en écrire un !