Image vers Texte (OCR)

Extrayez le texte d'une photo ou d'une image numérisée directement dans votre navigateur grâce à la reconnaissance optique de caractères — aucun envoi, fonctionne hors ligne une fois chargé.

248 vues

Cet outil est destiné aux photos et images numérisées, pas à un PDF qui possède déjà une couche de texte intégrée. Pour un PDF contenant du vrai texte, utilisez plutôt l'outil « Extracteur de Texte PDF ».

Comment un Navigateur Peut Vraiment « Lire » une Photo

La reconnaissance optique de caractères (OCR) est le processus qui transforme des pixels ressemblant visuellement à des lettres en véritable texte Unicode sélectionnable, et cela a traditionnellement été un travail côté serveur précisément parce que c'est lourd en calcul. Cet outil exécute Tesseract — développé à l'origine chez HP Labs dans les années 1980, puis passé en open source et maintenu par Google, largement considéré comme l'un des moteurs OCR open source les plus précis disponibles — compilé en WebAssembly, un format d'instructions binaires qui permet au code C++ de s'exécuter dans le navigateur à une vitesse proche du natif. C'est cette étape de compilation qui rend cela possible sans serveur : exactement le même moteur de reconnaissance utilisé dans de nombreuses applications de numérisation de bureau et mobiles s'exécute localement sur votre appareil.

Le Tesseract moderne (version 4 et ultérieures) reconnaît le texte à l'aide d'un réseau neuronal LSTM (Long Short-Term Memory, un type de réseau neuronal récurrent bien adapté aux données séquentielles) plutôt que l'ancienne reconnaissance de motifs caractère par caractère utilisée dans Tesseract 3 et les versions antérieures. Au lieu d'essayer d'isoler et de classer une lettre à la fois, le modèle LSTM lit une ligne entière comme une séquence, en utilisant le contexte environnant pour résoudre les formes ambiguës — c'est pourquoi il peut distinguer correctement un « l » d'un « 1 » ou un « O » d'un « 0 » de manière bien plus fiable que les anciens moteurs, car il prédit en réalité « quel mot a du sens ici », pas seulement en faisant correspondre des formes isolément.

La qualité de la reconnaissance dépend fortement du modèle de langue chargé : cet outil télécharge un fichier de modèle entraîné spécifique à la langue sélectionnée (anglais ou turc) lors de la première utilisation, contenant les motifs statistiques des formes de lettres, des séquences de lettres courantes et du dictionnaire de cette langue. Sélectionner la bonne langue avant la numérisation améliore sensiblement la précision, car un modèle entraîné sur du texte turc gère bien mieux les caractères spécifiques au turc (ç, ğ, ı, ö, ş, ü) qu'un modèle uniquement anglais.

Comme le modèle de langue représente un téléchargement conséquent (plusieurs mégaoctets), le navigateur le met en cache après la première utilisation, de sorte que les numérisations suivantes dans la même langue démarrent nettement plus vite sans avoir besoin de le retélécharger.

Obtenir de Meilleurs Résultats

  • Des photos nettes, bien éclairées et à fort contraste fonctionnent bien mieux que des photos floues ou en faible lumière — la qualité de l'OCR suit de près la qualité de l'image, car le réseau neuronal travaille à partir des mêmes pixels qu'un œil humain aurait du mal à déchiffrer.
  • Une photo droite et non tournée est reconnue plus fiablement qu'une photo prise sous un angle prononcé, même si le moteur applique un certain redressement automatique.
  • L'écriture manuscrite est fondamentalement plus difficile que le texte imprimé pour ce moteur - Tesseract a été entraîné principalement sur des polices imprimées, et une écriture cursive ou très stylisée produira une précision nettement plus faible.
  • Il s'agit d'un outil différent de l'extraction de texte PDF de ce site : celui-ci effectue une véritable reconnaissance de caractères sur des pixels, tandis que l'outil PDF lit un texte déjà intégré sous forme sélectionnable dans le fichier - n'utilisez l'OCR que lorsqu'il n'existe pas de véritable couche de texte à lire.

Questions fréquentes

Comment la reconnaissance de texte peut-elle fonctionner dans un navigateur sans serveur ?

Le moteur OCR Tesseract, développé à l'origine chez HP Labs et maintenant maintenu par Google, est compilé en WebAssembly - un format binaire qui exécute du code C++ dans le navigateur à une vitesse proche du natif. C'est ce qui rend possible une reconnaissance optique de caractères complète entièrement sur votre appareil.

Pourquoi le choix de la bonne langue est-il important ?

Chaque langue télécharge son propre fichier de modèle entraîné contenant les motifs statistiques des formes de lettres, des séquences courantes et du dictionnaire de cette langue. Un modèle entraîné sur le turc reconnaît des caractères spécifiques au turc comme ç, ğ, ı, ö, ş, ü bien plus précisément qu'un modèle uniquement anglais.

Pourquoi mon écriture manuscrite est-elle mal reconnue par rapport au texte imprimé ?

Le réseau neuronal de Tesseract a été entraîné principalement sur des polices imprimées. Son modèle LSTM lit le texte comme une séquence et utilise le contexte pour résoudre les formes ambiguës, ce qui fonctionne très bien pour des formes de lettres imprimées cohérentes mais peine face à la grande variabilité de l'écriture cursive ou stylisée.

Mon image est-elle envoyée à un serveur ?

Non. La reconnaissance s'exécute entièrement dans votre navigateur via WebAssembly - l'image n'est jamais transmise nulle part. Seul le fichier du modèle de langue lui-même est téléchargé une fois (puis mis en cache) afin que le moteur dispose des données entraînées dont il a besoin.

Quelle est la différence entre cet outil et l'outil d'extraction de texte PDF ?

Cet outil effectue une véritable reconnaissance optique de caractères sur des pixels - il fonctionne sur des photos et des images numérisées sans texte sous-jacent. L'extracteur de texte PDF lit quant à lui un texte déjà stocké comme texte intégré et sélectionnable dans un PDF, ce qui est une opération complètement différente (et bien plus rapide et précise) lorsque cette couche de texte existe.

Commentaires

Pas encore de commentaires — soyez le premier à en écrire un !

Outils similaires