Bild zu Text (OCR)

Extrahieren Sie Text aus einem Foto oder gescannten Bild direkt in Ihrem Browser mittels optischer Zeichenerkennung — kein Upload, funktioniert nach dem Laden auch offline.

243 Aufrufe

Dieses Werkzeug ist für Fotos und gescannte Bilder gedacht, nicht für ein PDF, das bereits eine eingebettete Textebene hat. Für ein PDF mit echtem Text darin verwenden Sie stattdessen das Werkzeug „PDF-Text-Extraktor".

Wie ein Browser ein Foto tatsächlich „lesen" kann

Optische Zeichenerkennung (OCR) ist der Prozess, bei dem Pixel, die visuell wie Buchstaben aussehen, in echten, auswählbaren Unicode-Text umgewandelt werden, und das war traditionell eine serverseitige Aufgabe, gerade weil sie rechenintensiv ist. Dieses Werkzeug führt Tesseract aus — ursprünglich in den 1980er-Jahren bei HP Labs entwickelt, später als Open Source veröffentlicht und von Google gepflegt, weithin als eine der genauesten verfügbaren Open-Source-OCR-Engines angesehen — kompiliert zu WebAssembly, einem binären Anweisungsformat, das C++-Code nahezu mit nativer Geschwindigkeit im Browser ausführen lässt. Genau dieser Kompilierungsschritt macht dies ohne Server möglich: dieselbe Erkennungs-Engine, die in vielen Desktop- und mobilen Scan-Apps verwendet wird, läuft lokal auf Ihrem Gerät.

Modernes Tesseract (Version 4 und höher) erkennt Text mithilfe eines LSTM-neuronalen Netzwerks (Long Short-Term Memory, eine Art rekurrentes neuronales Netzwerk, das gut für sequenzielle Daten geeignet ist) anstelle des älteren zeichenweisen Mustervergleichs, der in Tesseract 3 und früher verwendet wurde. Statt zu versuchen, jeweils einen Buchstaben zu isolieren und zu klassifizieren, liest das LSTM-Modell eine ganze Zeile als Sequenz und nutzt den umgebenden Kontext, um mehrdeutige Formen aufzulösen — deshalb kann es ein „l" viel zuverlässiger von einer „1" oder ein „O" von einer „0" unterscheiden als ältere Engines, da es effektiv vorhersagt, „welches Wort hier sinnvoll ist", statt Formen nur isoliert abzugleichen.

Die Erkennungsqualität hängt stark vom geladenen Sprachmodell ab: Dieses Werkzeug lädt bei der ersten Verwendung eine trainierte Modelldatei für die ausgewählte Sprache (Englisch oder Türkisch) herunter, die die statistischen Muster der Buchstabenformen, häufigen Buchstabenfolgen und des Wörterbuchs dieser Sprache enthält. Die richtige Sprache vor dem Scannen auszuwählen, verbessert die Genauigkeit spürbar, da ein auf Türkisch trainiertes Modell türkischspezifische Zeichen (ç, ğ, ı, ö, ş, ü) weitaus besser verarbeitet als ein reines Englisch-Modell.

Da das Sprachmodell einen spürbaren Download (mehrere Megabyte) darstellt, speichert der Browser es nach der ersten Nutzung im Cache, sodass spätere Scans in derselben Sprache merklich schneller starten, ohne es erneut abrufen zu müssen.

Bessere Ergebnisse erzielen

  • Scharfe, gut beleuchtete, kontrastreiche Fotos funktionieren weitaus besser als unscharfe oder schlecht beleuchtete — die OCR-Qualität folgt eng der Bildqualität, da das neuronale Netzwerk mit denselben Pixeln arbeitet, an denen sich auch ein menschliches Auge abmühen würde.
  • Ein gerades, nicht gedrehtes Foto wird zuverlässiger erkannt als ein in einem steilen Winkel aufgenommenes, auch wenn die Engine eine gewisse automatische Entzerrung vornimmt.
  • Handschrift ist für diese Engine grundsätzlich schwieriger als gedruckter Text - Tesseract wurde vorwiegend auf gedruckten Schriften trainiert, und Schreibschrift oder stark stilisierte Handschrift führt zu deutlich geringerer Genauigkeit.
  • Dies ist ein anderes Werkzeug als die PDF-Textextraktion auf dieser Seite: Dieses hier führt echte Zeichenerkennung auf Pixeln durch, während das PDF-Werkzeug bereits als auswählbaren Text in der Datei eingebetteten Text liest - verwenden Sie OCR nur, wenn keine echte Textebene zum Lesen vorhanden ist.

Häufig gestellte Fragen

Wie kann Texterkennung ohne Server im Browser laufen?

Die Tesseract-OCR-Engine, ursprünglich bei HP Labs entwickelt und heute von Google gepflegt, ist zu WebAssembly kompiliert - einem binären Format, das C++-Code nahezu mit nativer Geschwindigkeit im Browser ausführt. Das macht vollständige optische Zeichenerkennung vollständig auf Ihrem Gerät möglich.

Warum ist die Wahl der richtigen Sprache wichtig?

Jede Sprache lädt ihre eigene trainierte Modelldatei mit den statistischen Mustern der Buchstabenformen, häufigen Sequenzen und des Wörterbuchs dieser Sprache herunter. Ein auf Türkisch trainiertes Modell erkennt türkischspezifische Zeichen wie ç, ğ, ı, ö, ş, ü weitaus genauer als ein reines Englisch-Modell.

Warum wird meine Handschrift schlechter erkannt als gedruckter Text?

Das neuronale Netzwerk von Tesseract wurde vorwiegend auf gedruckten Schriften trainiert. Sein LSTM-Modell liest Text als Sequenz und nutzt Kontext, um mehrdeutige Formen aufzulösen, was für konsistente gedruckte Buchstabenformen sehr gut funktioniert, aber bei der hohen Variabilität von Schreibschrift oder stilisierter Handschrift an Grenzen stößt.

Wird mein Bild auf einen Server hochgeladen?

Nein. Die Erkennung läuft vollständig in Ihrem Browser über WebAssembly - das Bild wird niemals irgendwohin übertragen. Nur die Sprachmodelldatei selbst wird einmal heruntergeladen (und dann zwischengespeichert), damit die Engine über die benötigten trainierten Daten verfügt.

Was ist der Unterschied zwischen diesem Werkzeug und dem PDF-Textextraktions-Werkzeug?

Dieses Werkzeug führt echte optische Zeichenerkennung auf Pixeln durch - es funktioniert bei Fotos und gescannten Bildern ohne zugrunde liegenden Text. Der PDF-Textextraktor liest stattdessen Text, der bereits als auswählbarer, eingebetteter Text in einem PDF gespeichert ist, was ein völlig anderer (und viel schnellerer, genauerer) Vorgang ist, wenn diese Textebene vorhanden ist.

Kommentare

Noch keine Kommentare — schreiben Sie den ersten!

Ähnliche Tools