PDF-Text-Extraktor
Extrahieren Sie den reinen Text aus einem PDF direkt in Ihrem Browser — liest die eingebettete Textebene des Dokuments, kein Upload, kein OCR.
231 Aufrufe
Verarbeitung…
Das PDF konnte nicht gelesen werden — es könnte beschädigt oder passwortgeschützt sein.
Kein Text gefunden — dieses PDF könnte ein gescanntes Bild ohne eingebettete Textebene sein (dieses Werkzeug führt kein OCR durch).
Was die Textebene eines PDFs tatsächlich ist
Ein PDF ist nicht das Bild einer Seite — zumindest normalerweise nicht. Wird ein PDF aus einer Textverarbeitung, einer Webseite oder einer Satzsoftware erzeugt, wird der Seiteninhalt als Abfolge von Zeichenanweisungen gespeichert: „platziere Glyphe G an Position (x, y) mit Schriftart F in Größe S", wiederholt für jedes Zeichen auf der Seite. Jede dieser Glyphen-Platzierungsanweisungen trägt einen Verweis auf die Zeichenkodierungstabelle einer Schriftart, wodurch Software die gezeichnete Form auf ein tatsächliches Unicode-Zeichen zurückführen kann, statt nur auf das Bild eines solchen. Dieses Werkzeug funktioniert, indem es das PDF mit Mozillas Open-Source-Bibliothek pdf.js lädt und deren getTextContent()-API auf jeder Seite aufruft — entscheidend ist, dass dies den Anweisungsstrom direkt liest, ohne die Seite jemals zu Pixeln zu rendern, sodass es sogar auf einem Gerät ohne Grafikbeschleunigung funktioniert und im Vergleich zum Rendern nahezu augenblicklich läuft.
Das ist grundlegend anders als ein gescanntes PDF, das entsteht, wenn ein Papierdokument fotografiert oder eingescannt und als PDF gespeichert wird — in diesem Fall ist die „Seite" nur ein vollflächiges JPEG- oder TIFF-Bild ohne jegliche Glyphen-Anweisungen dahinter, weil keine Software jemals wusste, was der Text besagte; sie hat nur Pixel erfasst. Der Aufruf von getTextContent() auf einer gescannten Seite liefert nichts oder fast nichts zurück, weil es keine Textebene zu lesen gibt — die Information ist tatsächlich nicht in der Datei vorhanden, genauso wie Sie auf einer gescannten Seite in einem normalen PDF-Betrachter keinen Text markieren können. Text aus einem gescannten Dokument zu gewinnen, erfordert eine völlig andere Technik: OCR (optische Zeichenerkennung), die Pixelformen analysiert und Zeichen errät; das ist ein grundlegend anderer, deutlich fehleranfälligerer Prozess, den dieses Werkzeug nicht durchführt. Wenn Ihr PDF ein Scan ist, suchen Sie stattdessen nach einem dedizierten Bild-zu-Text-(OCR)-Werkzeug — eines ist auf dieser Website separat verfügbar.
Warum extrahierter Text durcheinandergeraten kann
Ein subtileres Problem betrifft selbst PDFs mit einer echten Textebene: getTextContent() gibt Glyphen-Platzierungselemente in der Reihenfolge zurück, in der sie ursprünglich bei der Erstellung des PDFs gezeichnet wurden — nicht notwendigerweise in der Reihenfolge, in der ein Mensch sie lesen würde. Die meisten einfachen, einspaltigen Dokumente werden von oben nach unten, von links nach rechts gezeichnet, was der natürlichen Lesereihenfolge entspricht, sodass die Extraktion korrekt erscheint. Ein PDF-Exporter kann Inhalte jedoch in beliebiger Reihenfolge zeichnen, und viele bewahren die visuelle Reihenfolge nicht: Ein zweispaltiger wissenschaftlicher Artikel, ein Zeitschriftenlayout, eine Tabelle oder ein PDF mit Textfeldern und Sprechblasen kann seine Zeichenreihenfolge leicht verschachtelt oder gegenüber der Blickbewegung eines Lesers über die Seite völlig umgekehrt haben, da die Spezifikation Position definiert, nicht Lesereihenfolge. Dieses Werkzeug verkettet die Elemente jeder Seite in der Reihenfolge, in der pdf.js sie meldet, und trennt Seiten mit einer klaren --- Seite N ----Markierung, sodass Sie genau sehen können, von welcher Seite jeder Block stammt, und ein mehrspaltiges Ergebnis bei Bedarf manuell neu anordnen können.
- Es wird nichts hochgeladen: Das PDF wird vollständig clientseitig mit pdf.js analysiert, das in Ihrem Browser läuft; die Datei erreicht niemals den Server dieser Website.
- Passwortgeschützte PDFs lassen sich nicht öffnen - dieses Werkzeug versucht nicht, PDF-Verschlüsselung oder -Berechtigungen zu umgehen.
- Der extrahierte Abstand kann vom visuellen Layout abweichen - insbesondere Tabellen werden oft als flache Folge von Zellenwerten statt als formatiertes Raster extrahiert, da PDF kein natives Konzept für eine „Tabelle" hat, wie es HTML hat.
- Mehrseitige Dokumente erhalten Seitenmarkierungen, sodass Sie erkennen können, wo der Inhalt einer Seite endet und der nächste beginnt, da PDF-Seiten ansonsten unabhängige Inhaltsströme ohne inhärenten Absatzumbruch zwischen ihnen sind.
Häufig gestellte Fragen
Warum habe ich ein leeres oder fast leeres Ergebnis erhalten?
Ihr PDF ist sehr wahrscheinlich ein gescanntes Bild - ein Foto oder Scan einer Papierseite, als PDF gespeichert ohne eingebetteten Text, nur ein Bild. Dieses Werkzeug liest die Textebene des PDFs direkt und führt kein OCR (optische Zeichenerkennung) durch, sodass eine gescannte Seite ohne Textebene nichts zum Lesen zurückgibt.
Warum ist der extrahierte Text bei einem zweispaltigen PDF durcheinander?
PDF speichert Inhalte als Zeichenanweisungen in der von der exportierenden Software gewählten Reihenfolge, die nicht garantiert der visuellen Lesereihenfolge entspricht. Ein zweispaltiges Layout, eine Tabelle oder eine zeitschriftenartige Seite kann Text aus beiden Spalten verschachteln, weil das Dateiformat Glyphenpositionen definiert, keine Lesereihenfolge.
Führt dieses Werkzeug OCR bei gescannten Dokumenten durch?
Nein. Dieses Werkzeug liest nur die bereits vorhandene eingebettete Textebene eines PDFs über die getTextContent()-API von pdf.js - es analysiert keine Pixel und erkennt keine Zeichen in einem Bild. Für gescannte Dokumente ohne Textebene ist ein Bild-zu-Text-(OCR)-Werkzeug eine separate, andere Technologie.
Wird mein PDF auf einen Server hochgeladen?
Nein - die gesamte Extraktion erfolgt in Ihrem Browser mit der Open-Source-Bibliothek pdf.js. Die Datei wird lokal über die File-API gelesen und niemals irgendwohin übertragen.
Warum hat die Ausgabe „--- Seite N ---"-Markierungen?
Jede PDF-Seite ist ein separater Inhaltsstrom mit eigenen Textelementen ohne inhärente Verbindung zur nächsten Seite. Die Seitenmarkierungen machen deutlich, wo der extrahierte Text einer Seite endet und der nächste beginnt, was für Dokumente wichtig ist, in denen Absätze oder Sätze über einen Seitenumbruch hinweg fortgesetzt werden.
Ähnliche Tools
Problem melden
PDF-Text-Extraktor
Kommentare
Noch keine Kommentare — schreiben Sie den ersten!