PDF-tekst Extractor
Haal de platte tekst rechtstreeks uit een PDF in uw browser — leest de ingebedde tekstlaag van het document, geen upload, geen OCR.
230 weergaven
Verwerken…
Kon de PDF niet lezen — deze kan beschadigd of met een wachtwoord beveiligd zijn.
Geen tekst gevonden — deze PDF is mogelijk een gescande afbeelding zonder ingebedde tekstlaag (deze tool voert geen OCR uit).
Wat de Tekstlaag van een PDF Eigenlijk Is
Een PDF is geen afbeelding van een pagina — althans, meestal niet. Wanneer een PDF wordt geproduceerd vanuit een tekstverwerker, een webpagina of zetsoftware, wordt de pagina-inhoud opgeslagen als een reeks tekeninstructies: "plaats glyph G op positie (x, y) met lettertype F op grootte S," herhaald voor elk teken op de pagina. Elk van die glyph-plaatsingsinstructies draagt een verwijzing terug naar de tekencoderingstabel van een lettertype, wat de manier is waarop software de getekende vorm kan terugmappen naar een echt Unicode-teken in plaats van slechts een afbeelding daarvan. Deze tool werkt door de PDF te laden met de opensource-bibliotheek pdf.js van Mozilla en de getTextContent()-API ervan op elke pagina aan te roepen — cruciaal is dat dit die instructiestroom rechtstreeks leest, zonder de pagina ooit naar pixels te renderen, dus het werkt zelfs op een apparaat zonder grafische versnelling en draait bijna direct in vergelijking met renderen.
Dit is fundamenteel anders dan een gescande PDF, wat u krijgt wanneer een papieren document wordt gefotografeerd of door een scanner gehaald en als PDF wordt opgeslagen — in dat geval is de "pagina" gewoon een volledige JPEG- of TIFF-afbeelding zonder enige glyph-instructies erachter, omdat geen enkele software ooit wist wat de tekst zei; er werden alleen pixels vastgelegd. Het aanroepen van getTextContent() op een gescande pagina levert niets of vrijwel niets op, omdat er geen tekstlaag is om te lezen — de informatie is werkelijk niet aanwezig in het bestand, op dezelfde manier waarop u geen tekst kunt selecteren op een gescande pagina in een normale PDF-viewer. Tekst terugwinnen uit een gescand document vereist een compleet andere techniek, OCR (optische tekenherkenning), die de pixelvormen analyseert en tekens raadt; dat is een fundamenteel ander, veel foutgevoeliger proces dat deze tool niet uitvoert. Als uw PDF een scan is, kijk dan in plaats daarvan naar een speciale afbeelding-naar-tekst (OCR)-tool — er is er apart een gepland op deze site.
Waarom Geëxtraheerde Tekst Uit Volgorde Kan Komen
Een subtieler probleem treft zelfs PDF's die wel een echte tekstlaag hebben: getTextContent() geeft glyph-plaatsingsitems terug in welke volgorde ze oorspronkelijk werden getekend toen de PDF werd gegenereerd — niet noodzakelijk de volgorde waarin een mens ze zou lezen. De meeste eenvoudige, enkelkoloms documenten worden van boven naar beneden, van links naar rechts getekend, overeenkomend met de natuurlijke leesvolgorde, dus extractie ziet er correct uit. Maar een PDF-exporter mag inhoud in elke volgorde tekenen die hij kiest, en velen behouden de visuele volgorde niet: een academisch artikel met twee kolommen, een tijdschriftlay-out, een tabel, of een PDF met tekstvakken en callouts kan gemakkelijk zijn tekenvolgorde door elkaar hebben gehusseld of volledig omgekeerd ten opzichte van hoe het oog van een lezer over de pagina zou bewegen, omdat de specificatie positie definieert, niet leesvolgorde. Deze tool voegt de items van elke pagina samen in de volgorde die pdf.js rapporteert en scheidt pagina's met een duidelijke --- Pagina N ----markering, zodat u precies kunt zien van welke pagina elk blok afkomstig is en een resultaat met meerdere kolommen indien nodig handmatig kunt herordenen.
- Er wordt niets geüpload: de PDF wordt volledig client-side ontleed met pdf.js dat in uw browser draait; het bestand bereikt nooit de server van deze site.
- Met een wachtwoord beveiligde PDF's kunnen niet worden geopend — deze tool probeert niet de versleuteling of rechten van een PDF te omzeilen.
- Geëxtraheerde spatiëring kan afwijken van de visuele lay-out — vooral tabellen worden vaak geëxtraheerd als een platte reeks celwaarden in plaats van een geformatteerd raster, aangezien PDF geen native concept van een "tabel" heeft zoals HTML dat wel heeft.
- Meerpaginadocumenten krijgen paginamarkeringen zodat u kunt zien waar de inhoud van de ene pagina eindigt en de volgende begint, aangezien PDF-pagina's anders onafhankelijke inhoudsstromen zijn zonder inherente alineagrens ertussen.
Veelgestelde vragen
Waarom kreeg ik een leeg of bijna leeg resultaat?
Uw PDF is zeer waarschijnlijk een gescande afbeelding — een foto of scan van een papieren pagina opgeslagen als PDF zonder ingebedde tekst, alleen een afbeelding. Deze tool leest de tekstlaag van de PDF rechtstreeks en voert geen OCR (optische tekenherkenning) uit, dus een gescande pagina zonder tekstlaag levert niets op om te lezen.
Waarom staat de geëxtraheerde tekst uit volgorde in een PDF met twee kolommen?
PDF slaat inhoud op als tekeninstructies in welke volgorde de exporterende software ook heeft gekozen, wat niet gegarandeerd overeenkomt met de visuele leesvolgorde. Een lay-out met twee kolommen, een tabel of een pagina in tijdschriftstijl kan tekst uit beide kolommen door elkaar husselen, omdat het bestandsformaat glyph-posities definieert, geen leesvolgorde.
Voert deze tool OCR uit op gescande documenten?
Nee. Deze tool leest alleen de reeds bestaande, ingebedde tekstlaag van een PDF via de getTextContent()-API van pdf.js — het analyseert geen pixels en herkent geen tekens in een afbeelding. Voor gescande documenten zonder tekstlaag is een afbeelding-naar-tekst (OCR)-tool een aparte, andere technologie.
Wordt mijn PDF naar een server geüpload?
Nee — de volledige extractie vindt plaats in uw browser met de opensource-bibliotheek pdf.js. Het bestand wordt lokaal gelezen via de File API en nooit ergens naartoe verzonden.
Waarom bevat de uitvoer "--- Pagina N ---"-markeringen?
Elke PDF-pagina is een aparte inhoudsstroom met zijn eigen tekstitems en geen inherente verbinding met de volgende pagina. De paginamarkeringen maken duidelijk waar de geëxtraheerde tekst van de ene pagina eindigt en de volgende begint, wat van belang is voor documenten waarin alinea's of zinnen doorlopen over een paginagrens.
Vergelijkbare tools
Probleem melden
PDF-tekst Extractor
Reacties
Nog geen reacties — schrijf de eerste!