Afbeelding naar Tekst (OCR)
Extraheer tekst uit een foto of gescande afbeelding rechtstreeks in uw browser met optische tekenherkenning — geen upload, werkt offline zodra geladen.
244 weergaven
OCR-engine wordt geladen…
Geen tekst gevonden in de afbeelding, of de resolutie is te laag.
Deze tool is voor foto's en gescande afbeeldingen, niet voor een PDF die al een ingebedde tekstlaag heeft. Gebruik voor een PDF met echte tekst erin de tool "PDF-tekstextractor".
Hoe een Browser Eigenlijk een Foto Kan "Lezen"
Optische tekenherkenning (OCR) is het proces waarbij pixels die er visueel uitzien als letters worden omgezet in echte, selecteerbare Unicode-tekst, en dit is traditioneel serverwerk geweest, precies omdat het rekenkundig zwaar is. Deze tool draait Tesseract — oorspronkelijk ontwikkeld bij HP Labs in de jaren 80, later open source gemaakt en onderhouden door Google, en algemeen beschouwd als een van de meest nauwkeurige beschikbare opensource-OCR-engines — gecompileerd naar WebAssembly, een binair instructieformaat waarmee C++-code met bijna native snelheid in de browser kan draaien. Die compilatiestap is wat dit zonder server mogelijk maakt: precies dezelfde herkenningsengine die in veel desktop- en mobiele scanapps wordt gebruikt, draait lokaal op uw apparaat.
Moderne Tesseract (versie 4 en later) herkent tekst met een LSTM-neuraal netwerk (Long Short-Term Memory, een type recurrent neuraal netwerk dat goed geschikt is voor sequentiële gegevens) in plaats van de oudere teken-voor-teken patroonherkenning die in Tesseract 3 en eerder werd gebruikt. In plaats van te proberen één letter tegelijk te isoleren en te classificeren, leest het LSTM-model een hele regel als een reeks, waarbij de omringende context wordt gebruikt om dubbelzinnige vormen op te lossen — dit is waarom het een "l" veel betrouwbaarder van een "1" kan onderscheiden, of een "O" van een "0", dan oudere engines, aangezien het effectief voorspelt "welk woord is hier logisch," niet alleen vormen los van elkaar vergelijkt.
De herkenningskwaliteit hangt sterk af van het geladen taalmodel: deze tool downloadt bij het eerste gebruik een getraind modelbestand specifiek voor de geselecteerde taal (Engels of Turks), met de statistische patronen voor de lettervormen, veelvoorkomende letterreeksen en het woordenboek van die taal. Het selecteren van de juiste taal vóór het scannen verbetert de nauwkeurigheid aanzienlijk, aangezien een model dat is getraind op Turkse tekst Turks-specifieke tekens (ç, ğ, ı, ö, ş, ü) veel beter verwerkt dan een alleen-Engels model zou doen.
Omdat het taalmodel een aanzienlijke download is (enkele megabytes), cachet de browser het na het eerste gebruik, zodat volgende scans in dezelfde taal merkbaar sneller starten zonder dat het opnieuw moet worden opgehaald.
Betere Resultaten Krijgen
- Scherpe, goed verlichte, contrastrijke foto's werken veel beter dan wazige of slecht verlichte — de OCR-kwaliteit volgt de beeldkwaliteit nauwgezet, aangezien het neurale netwerk werkt met dezelfde pixels waar een menselijk oog ook moeite mee zou hebben.
- Een rechte, niet-gedraaide foto wordt betrouwbaarder herkend dan een foto die onder een steile hoek is genomen, ook al past de engine wel enige automatische scheefstandcorrectie toe.
- Handschrift is voor deze engine fundamenteel moeilijker dan gedrukte tekst — Tesseract is voornamelijk getraind op gedrukte lettertypen, en cursief of sterk gestileerd handschrift levert een merkbaar lagere nauwkeurigheid op.
- Dit is een andere tool dan PDF-tekstextractie op deze site: deze voert daadwerkelijke tekenherkenning uit op pixels, terwijl de PDF-tool tekst leest die al als selecteerbare tekst in het bestand is ingebed — gebruik OCR alleen wanneer er geen echte tekstlaag is om te lezen.
Veelgestelde vragen
Hoe kan tekstherkenning in een browser draaien zonder server?
De Tesseract OCR-engine, oorspronkelijk ontwikkeld bij HP Labs en nu onderhouden door Google, is gecompileerd naar WebAssembly — een binair formaat waarmee C++-code met bijna native snelheid in de browser draait. Dat is wat volledige optische tekenherkenning volledig op uw apparaat mogelijk maakt.
Waarom is het belangrijk om de juiste taal te selecteren?
Elke taal downloadt zijn eigen getrainde modelbestand met de statistische patronen voor de lettervormen, veelvoorkomende reeksen en het woordenboek van die taal. Een op Turks getraind model herkent Turks-specifieke tekens zoals ç, ğ, ı, ö, ş, ü veel nauwkeuriger dan een alleen-Engels model zou doen.
Waarom wordt mijn handschrift slechter herkend dan gedrukte tekst?
Het neurale netwerk van Tesseract is voornamelijk getraind op gedrukte lettertypen. Het LSTM-model leest tekst als een reeks en gebruikt context om dubbelzinnige vormen op te lossen, wat zeer goed werkt voor consistente gedrukte lettervormen maar moeite heeft met de hoge variabiliteit van cursief of gestileerd handschrift.
Wordt mijn afbeelding naar een server geüpload?
Nee. De herkenning draait volledig in uw browser via WebAssembly — de afbeelding wordt nooit ergens naartoe verzonden. Alleen het taalmodelbestand zelf wordt eenmalig gedownload (en vervolgens gecachet), zodat de engine over de benodigde getrainde gegevens beschikt.
Wat is het verschil tussen deze tool en de PDF-tekstextractietool?
Deze tool voert echte optische tekenherkenning uit op pixels — het werkt op foto's en gescande afbeeldingen zonder onderliggende tekst. De PDF-tekstextractor leest in plaats daarvan tekst die al is opgeslagen als selecteerbare, ingebedde tekst in een PDF, wat een compleet andere (en veel snellere, nauwkeurigere) bewerking is wanneer die tekstlaag bestaat.
Vergelijkbare tools
Probleem melden
Afbeelding naar Tekst (OCR)
Reacties
Nog geen reacties — schrijf de eerste!