Immagine in Testo (OCR)

Estrai testo da una foto o un'immagine scansionata direttamente nel tuo browser usando il riconoscimento ottico dei caratteri — nessun caricamento, funziona offline una volta caricato.

245 visualizzazioni

Questo strumento è per foto e immagini scansionate, non per un PDF che ha già un livello di testo incorporato. Per un PDF con testo reale al suo interno, usa invece lo strumento "Estrazione Testo da PDF".

Come un Browser Può Davvero "Leggere" una Foto

Il riconoscimento ottico dei caratteri (OCR) è il processo che trasforma pixel visivamente simili a lettere in vero testo Unicode selezionabile, ed è stato tradizionalmente un lavoro lato server proprio perché è computazionalmente pesante. Questo strumento esegue Tesseract — originariamente sviluppato presso HP Labs negli anni '80, poi reso open source e mantenuto da Google, ampiamente considerato uno dei motori OCR open source più accurati disponibili — compilato in WebAssembly, un formato di istruzioni binarie che permette al codice C++ di eseguire nel browser a una velocità vicina a quella nativa. È questo passaggio di compilazione che rende tutto ciò possibile senza un server: esattamente lo stesso motore di riconoscimento usato in molte app di scansione desktop e mobile viene eseguito localmente sul tuo dispositivo.

Il Tesseract moderno (versione 4 e successive) riconosce il testo usando una rete neurale LSTM (Long Short-Term Memory, un tipo di rete neurale ricorrente adatta ai dati sequenziali) anziché il più vecchio riconoscimento di pattern carattere per carattere usato in Tesseract 3 e versioni precedenti. Invece di cercare di isolare e classificare una lettera alla volta, il modello LSTM legge un'intera riga come sequenza, usando il contesto circostante per risolvere forme ambigue — questo è il motivo per cui riesce a distinguere correttamente una "l" da un "1" o una "O" da uno "0" molto più affidabilmente dei motori più vecchi, poiché in pratica sta prevedendo "quale parola ha senso qui", non solo confrontando forme isolate.

La qualità del riconoscimento dipende fortemente dal modello linguistico caricato: questo strumento scarica un file di modello addestrato specifico per la lingua selezionata (inglese o turco) la prima volta che viene usato, contenente i pattern statistici delle forme delle lettere, le sequenze di lettere comuni e il dizionario di quella lingua. Selezionare la lingua corretta prima della scansione migliora sensibilmente l'accuratezza, poiché un modello addestrato su testo turco gestisce i caratteri specifici del turco (ç, ğ, ı, ö, ş, ü) molto meglio di un modello solo inglese.

Poiché il modello linguistico è un download di dimensioni considerevoli (diversi megabyte), il browser lo mette in cache dopo il primo utilizzo, così le scansioni successive nella stessa lingua partono notevolmente più veloci senza doverlo riscaricare.

Ottenere Risultati Migliori

  • Foto nitide, ben illuminate e ad alto contrasto funzionano molto meglio di quelle sfocate o con poca luce — la qualità dell'OCR segue da vicino la qualità dell'immagine, poiché la rete neurale lavora sugli stessi pixel su cui si affaticherebbe un occhio umano.
  • Una foto dritta e non ruotata viene riconosciuta più affidabilmente di una foto scattata con un'angolazione forte, anche se il motore applica una certa correzione automatica dell'inclinazione.
  • La scrittura a mano è fondamentalmente più difficile del testo stampato per questo motore - Tesseract è stato addestrato principalmente su font stampati, e una scrittura corsiva o molto stilizzata produrrà un'accuratezza notevolmente inferiore.
  • Questo è uno strumento diverso dall'estrazione di testo PDF presente su questo sito: questo esegue un vero riconoscimento di caratteri sui pixel, mentre lo strumento PDF legge testo già incorporato come testo selezionabile nel file - usa l'OCR solo quando non esiste un vero livello di testo da leggere.

Domande Frequenti

Come può il riconoscimento del testo funzionare in un browser senza un server?

Il motore OCR Tesseract, originariamente sviluppato presso HP Labs e ora mantenuto da Google, è compilato in WebAssembly - un formato binario che esegue codice C++ nel browser a una velocità vicina a quella nativa. È questo che rende possibile il riconoscimento ottico completo dei caratteri interamente sul tuo dispositivo.

Perché è importante selezionare la lingua giusta?

Ogni lingua scarica il proprio file di modello addestrato contenente i pattern statistici delle forme delle lettere, le sequenze comuni e il dizionario di quella lingua. Un modello addestrato sul turco riconosce caratteri specifici del turco come ç, ğ, ı, ö, ş, ü molto più accuratamente di un modello solo inglese.

Perché la mia scrittura a mano viene riconosciuta peggio rispetto al testo stampato?

La rete neurale di Tesseract è stata addestrata principalmente su font stampati. Il suo modello LSTM legge il testo come sequenza e usa il contesto per risolvere forme ambigue, il che funziona molto bene per forme di lettere stampate coerenti ma fatica con l'alta variabilità della scrittura corsiva o stilizzata.

La mia immagine viene caricata su un server?

No. Il riconoscimento avviene interamente all'interno del tuo browser tramite WebAssembly - l'immagine non viene mai trasmessa da nessuna parte. Solo il file del modello linguistico viene scaricato una volta (e poi messo in cache) così il motore ha i dati addestrati di cui ha bisogno.

Qual è la differenza tra questo e lo strumento di estrazione testo da PDF?

Questo strumento esegue un vero riconoscimento ottico dei caratteri sui pixel - funziona su foto e immagini scansionate senza testo sottostante. L'estrattore di testo PDF invece legge testo già memorizzato come testo selezionabile e incorporato all'interno di un PDF, il che è un'operazione completamente diversa (e molto più veloce e accurata) quando quel livello di testo esiste.

Commenti

Ancora nessun commento — scrivi il primo!

Strumenti Simili