Resimden Yazı Çıkarma (OCR)
Optik karakter tanıma ile bir fotoğraf veya taranmış görselden metni doğrudan tarayıcınızda çıkarın — yükleme yok, yüklendikten sonra çevrimdışı da çalışır.
250 görüntülenme
OCR motoru yükleniyor…
Görselde metin bulunamadı veya çok düşük çözünürlüklü.
Bu araç gömülü metin katmanı olan bir PDF için değil, fotoğraf/taranmış görseller içindir. Metnin gömülü olduğu bir PDF için "PDF'ten Metin Çıkarma" aracını kullanın.
Bir Tarayıcı Bir Fotoğrafı Gerçekten Nasıl "Okuyabilir"?
Optik karakter tanıma (OCR), görsel olarak harflere benzeyen pikselleri gerçek, seçilebilir Unicode metne dönüştürme sürecidir ve geleneksel olarak hesaplama açısından ağır olduğu için sunucu tarafı bir iş olmuştur. Bu araç, başlangıçta 1980'lerde HP Labs'ta geliştirilen, daha sonra açık kaynak hale gelip Google tarafından sürdürülen ve mevcut en doğru açık kaynak OCR motorlarından biri olarak yaygın şekilde kabul edilen Tesseract'ı — C++ kodunun tarayıcı içinde neredeyse yerel hıza yakın çalışmasını sağlayan ikili bir talimat biçimi olan WebAssembly'e derlenmiş halde — çalıştırır. Bu derleme adımı, bunu sunucu olmadan mümkün kılan şeydir: birçok masaüstü ve mobil tarama uygulamasında kullanılan tam olarak aynı tanıma motoru, cihazınızda yerel olarak çalışır.
Modern Tesseract (sürüm 4 ve sonrası), Tesseract 3 ve öncesinde kullanılan eski karakter-karakter desen eşleştirme yerine bir LSTM sinir ağı (Long Short-Term Memory — sıralı veriye uygun bir tekrarlayan sinir ağı türü) kullanarak metni tanır. Bir seferde tek bir harfi ayırıp sınıflandırmaya çalışmak yerine, LSTM modeli tüm bir satırı bir dizi olarak okur, belirsiz şekilleri çözmek için çevredeki bağlamı kullanır — bu yüzden bir "l"yi "1"den veya bir "O"yu "0"dan eski motorlardan çok daha güvenilir biçimde ayırt edebilir, çünkü etkin biçimde sadece şekilleri izole olarak eşleştirmek yerine "burada hangi kelime mantıklı" sorusunu tahmin eder.
Tanıma kalitesi büyük ölçüde yüklenen dil modeline bağlıdır: bu araç, ilk kullanıldığında seçilen dile (İngilizce veya Türkçe) özgü, o dilin harf biçimleri, yaygın harf dizileri ve sözlüğü için istatistiksel desenler içeren eğitilmiş bir model dosyası indirir. Taramadan önce doğru dili seçmek doğruluğu anlamlı biçimde artırır, çünkü Türkçe metin üzerinde eğitilmiş bir model, Türkçe'ye özgü karakterleri (ç, ğ, ı, ö, ş, ü) yalnızca İngilizce bir modelden çok daha iyi ele alır.
Dil modeli anlamlı bir indirme boyutuna sahip olduğundan (birkaç megabayt), tarayıcı ilk kullanımdan sonra bunu önbelleğe alır; bu yüzden aynı dilde sonraki taramalar, yeniden indirmeye gerek kalmadan belirgin biçimde daha hızlı başlar.
Daha İyi Sonuçlar Almak
- Keskin, iyi aydınlatılmış, yüksek kontrastlı fotoğraflar bulanık veya düşük ışıklı olanlardan çok daha iyi çalışır — OCR kalitesi görsel kalitesini yakından takip eder, çünkü sinir ağı, bir insan gözünün de zorlanacağı aynı piksellerle çalışır.
- Motor bir miktar otomatik eğim düzeltmesi uygulasa da, dümdüz, döndürülmemiş bir fotoğraf, dik açılı çekilmiş bir fotoğraftan daha güvenilir biçimde tanınır.
- El yazısı bu motor için basılı metinden temelde daha zordur — Tesseract öncelikle basılı fontlar üzerinde eğitilmiştir, bitişik veya oldukça biçimlendirilmiş el yazısı belirgin biçimde daha düşük doğruluk üretir.
- Bu, sitedeki PDF metin çıkarma aracından farklı bir araçtır: bu araç pikseller üzerinde gerçek karakter tanıma yapar, PDF aracı ise dosyada zaten seçilebilir metin olarak gömülü olan metni okur — okunacak gerçek bir metin katmanı yoksa yalnızca OCR kullanın.
Sıkça Sorulan Sorular
Metin tanıma bir sunucu olmadan tarayıcıda nasıl çalışabiliyor?
Başlangıçta HP Labs'ta geliştirilen ve şimdi Google tarafından sürdürülen Tesseract OCR motoru, C++ kodunun tarayıcı içinde neredeyse yerel hıza yakın çalışmasını sağlayan ikili bir biçim olan WebAssembly'e derlenmiştir. Tam optik karakter tanımayı tamamen cihazınızda mümkün kılan şey budur.
Doğru dili seçmek neden önemli?
Her dil, o dilin harf biçimleri, yaygın diziler ve sözlüğü için istatistiksel desenler içeren kendi eğitilmiş model dosyasını indirir. Türkçe üzerinde eğitilmiş bir model, ç, ğ, ı, ö, ş, ü gibi Türkçe'ye özgü karakterleri yalnızca İngilizce bir modelden çok daha doğru tanır.
El yazım basılı metne göre neden daha kötü tanınıyor?
Tesseract'ın sinir ağı öncelikle basılı fontlar üzerinde eğitilmiştir. LSTM modeli metni bir dizi olarak okur ve belirsiz şekilleri çözmek için bağlamı kullanır; bu tutarlı basılı harf biçimleri için çok iyi çalışır ama bitişik veya biçimlendirilmiş el yazısının yüksek değişkenliğinde zorlanır.
Görselim bir sunucuya yükleniyor mu?
Hayır. Tanıma tamamen tarayıcınızda WebAssembly aracılığıyla çalışır — görsel hiçbir yere iletilmez. Yalnızca dil modeli dosyasının kendisi bir kez indirilir (sonra önbelleğe alınır), böylece motor ihtiyaç duyduğu eğitilmiş veriye sahip olur.
Bu araç ile PDF metin çıkarma aracı arasındaki fark nedir?
Bu araç pikseller üzerinde gerçek optik karakter tanıma yapar — altta metin olmayan fotoğraflar ve taranmış görsellerde çalışır. PDF metin çıkarıcı ise bunun yerine bir PDF içinde zaten seçilebilir, gömülü metin olarak saklanan metni okur; bu metin katmanı mevcut olduğunda tamamen farklı (ve çok daha hızlı, daha doğru) bir işlemdir.
Benzer Araçlar
Sorun Bildir
Resimden Yazı Çıkarma (OCR)
Yorumlar
Henüz yorum yok — ilk yorumu siz yazın!