استخراج النص من الصورة (OCR)
استخرج النص من صورة أو مستند ممسوح ضوئيًا مباشرةً داخل متصفحك باستخدام التعرف الضوئي على الحروف — بلا رفع، ويعمل دون اتصال بعد التحميل الأول.
252 مشاهدة
جارٍ تحميل محرك OCR…
لم يُعثر على نص في الصورة، أو أن الدقة منخفضة جدًا.
هذه الأداة مخصصة للصور الفوتوغرافية والمستندات الممسوحة ضوئيًا، وليست لملف PDF يحتوي بالفعل على طبقة نص مدمجة. لملف PDF يحتوي على نص حقيقي بداخله، استخدم بدلًا من ذلك أداة "استخراج النص من PDF".
كيف "يقرأ" المتصفح صورة فعليًا
التعرف الضوئي على الحروف (OCR) هو عملية تحويل وحدات بكسل تشبه بصريًا حروفًا إلى نص Unicode حقيقي قابل للتحديد، وقد كان هذا تقليديًا عملًا يتم على الخادم بالضبط لأنه يتطلب حسابًا مكثفًا. تُشغِّل هذه الأداة Tesseract — التي طُوِّرت أصلًا في مختبرات HP في ثمانينيات القرن الماضي، ثم أصبحت مفتوحة المصدر وتتولى جوجل صيانتها، وتُعد على نطاق واسع من أدق محركات OCR مفتوحة المصدر المتاحة — مُترجَمة إلى WebAssembly، وهو تنسيق تعليمات ثنائي يتيح تشغيل شيفرة ++C داخل المتصفح بسرعة قريبة من السرعة الأصلية. خطوة الترجمة هذه هي ما يجعل الأمر ممكنًا دون خادم: محرك التعرف نفسه المستخدم في العديد من تطبيقات المسح الضوئي لسطح المكتب والهاتف يعمل محليًا على جهازك.
يتعرف Tesseract الحديث (الإصدار 4 وما بعده) على النص باستخدام شبكة عصبية LSTM (الذاكرة القصيرة والطويلة المدى، نوع من الشبكات العصبية المتكررة المناسبة جدًا للبيانات المتسلسلة) بدلًا من مطابقة الأنماط حرفًا بحرف الأقدم المستخدمة في Tesseract 3 وما قبله. فبدلًا من محاولة عزل حرف واحد وتصنيفه في كل مرة، يقرأ نموذج LSTM السطر بأكمله كسلسلة، مستخدمًا السياق المحيط لحل الأشكال الغامضة — وهذا سبب قدرته على التمييز بدقة بين "l" و"1" أو بين "O" و"0" بشكل أوثق بكثير من المحركات القديمة، لأنه في الواقع يتنبأ بـ"أي كلمة منطقية هنا"، لا مجرد مطابقة الأشكال بمعزل عن بعضها.
تعتمد جودة التعرف بشكل كبير على نموذج اللغة المحمَّل: تُنزِّل هذه الأداة ملف نموذج مدرَّب خاصًا باللغة المختارة (الإنجليزية أو التركية) عند أول استخدام، يحتوي على الأنماط الإحصائية لأشكال حروف تلك اللغة وتسلسلاتها الشائعة وقاموسها. اختيار اللغة الصحيحة قبل المسح يحسّن الدقة بشكل ملموس، لأن نموذجًا مدرَّبًا على النص التركي يتعامل مع الأحرف الخاصة بالتركية (ç، ğ، ı، ö، ş، ü) بشكل أفضل بكثير من نموذج إنجليزي فقط.
بما أن نموذج اللغة يمثل تنزيلًا ذا حجم ملموس (عدة ميغابايت)، يخزّنه المتصفح مؤقتًا بعد أول استخدام، بحيث تبدأ عمليات المسح اللاحقة بنفس اللغة أسرع بشكل ملحوظ دون الحاجة لإعادة تنزيله.
الحصول على نتائج أفضل
- الصور الحادة، جيدة الإضاءة، عالية التباين تعمل بشكل أفضل بكثير من الصور الضبابية أو خافتة الإضاءة — تتبع جودة OCR جودة الصورة عن كثب، لأن الشبكة العصبية تعمل من نفس وحدات البكسل التي قد تجهد عين الإنسان لفهمها.
- الصورة المستقيمة غير المائلة تُتعرَّف عليها بشكل أكثر موثوقية من صورة التُقطت بزاوية حادة، رغم أن المحرك يطبّق بعض التصحيح التلقائي للانحراف.
- الخط اليدوي أصعب جوهريًا من النص المطبوع بالنسبة لهذا المحرك — دُرِّب Tesseract أساسًا على الخطوط المطبوعة، وسيؤدي الخط المتصل أو المزخرف بشدة إلى دقة أقل بشكل ملحوظ.
- هذه أداة مختلفة عن أداة استخراج النص من PDF في هذا الموقع: هذه الأداة تُجري تعرفًا حقيقيًا على الحروف من وحدات البكسل، بينما تقرأ أداة PDF نصًا مدمجًا بالفعل كنص قابل للتحديد في الملف — استخدم OCR فقط عندما لا توجد طبقة نص حقيقية لقراءتها.
الأسئلة الشائعة
كيف يمكن لتعرف النص أن يعمل داخل متصفح دون خادم؟
محرك Tesseract للتعرف الضوئي على الحروف، الذي طُوِّر أصلًا في مختبرات HP وتتولى جوجل صيانته الآن، مُترجَم إلى WebAssembly — تنسيق ثنائي يُشغِّل شيفرة ++C داخل المتصفح بسرعة قريبة من السرعة الأصلية. هذا ما يجعل التعرف الضوئي الكامل على الحروف ممكنًا بالكامل على جهازك.
لماذا يهم اختيار اللغة الصحيحة؟
تُنزِّل كل لغة ملف نموذجها المدرَّب الخاص الذي يحتوي على الأنماط الإحصائية لأشكال حروف تلك اللغة وتسلسلاتها الشائعة وقاموسها. النموذج المدرَّب على التركية يتعرف على الأحرف الخاصة بالتركية مثل ç، ğ، ı، ö، ş، ü بدقة أكبر بكثير من نموذج إنجليزي فقط.
لماذا يُتعرَّف على خطي اليدوي بشكل أسوأ مقارنة بالنص المطبوع؟
دُرِّبت الشبكة العصبية لـTesseract أساسًا على الخطوط المطبوعة. يقرأ نموذج LSTM النص كسلسلة ويستخدم السياق لحل الأشكال الغامضة، وهو ما يعمل جيدًا جدًا مع أشكال الحروف المطبوعة المتسقة لكنه يواجه صعوبة مع التنوع الكبير في الخط المتصل أو المزخرف.
هل تُرفع صورتي إلى خادم؟
لا. يعمل التعرف بالكامل داخل متصفحك عبر WebAssembly — لا تُنقل الصورة إلى أي مكان أبدًا. يُنزَّل ملف نموذج اللغة نفسه مرة واحدة فقط (ثم يُخزَّن مؤقتًا) حتى يمتلك المحرك البيانات المدرَّبة التي يحتاجها.
ما الفرق بين هذه الأداة وأداة استخراج النص من PDF؟
تُجري هذه الأداة تعرفًا ضوئيًا حقيقيًا على الحروف من وحدات البكسل — وتعمل على الصور والمستندات الممسوحة ضوئيًا التي لا تحتوي على نص أساسي. أما مستخرج نص PDF فيقرأ بدلًا من ذلك نصًا مخزَّنًا بالفعل كنص مدمج قابل للتحديد داخل ملف PDF، وهي عملية مختلفة تمامًا (وأسرع وأدق بكثير) عندما توجد طبقة النص تلك.
أدوات مشابهة
الإبلاغ عن مشكلة
استخراج النص من الصورة (OCR)
التعليقات
لا توجد تعليقات بعد — كن أول من يكتب تعليقًا!