Imagen a Texto (OCR)

Extrae texto de una foto o imagen escaneada directamente en tu navegador mediante reconocimiento óptico de caracteres — sin subir nada, funciona sin conexión una vez cargado.

249 visitas

Esta herramienta es para fotos e imágenes escaneadas, no para un PDF que ya tiene una capa de texto incrustada. Para un PDF con texto real dentro, usa en su lugar la herramienta "Extractor de Texto de PDF".

Cómo Puede un Navegador Realmente "Leer" una Foto

El reconocimiento óptico de caracteres (OCR) es el proceso de convertir píxeles que visualmente parecen letras en texto Unicode real y seleccionable, y tradicionalmente ha sido trabajo del lado del servidor precisamente porque es computacionalmente pesado. Esta herramienta ejecuta Tesseract — desarrollado originalmente en HP Labs en la década de 1980, luego liberado como código abierto y mantenido por Google, y ampliamente considerado uno de los motores de OCR de código abierto más precisos disponibles — compilado a WebAssembly, un formato de instrucciones binarias que permite que el código C++ se ejecute dentro del navegador a una velocidad cercana a la nativa. Ese paso de compilación es lo que hace esto posible sin un servidor: el mismo motor de reconocimiento usado en muchas aplicaciones de escaneo de escritorio y móviles se ejecuta localmente en tu dispositivo.

El Tesseract moderno (versión 4 en adelante) reconoce texto usando una red neuronal LSTM (Long Short-Term Memory, un tipo de red neuronal recurrente bien adaptada a datos secuenciales) en lugar de la comparación de patrones carácter por carácter más antigua usada en Tesseract 3 y anteriores. En lugar de intentar aislar y clasificar una letra a la vez, el modelo LSTM lee una línea completa como secuencia, usando el contexto circundante para resolver formas ambiguas — por eso puede distinguir correctamente una "l" de un "1" o una "O" de un "0" con mucha más fiabilidad que los motores antiguos, ya que efectivamente está prediciendo "qué palabra tiene sentido aquí", no solo comparando formas de manera aislada.

La calidad del reconocimiento depende en gran medida del modelo de idioma cargado: esta herramienta descarga un archivo de modelo entrenado específico para el idioma seleccionado (inglés o turco) la primera vez que se usa, que contiene los patrones estadísticos de las formas de letras, secuencias de letras comunes y diccionario de ese idioma. Seleccionar el idioma correcto antes de escanear mejora significativamente la precisión, ya que un modelo entrenado en texto turco maneja los caracteres específicos del turco (ç, ğ, ı, ö, ş, ü) mucho mejor que un modelo solo de inglés.

Como el modelo de idioma supone una descarga considerable (varios megabytes), el navegador lo guarda en caché tras el primer uso, así que los escaneos posteriores en el mismo idioma empiezan notablemente más rápido sin necesidad de volver a descargarlo.

Cómo Obtener Mejores Resultados

  • Las fotos nítidas, bien iluminadas y de alto contraste funcionan mucho mejor que las borrosas o con poca luz — la calidad del OCR sigue de cerca la calidad de la imagen, ya que la red neuronal trabaja con los mismos píxeles con los que un ojo humano tendría dificultades.
  • Una foto recta, sin rotar, se reconoce de forma más fiable que una tomada en un ángulo pronunciado, aunque el motor sí aplica cierta corrección automática de inclinación.
  • La escritura a mano es fundamentalmente más difícil que el texto impreso para este motor — Tesseract se entrenó principalmente con tipografías impresas, y la letra cursiva o muy estilizada producirá una precisión notablemente menor.
  • Esta es una herramienta distinta de la extracción de texto de PDF de este sitio: esta realiza reconocimiento de caracteres real sobre píxeles, mientras que la herramienta de PDF lee texto que ya está incrustado como texto seleccionable en el archivo — usa OCR solo cuando no hay una capa de texto real que leer.

Preguntas Frecuentes

¿Cómo puede el reconocimiento de texto funcionar en un navegador sin un servidor?

El motor de OCR Tesseract, desarrollado originalmente en HP Labs y ahora mantenido por Google, se compila a WebAssembly — un formato binario que ejecuta código C++ dentro del navegador a una velocidad cercana a la nativa. Eso es lo que hace posible el reconocimiento óptico de caracteres completo enteramente en tu dispositivo.

¿Por qué importa seleccionar el idioma correcto?

Cada idioma descarga su propio archivo de modelo entrenado que contiene los patrones estadísticos de las formas de letras, secuencias comunes y diccionario de ese idioma. Un modelo entrenado en turco reconoce caracteres específicos del turco como ç, ğ, ı, ö, ş, ü con mucha más precisión que un modelo solo de inglés.

¿Por qué mi letra manuscrita se reconoce peor que el texto impreso?

La red neuronal de Tesseract se entrenó principalmente con tipografías impresas. Su modelo LSTM lee el texto como una secuencia y usa el contexto para resolver formas ambiguas, lo cual funciona muy bien para formas de letras impresas consistentes pero tiene dificultades con la alta variabilidad de la escritura cursiva o estilizada.

¿Se sube mi imagen a un servidor?

No. El reconocimiento se ejecuta enteramente dentro de tu navegador mediante WebAssembly — la imagen nunca se transmite a ningún sitio. Solo el archivo del modelo de idioma se descarga una vez (y luego se guarda en caché) para que el motor tenga los datos entrenados que necesita.

¿Cuál es la diferencia entre esta herramienta y la de extracción de texto de PDF?

Esta herramienta realiza reconocimiento óptico de caracteres real sobre píxeles — funciona con fotos e imágenes escaneadas sin texto subyacente. El extractor de texto de PDF, en cambio, lee texto que ya está almacenado como texto incrustado y seleccionable dentro de un PDF, lo cual es una operación completamente distinta (y mucho más rápida y precisa) cuando esa capa de texto existe.

Comentarios

Aún no hay comentarios — ¡sé el primero en escribir uno!

Herramientas Similares