WebTools

OCR: leer texto de imágenes y PDF

Reconoce el texto de escaneos y fotos, y hace un PDF buscable.

Un escaneo o una foto de un documento son una imagen: el texto que ves no se puede seleccionar, ni buscar, ni copiar. El OCR lo reconoce y te lo devuelve como texto de verdad.

Puedes pedir un archivo de texto plano o, mejor aún, un PDF buscable: la misma imagen de siempre, con una capa de texto invisible debajo. Se ve exactamente igual, pero ahora lo puedes buscar y copiar fragmentos.

El reconocimiento lo hace Tesseract compilado a WebAssembly, corriendo dentro de la pestaña. Un contrato o una factura escaneada no se envía a ningún servicio para leerla, que con esta clase de documentos no es un detalle menor.

Cómo se usa

  1. Suelta el escaneo, la foto o el PDF.
  2. Elige el idioma del documento: acertarlo cambia mucho el resultado.
  3. Decide si quieres texto plano o un PDF buscable, y procesa.

Preguntas frecuentes

¿Por qué tengo que decir el idioma?
Porque el reconocimiento no va letra a letra: usa un modelo del lenguaje para decidir entre lecturas posibles. Con el idioma equivocado, «palabra» puede acabar siendo «paIabra».
¿Puedo marcar dos a la vez?
Sí, para documentos bilingües. Tiene un coste: cada idioma añadido hace el trabajo más lento y añade alguna confusión.
El resultado tiene errores, ¿qué puedo hacer?
El OCR depende sobre todo de la calidad del original. Sube la resolución a 300 ppp, endereza la imagen si está torcida y mira que el contraste sea bueno.
¿Reconoce escritura a mano?
Prácticamente no. Tesseract está entrenado con texto impreso; con letra manuscrita los resultados no son aprovechables.

Herramientas relacionadas