Un escaneo o una foto de un documento son una imagen: el texto que ves no se puede seleccionar, ni buscar, ni copiar. El OCR lo reconoce y te lo devuelve como texto de verdad.
Puedes pedir un archivo de texto plano o, mejor aún, un PDF buscable: la misma imagen de siempre, con una capa de texto invisible debajo. Se ve exactamente igual, pero ahora lo puedes buscar y copiar fragmentos.
El reconocimiento lo hace Tesseract compilado a WebAssembly, corriendo dentro de la pestaña. Un contrato o una factura escaneada no se envía a ningún servicio para leerla, que con esta clase de documentos no es un detalle menor.
Cómo se usa
- Suelta el escaneo, la foto o el PDF.
- Elige el idioma del documento: acertarlo cambia mucho el resultado.
- Decide si quieres texto plano o un PDF buscable, y procesa.
Preguntas frecuentes
- ¿Por qué tengo que decir el idioma?
- Porque el reconocimiento no va letra a letra: usa un modelo del lenguaje para decidir entre lecturas posibles. Con el idioma equivocado, «palabra» puede acabar siendo «paIabra».
- ¿Puedo marcar dos a la vez?
- Sí, para documentos bilingües. Tiene un coste: cada idioma añadido hace el trabajo más lento y añade alguna confusión.
- El resultado tiene errores, ¿qué puedo hacer?
- El OCR depende sobre todo de la calidad del original. Sube la resolución a 300 ppp, endereza la imagen si está torcida y mira que el contraste sea bueno.
- ¿Reconoce escritura a mano?
- Prácticamente no. Tesseract está entrenado con texto impreso; con letra manuscrita los resultados no son aprovechables.
Herramientas relacionadas
Comprimir PDFRecodifica las imágenes de dentro sin tocar el texto ni la estructura.
Organizar páginasVe todas las páginas, arrástralas, gíralas y quita las que sobren.
PDF a imágenesUna imagen por página, a la resolución que necesites.
PDF a textoExtrae la capa de texto del documento, sin OCR.
Extraer imágenes de un PDFSaca las fotos y los gráficos incrustados como archivos aparte.