WebTools

OCR: llegir text d’imatges i PDF

Reconeix el text d’escanejos i fotos, i en fa un PDF cercable.

Un escaneig o una foto d’un document són una imatge: el text que hi veus no es pot seleccionar, ni cercar, ni copiar. L’OCR el reconeix i te’l torna com a text de veritat.

Pots demanar-ne un fitxer de text pla o, millor encara, un PDF cercable: la mateixa imatge de sempre, amb una capa de text invisible a sota. Es veu exactament igual, però ara el pots cercar i copiar-ne fragments.

El reconeixement el fa Tesseract compilat a WebAssembly, corrent dins de la pestanya. Un contracte o una factura escanejada no s’envia a cap servei per llegir-la, que amb aquesta mena de documents no és un detall menor.

Com es fa servir

  1. Deixa-hi l’escaneig, la foto o el PDF.
  2. Tria l’idioma del document: encertar-lo canvia molt el resultat.
  3. Decideix si vols text pla o un PDF cercable, i processa.

Preguntes freqüents

Per què he de dir l’idioma?
Perquè el reconeixement no va lletra a lletra: fa servir un model del llenguatge per decidir entre lectures possibles. Amb l’idioma equivocat, «paraula» pot acabar sent «parauIa».
Puc marcar-ne dos alhora?
Sí, per a documents bilingües. Té un cost: cada idioma afegit fa la feina més lenta i afegeix alguna confusió, així que no els posis tots per si de cas.
El resultat té errors, què puc fer?
L’OCR depèn sobretot de la qualitat de l’original. Puja la resolució a 300 ppp, endreça la imatge si està torta i mira que el contrast sigui bo. Un escaneig gris i tort no el salva cap motor.
Què és exactament un PDF cercable?
El document original amb el text reconegut posat a sobre en tinta invisible, alineat amb les paraules de la imatge. El lector el pot cercar i seleccionar; tu continues veient l’escaneig.
Reconeix escriptura a mà?
Pràcticament no. Tesseract està entrenat amb text imprès; amb lletra manuscrita els resultats no són aprofitables.

Eines relacionades