Un escaneig o una foto d’un document són una imatge: el text que hi veus no es pot seleccionar, ni cercar, ni copiar. L’OCR el reconeix i te’l torna com a text de veritat.
Pots demanar-ne un fitxer de text pla o, millor encara, un PDF cercable: la mateixa imatge de sempre, amb una capa de text invisible a sota. Es veu exactament igual, però ara el pots cercar i copiar-ne fragments.
El reconeixement el fa Tesseract compilat a WebAssembly, corrent dins de la pestanya. Un contracte o una factura escanejada no s’envia a cap servei per llegir-la, que amb aquesta mena de documents no és un detall menor.
Com es fa servir
- Deixa-hi l’escaneig, la foto o el PDF.
- Tria l’idioma del document: encertar-lo canvia molt el resultat.
- Decideix si vols text pla o un PDF cercable, i processa.
Preguntes freqüents
- Per què he de dir l’idioma?
- Perquè el reconeixement no va lletra a lletra: fa servir un model del llenguatge per decidir entre lectures possibles. Amb l’idioma equivocat, «paraula» pot acabar sent «parauIa».
- Puc marcar-ne dos alhora?
- Sí, per a documents bilingües. Té un cost: cada idioma afegit fa la feina més lenta i afegeix alguna confusió, així que no els posis tots per si de cas.
- El resultat té errors, què puc fer?
- L’OCR depèn sobretot de la qualitat de l’original. Puja la resolució a 300 ppp, endreça la imatge si està torta i mira que el contrast sigui bo. Un escaneig gris i tort no el salva cap motor.
- Què és exactament un PDF cercable?
- El document original amb el text reconegut posat a sobre en tinta invisible, alineat amb les paraules de la imatge. El lector el pot cercar i seleccionar; tu continues veient l’escaneig.
- Reconeix escriptura a mà?
- Pràcticament no. Tesseract està entrenat amb text imprès; amb lletra manuscrita els resultats no són aprofitables.
Eines relacionades
Comprimir PDFRecodifica les imatges de dins sense tocar el text ni l’estructura.
Organitzar pàginesVeu totes les pàgines, arrossega-les, gira-les i treu les que sobren.
PDF a imatgesUna imatge per pàgina, a la resolució que necessitis.
PDF a textExtreu la capa de text del document, sense OCR.
Extreure imatges d’un PDFTreu les fotos i els gràfics incrustats com a fitxers a part.