WebTools

PDF a text

Extreu la capa de text del document, sense OCR.

Treu el text d’un PDF per copiar-lo, cercar-hi o passar-lo a una altra eina. Llegeix la capa de text que el document ja porta, la mateixa que selecciones amb el ratolí al lector.

Un PDF no guarda paràgrafs: guarda trossos de text amb una posició. Aquí s’agrupen per la seva alçada a la pàgina, que és el que s’acosta més al que llegeixes; qualsevol cosa més llesta que això comença a endevinar columnes i s’equivoca.

Com es fa servir

  1. Deixa-hi el PDF.
  2. Tria si vols unir les línies tallades.
  3. Baixa el .txt o copia’l.

Preguntes freqüents

No em treu res, per què?
Perquè el PDF és un escaneig: pàgines que són fotografies, sense cap capa de text. Per llegir-les caldria OCR, que és una altra cosa i aquesta eina no en fa.
Què fa unir les línies tallades?
Ajunta els salts de línia que només hi són perquè la pàgina s’acabava, i conserva els que separen paràgrafs de debò. Desactiva-ho si vols el text exactament com està maquetat.
Respecta les columnes i les taules?
No gaire. El text surt en l’ordre en què és al document, que en una pàgina a dues columnes sovint no és l’ordre de lectura. Per a taules va millor extreure-les a mà.

Eines relacionades