WebTools

PDF a texto

Extrae la capa de texto del documento, sin OCR.

Saca el texto de un PDF para copiarlo, buscar en él o pasarlo a otra herramienta. Lee la capa de texto que el documento ya lleva, la misma que seleccionas con el ratón en el lector.

Un PDF no guarda párrafos: guarda trozos de texto con una posición. Aquí se agrupan por su altura en la página, que es lo que más se acerca a lo que lees; cualquier cosa más lista que eso empieza a adivinar columnas y se equivoca.

Cómo se usa

  1. Suelta el PDF.
  2. Elige si quieres unir las líneas cortadas.
  3. Descarga el .txt o cópialo.

Preguntas frecuentes

No me saca nada, ¿por qué?
Porque el PDF es un escaneo: páginas que son fotografías, sin ninguna capa de texto. Para leerlas hace falta OCR, que es otra cosa y esta herramienta no hace.
¿Qué hace unir las líneas cortadas?
Junta los saltos de línea que solo están ahí porque la página se acababa, y conserva los que separan párrafos de verdad. Desactívalo si quieres el texto exactamente como está maquetado.
¿Respeta las columnas y las tablas?
No mucho. El texto sale en el orden en que está en el documento, que en una página a dos columnas a menudo no es el orden de lectura.

Herramientas relacionadas