PDF a Texto

Extrae todo el texto de un PDF a un archivo .txt en tu navegador, con copiar al portapapeles. Gratis, sin subir archivos, 100% privado.

🌐 English

Drop your file here (.pdf)

🔒 Privado por diseño: tus archivos se procesan localmente en tu navegador; nada se sube nunca a ningún servidor.

Cómo extraer texto de un PDF

  1. Arrastra tu PDF a la caja de arriba o pulsa Choose a file.
  2. Elige cómo se separan las páginas con la opción Separadores de página: marcadores de página, una línea en blanco o un único bloque continuo.
  3. Pulsa PDF a Texto y deja que lea cada página.
  4. Copia el texto al portapapeles o descárgalo como archivo .txt.

¿Por qué convertir un PDF en texto plano?

Un PDF está hecho para mirarse, no para editarse. Eso es justo lo que lo hace frustrante en cuanto necesitas las palabras que hay dentro. Quieres citar dos párrafos de un informe en un correo, sacar una cláusula de un contrato, pasar un artículo a un resumidor o a un traductor, o buscar en un documento que tu lector de PDF se empeña en no dejarte buscar, y no hay un simple botón de “dame el texto”.

Esta herramienta lee el texto directamente del PDF y te lo devuelve como texto plano y editable. Una vez que es texto plano puedes hacer cualquier cosa con él: pegarlo en un documento, pasarlo por un contador de palabras o un corrector, meterlo en una hoja de cálculo o entregárselo a cualquier herramienta que espere texto plano en lugar de un PDF bloqueado. Es la forma más rápida de pasar de “un PDF que me han enviado” a “texto que puedo usar”.

De forma predeterminada, cada página se etiqueta con un marcador --- Page N --- para que veas exactamente dónde acaba una página y empieza la siguiente, útil cuando citas una fuente o saltas a una página concreta. Si prefieres un único bloque limpio sin nada de por medio, cambia la opción Separadores de página a una línea en blanco o a sin separadores.

Una nota honesta sobre lo que obtienes. Un PDF no guarda líneas de texto ordenadas; guarda muchos fragmentos pequeños posicionados en la página. Esta herramienta los vuelve a unir en texto legible página a página, lo que es perfecto para leer, citar y reprocesar, pero los saltos de línea exactos, los diseños a varias columnas y las cuadrículas de las tablas se aplanan en lugar de reconstruirse a la perfección. Obtienes las palabras, no una copia píxel a píxel de la página.

PDF con texto frente a PDF escaneado

Hay dos tipos de PDF, y solo uno se puede convertir en texto. Un PDF con texto, cualquier cosa exportada desde Word, Google Docs, LaTeX o una app de diseño, lleva el texto real de la página como datos, que es justo lo que extrae esta herramienta. Un PDF escaneado es en realidad un montón de fotografías de papel; dentro no hay palabras, solo píxeles, así que la extracción de texto no encuentra nada.

Cuando la herramienta lee tu documento y no halla prácticamente texto en ninguna página, no te entrega un archivo en blanco en silencio, sino que descarga un breve aviso que explica que el PDF parece escaneado o solo de imagen. Para sacar texto de un documento escaneado necesitas primero un OCR (reconocimiento óptico de caracteres) que lea los píxeles y añada una capa de texto real, tras lo cual esta herramienta puede extraerlo con normalidad.

Tus documentos nunca salen de tu dispositivo

Contratos, escritos legales, manuscritos inéditos, informes financieros: los PDF de los que más quieres extraer texto suelen ser los que menos quieres entregar al servidor de un desconocido. Muchos conversores de “PDF a texto” en línea te piden exactamente eso: subir el archivo, dejar que su servidor lo procese y confiar tu documento privado a su política de retención.

Esta herramienta funciona al revés. Ejecuta PDF.js, el motor de PDF de código abierto creado por Mozilla y usado dentro de Firefox, directamente en la pestaña de tu navegador. El texto se extrae en tu propia máquina. No se sube nada, no hace falta cuenta y ningún servidor ve un solo byte de tu documento. Tampoco hay espera de subida: incluso un PDF grande empieza a extraerse de inmediato.

Usos comunes

Cómo funciona, en imágenes

Captura de pantalla de la herramienta PDF a Texto con sysfenix-sample.pdf (3 KB) cargado, Page separators en Page markers (--- Page N ---)
PDF a Texto en pleno proceso: sysfenix-sample.pdf (3 KB) cargado, Page separators en Page markers (--- Page N ---).
Captura de pantalla del resultado de PDF a Texto mostrando sysfenix-sample.txt listo para descargar (1 KB, 63% más pequeño)
El resultado final: sysfenix-sample.txt listo para descargar (1 KB, 63% más pequeño). El enlace de descarga es una URL blob local: el archivo nunca sale de tu dispositivo.

Preguntas frecuentes

¿Se sube mi PDF a un servidor?

No. El PDF se abre y su texto se extrae por completo dentro de tu navegador con PDF.js, el mismo motor de código abierto que usa Firefox para mostrar PDF. Contratos, informes, manuscritos y documentos privados nunca salen de tu dispositivo, y al cerrar la pestaña no queda ningún rastro.

¿Hay un límite de tamaño o de páginas?

No hay límite artificial ni plan de pago. Como el trabajo lo hace tu propio dispositivo, el límite práctico es la memoria de tu equipo; documentos de varios cientos de páginas suelen ir bien. Un PDF muy grande solo tarda un poco más en analizarse.

¿Los marcadores de página y el aviso están en inglés?

Sí. El texto que extrae la herramienta es el que contenga tu PDF, en el idioma que sea (un PDF en español da texto en español). Pero dos cosas se generan siempre en inglés en ambas versiones de la página, el marcador de página, que dice "--- Page N ---" (la palabra "Page"), y el aviso que se descarga cuando el PDF parece escaneado. El contenido extraído no se ve afectado.

¿Por qué el archivo sale vacío o dice que mi PDF parece escaneado?

La extracción de texto necesita una capa de texto real. Un documento escaneado es en realidad una imagen de cada página, así que no hay caracteres que extraer. Cuando la herramienta no encuentra prácticamente texto en todo el documento descarga un breve aviso en lugar de un archivo en blanco; pasa el PDF primero por un OCR (reconocimiento óptico de caracteres) para añadir una capa de texto y vuelve a intentarlo.

¿Se conservará el diseño exacto, las columnas y los saltos de línea?

No; esto extrae las palabras, no el diseño visual. Un PDF guarda el texto como fragmentos posicionados en lugar de líneas ordenadas, así que la salida es el texto legible de cada página, pero los diseños a varias columnas, las tablas y los saltos de línea exactos se aplanan. Es ideal para citar, buscar o pasar el texto a otra herramienta, no para reproducir la página píxel a píxel.

¿Puedo copiar el texto en vez de descargarlo?

Sí. Tras procesarlo puedes copiar el texto extraído directamente al portapapeles, o descargarlo como archivo .txt, lo que te resulte más cómodo para pegarlo en un correo, un documento u otra herramienta.

Herramientas relacionadas