PDF a texto

Saca el texto de un PDF y cópialo o guárdalo como archivo .txt. Todo ocurre en tu navegador: el archivo nunca se sube.

  • 100% en tu navegador
  • Sin subir, sin registro
  • Sin límite de páginas ni de tamaño
  • Los archivos no salen de tu dispositivo

Si tu PDF es un escaneo, dentro no hay texto que extraer. Revisamos cada página y te lo decimos antes de que descargues nada.

Por qué la gente saca el texto de un PDF

Un PDF es la descripción de una página impresa. Sabe dónde se sitúa cada carácter, de qué tamaño es y qué tipografía lo dibuja, pero no sabe que esos caracteres forman una frase, un titular o un párrafo. Eso basta cuando solo quieres leer la página, y se convierte en un problema en cuanto quieres hacer otra cosa con lo que dice.

De ahí que se recurra al texto plano. Alguien tiene un informe largo y quiere buscarlo de verdad, o saltar entre secciones en lugar de desplazarse por noventa páginas. Alguien cita un párrafo en un correo y no quiere que la tipografía, los saltos de línea y el formato invisible vengan con él. Alguien pega un documento en un asistente de IA, que quiere palabras y no mobiliario de página. Alguien archiva un contrato en un formato que seguirá abriéndose dentro de veinte años sin ningún programa concreto.

Está también el motivo de accesibilidad, más frecuente de lo que parece. Los diseños a varias columnas son difíciles de leer en el móvil, y un lector de pantalla que sigue el orden equivocado lee una página a dos columnas como un sinsentido. Reducir un documento a sus palabras en el orden correcto lo hace utilizable de formas que el diseño original impedía.

Con subidaSu servidor?Esta webTu equipoNada sale de tu dispositivo, así que no hay copia que borrar.
Otros conversores suben tu documento. Este lo lee donde está.

Dos clases de PDF, y solo una tiene texto

Extraer texto de un PDF significa leer los caracteres guardados dentro del archivo. Eso funciona cuando el PDF tiene capa de texto: las letras reales, conservadas junto a las instrucciones que las dibujan. Un PDF escaneado no tiene capa de texto: es una imagen de una página, y dentro no hay ningún carácter.

La mayoría de los PDF creados por software —exportados desde un procesador de textos, impresos a PDF desde el navegador, generados por un sistema de facturación— llevan capa de texto. Se comprueba abriendo el archivo e intentando seleccionar una frase con el cursor. Si el resaltado sigue a las palabras, los caracteres están de verdad ahí y cualquier herramienta puede leerlos.

Un PDF hecho con un escáner o con la cámara del móvil es distinto. Cada página es una imagen. Tú ves las palabras porque el reconocimiento lo hacen tus ojos, pero para el archivo esa página contiene una fotografía y nada más. Seleccionar no hace nada, buscar no encuentra nada y extraer no devuelve nada: no porque la herramienta haya fallado, sino porque ahí no hay nada que devolver.

Convertir una imagen de palabras otra vez en palabras es otro trabajo, llamado OCR, y es un problema de reconocimiento y no de lectura: el software adivina cada forma y a veces se equivoca. Aquí no lo hacemos. Lo que hacemos es revisar cada página y decir en qué categoría cae, antes de que descargues nada. Una herramienta que te entrega un archivo vacío, o que cambia a OCR en silencio sin decírtelo, te deja sin manera de saber qué clase de documento tenías.

Esta comprobación no es una suposición. Una página con capa de texto devuelve sus caracteres; una sin ella no devuelve nada. No hay término medio en el que equivocarse. Por eso el resultado aparece encima del texto y no enterrado en un aviso más abajo.

Invoice 2026Total 1,240.00Due 30 daysTexto realSolo píxeles
Dos PDF que en pantalla se ven iguales: uno contiene caracteres, el otro solo una imagen de ellos, y ampliar nunca convierte una imagen en palabras.

Cómo extraer el texto de un PDF

No se instala nada y no se sube nada. Suelta el archivo, mira lo que hemos encontrado y llévate el texto como lo necesites.

Suelta un PDFMira el avisoCopia o guarda
Suelta el archivo, lee lo que encontramos y copia o guarda el texto.
1

Suelta tu PDF

Elige un archivo o arrástralo sobre el recuadro. Lo lee tu propio navegador: no se envía a ninguna parte, y no hay más límite de páginas o de tamaño que el que aguante tu dispositivo.

2

Lee primero el resumen

Antes de que aparezca ningún texto sabrás cuántas páginas llevan capa de texto, cuáles son escaneos, si el documento tiene campos de formulario rellenados y si se ha detectado y reordenado un diseño a dos columnas.

3

Ajusta la lectura si hace falta

Por defecto el texto sigue la página tal como la ves y las líneas sueltas se vuelven a unir en párrafos. Ambas cosas se pueden cambiar: el orden del documento conserva la secuencia que guarda el PDF, y dejar cada línea tal cual conserva los saltos originales.

4

Cópialo o guárdalo

Copiar pone el texto directamente en el portapapeles, que es lo que quiere casi todo el mundo al pegar en un documento o en un asistente de IA. Descargar escribe el mismo contenido en un archivo .txt en UTF-8.

Relacionado: Si solo necesitas el texto de unas pocas páginas, es más rápido extraer esas páginas primero.

Qué hace distinto este conversor de PDF a texto

La forma ingenua de extraer es coger la lista de fragmentos que devuelve pdf.js y unirlos sin más. Es una línea de código y produce algo que casi parece correcto, y por eso lo hacen tantas herramientas. En un formulario fiscal de dos páginas, ese enfoque pega palabras a través de setenta y seis saltos de línea. En ocho páginas de un artículo de investigación, doscientos noventa y tres. Salen cosas como «permission toreproduce» y «neural networksin particular», repartidas por el documento donde no las vas a ver necesariamente antes de usar el texto.

El problema de fondo es el orden. Un PDF guarda el texto en el orden en que se pinta sobre la página, que no es el orden en que lo lees. En un formulario, un campo de fecha puede salir como «MM DD YYYY/ /» porque los separadores se dibujan al final. En una página a dos columnas, las dos columnas se entrelazan línea a línea, que es exactamente lo que pasa cuando seleccionas una página entera en un lector de PDF y la pegas. Nosotros reconstruimos el orden de lectura a partir de dónde están realmente los caracteres, lo que devuelve «MM / DD / YYYY» y mantiene cada columna entera.

Y luego están las cosas que es fácil perderse por completo. Si has rellenado un formulario PDF, ninguna de tus respuestas está en el texto de la página: viven en los campos de formulario, y un extractor que solo lee la página te entrega una plantilla en blanco con toda la apariencia de haber funcionado. Nosotros los recogemos y los añadimos al final. Además, algunos generadores de PDF emiten caracteres que parecen correctos y no lo son: un documento en chino puede salir lleno de radicales Kangxi, indistinguibles en pantalla, invisibles para una búsqueda y erróneos al pegarlos. Todas las cadenas que entregamos se normalizan para que vuelvan a los caracteres que representan.

Para qué lo usa la gente:

  • Buscar de verdad en un informe largo, o saltar entre sus secciones
  • Pegar un documento en un asistente de IA sin el mobiliario de página
  • Citar de un artículo sin arrastrar el formato
  • Recuperar las respuestas de un formulario que alguien rellenó y devolvió
  • Archivar un documento como texto plano que se abrirá en cualquier sitio
  • Leer un diseño a varias columnas en el móvil, en una sola columna

Funciona donde ya estás

El trabajo ocurre dentro de tu navegador, así que no hay nada que instalar ni cuenta que crear. Vale cualquier navegador actual en cualquier sistema.

§ 01

Windows

Chrome, Edge o Firefox. Sin lector, sin suscripción a Acrobat, sin nada que descargar.

§ 02

macOS

Safari, Chrome o Firefox. Más rápido que abrir el archivo en Vista Previa y seleccionar página a página.

§ 03

Linux

Cualquier navegador moderno. El mismo resultado que el comando pdftotext, sin salir de la página.

§ 04

iPhone y iPad

Safari o Chrome. Útil cuando llega un PDF por correo y necesitas el texto en un mensaje.

§ 05

Android

Chrome, Firefox o Samsung Internet. Práctico para leer un documento a dos columnas en una sola.

§ 06

Chromebook

Funciona del todo sin conexión una vez cargada la página, lo que encaja con un dispositivo escolar gestionado.

Por qué copiar texto de un PDF suele salir mal

Si alguna vez has seleccionado una página en un lector de PDF, la has pegado y te has encontrado las frases descolocadas, este es el motivo, y es el mismo por el que la mayoría de las herramientas de conversión producen el mismo estropicio.

Orden de dibujoOrden de lectura
Un PDF guarda el texto en el orden en que se dibuja. Nosotros reconstruimos el orden en que lees.

Lo que guarda el PDF

El orden en que se pinta la página. El texto se coloca en la secuencia que le convenía al programa que produjo el archivo: un titular, luego un pie, luego el cuerpo, luego los separadores que caen entre los campos. Copiar sigue esa secuencia, así que en una página a dos columnas obtienes una línea de la izquierda, una de la derecha, y así hasta abajo.

Lo que reconstruimos

El orden en que leerías. Los caracteres se agrupan en líneas según dónde están, las líneas se agrupan en columnas y las columnas se leen una después de otra. Vuelven los saltos de línea, las columnas quedan enteras y los separadores regresan al centro de los campos a los que pertenecen.

Dónde siguen estando los límites

Una imagen de una página no se puede leer en absoluto, y una tabla deja de ser una tabla en cuanto es texto plano: las filas sobreviven, la cuadrícula no. Una línea que cruza ambas columnas sin que ninguna parte atraviese el medianil, como una fila de nombres de autores, es indistinguible de una línea de cada columna, así que un bloque de título puede salir en un orden raro. La propia comunidad de Adobe dice lo mismo de Acrobat: con barras laterales y texto insertado, es «casi imposible» saber qué línea seguir. Cuando nuestra lectura parezca equivocada, cambia al orden del documento y compara.

¿Texto o Word?

El texto plano es la respuesta correcta cuando quieres las palabras y nada más: buscar, citar, pegar en un asistente, archivar. Es la respuesta equivocada cuando necesitas recuperar el documento como documento, con sus titulares, tablas e imágenes; eso es trabajo de una conversión de PDF a Word, y ningún .txt lo hará. Merece la pena saber a por cuál de las dos venías antes de juzgar el resultado.

Tu documento se queda en tu dispositivo

Los archivos que la gente lleva a una herramienta así rara vez son intrascendentes. Son contratos, facturas, currículums, informes médicos, formularios rellenados: documentos en los que lo delicado es todo el contenido. Vale la pena pensarlo antes de subir uno a ninguna parte.

Esta herramienta no sube nada. Tu navegador abre el PDF, lo lee y compone el texto en tu propia máquina. No hay ninguna petición que lleve tu archivo, ninguna cola en un servidor, nada en caché en ningún sitio y ninguna copia que alguien tenga que borrar después. Cierras la pestaña y se acabó.

También significa que los límites de siempre no se aplican. Ni tope de páginas, ni tope de tamaño, ni cuota diaria, porque detrás no hay factura de servidor: solo lo que tu propio dispositivo puede sostener con holgura.

§ 01

Sin subida

El PDF se lee donde ya está. Nunca viaja.

§ 02

Sin cuenta

Sin registro, sin correo, sin marca de agua en el resultado.

§ 03

Sin guardar nada

En nuestro lado no hay copia que almacenar, registrar ni borrar.

Preguntas sobre extraer texto de PDF

¿Por qué el texto extraído sale vacío?
Casi con seguridad porque el PDF es un escaneo. Una página escaneada es una imagen y dentro no hay caracteres que leer: la extracción no devuelve nada porque no hay nada. Abre el archivo e intenta seleccionar una frase; si no aparece resaltado, eso es lo que pasa. Te decimos qué páginas están afectadas en lugar de entregarte un archivo en blanco.
¿Qué es una capa de texto?
Los caracteres guardados dentro del PDF, junto a las instrucciones que los dibujan en pantalla. Un PDF exportado desde un programa la tiene; uno hecho por un escáner o una cámara no, porque en su lugar contiene una fotografía de una página. Todo lo relativo a extraer texto se deriva de cuál de los dos tienes.
¿Hacéis OCR con los PDF escaneados?
No. El OCR reconoce formas y adivina caracteres: es otro trabajo, con otras formas de fallar, y preferimos no fingir lo contrario. Si tus páginas son escaneos lo decimos y te señalamos cómo convertirlas en imágenes, que luego puedes pasar por la herramienta de OCR que prefieras. Lo que no haremos es sustituir en silencio lo que has pedido por una suposición.
¿Por qué copiar y pegar desde un PDF sale desordenado?
Porque un PDF guarda el texto en el orden en que se dibuja, no en el que lo lees. Copiar sigue el orden guardado, así que una página a dos columnas sale entrelazada línea a línea y los campos dibujados en un orden raro salen revueltos. Esta herramienta reconstruye el orden a partir de la posición de los caracteres en la página, por eso el resultado se lee bien donde una copia simple no.
¿Por qué sigue mal el orden en mi documento a dos columnas?
La detección de columnas se basa en el hueco que baja por el centro de la página, y algunos diseños no dan una respuesta limpia: una figura ancha, una barra lateral o una fila de nombres extendida por todo el ancho. Si una página sale en el orden equivocado, cambia el orden de lectura a «orden del documento»: obtienes la secuencia guardada en el PDF, sin modificar, y a veces es la más útil de las dos.
Rellené un formulario PDF, ¿por qué falta mi texto?
Porque lo que escribiste no forma parte de la página. Los valores del formulario viven en los campos de formulario, aparte del texto que ya estaba cuando se creó el documento, así que una herramienta que solo lee la página te da una plantilla en blanco y ningún aviso. Nosotros leemos también los campos y añadimos las respuestas al final del texto, bajo su propio título. Puedes desactivarlo si solo quieres la página.
¿Se mantiene el diseño de las tablas?
No, y ninguna herramienta de texto plano debería prometer otra cosa. Un archivo .txt no tiene noción de tabla: las celdas salen como texto en orden de lectura, fila por fila, sin la cuadrícula. Los límites de columna suelen sobrevivir como espacios, suficiente para ver dónde acaba un campo y empieza el siguiente; si necesitas una tabla de verdad, quieres una hoja de cálculo o una conversión a Word.
¿Convierto a texto o a Word?
A texto si quieres las palabras: buscar, citar, pegar en un asistente de IA, archivar algo que se abra en cualquier parte. A Word si quieres el documento de vuelta como documento, con titulares, tablas, imágenes y estilos. Son trabajos realmente distintos, y un .txt que ha tirado el formato está haciendo exactamente lo que debe.
¿Se suben mis archivos?
No. El PDF lo abre y lo lee tu propio navegador, y el texto se compone en tu dispositivo. No se envía nada a ningún servidor, así que no hay copia en ninguna parte que alguien pueda guardar o borrar. Para una herramienta cuya entrada típica es un contrato, un currículum o un formulario rellenado, eso vale algo.
¿Hay límite de tamaño de archivo?
Ninguno que impongamos nosotros, porque no interviene ningún servidor. El techo real es tu dispositivo: un documento muy grande consume memoria mientras se lee, y un móvil antiguo sufrirá con un archivo que un portátil maneja sin problema. Las páginas se procesan de una en una, así que el progreso sigue avanzando en documentos grandes.
¿Funciona con PDF en chino, japonés, coreano o árabe?
Sí. El texto en cualquier escritura que traiga el PDF se extrae igual, y la salida es UTF-8. Hay un detalle que merece la pena conocer en documentos de Asia Oriental: algunos generadores de PDF emiten radicales Kangxi en lugar de los caracteres normales; se ven idénticos, pero una búsqueda del carácter normal no los encuentra. Nosotros los normalizamos antes de darte el texto, algo que la mayoría de las herramientas no hace.
¿Qué codificación tiene el archivo .txt?
UTF-8, sin marca de orden de bytes. Es lo que esperan los editores, terminales y lenguajes actuales, y mantiene intactos los acentos y los textos en cirílico, griego y de Asia Oriental. Si vienes del comando pdftotext, es la misma convención de salida.

Saca el texto de tu PDF

Gratis, sin límites y procesado enteramente en tu navegador, con una respuesta honesta sobre lo que hay realmente en tu archivo.

Extraer texto de un PDF