PDF a texto
Saca el texto de un PDF y cópialo o guárdalo como archivo .txt. Todo ocurre en tu navegador: el archivo nunca se sube.
Suelta un PDF para extraer su texto
o haz clic para elegir un archivo
- 100% en tu navegador
- Sin subir, sin registro
- Sin límite de páginas ni de tamaño
- Los archivos no salen de tu dispositivo
Si tu PDF es un escaneo, dentro no hay texto que extraer. Revisamos cada página y te lo decimos antes de que descargues nada.
Por qué la gente saca el texto de un PDF
Un PDF es la descripción de una página impresa. Sabe dónde se sitúa cada carácter, de qué tamaño es y qué tipografía lo dibuja, pero no sabe que esos caracteres forman una frase, un titular o un párrafo. Eso basta cuando solo quieres leer la página, y se convierte en un problema en cuanto quieres hacer otra cosa con lo que dice.
De ahí que se recurra al texto plano. Alguien tiene un informe largo y quiere buscarlo de verdad, o saltar entre secciones en lugar de desplazarse por noventa páginas. Alguien cita un párrafo en un correo y no quiere que la tipografía, los saltos de línea y el formato invisible vengan con él. Alguien pega un documento en un asistente de IA, que quiere palabras y no mobiliario de página. Alguien archiva un contrato en un formato que seguirá abriéndose dentro de veinte años sin ningún programa concreto.
Está también el motivo de accesibilidad, más frecuente de lo que parece. Los diseños a varias columnas son difíciles de leer en el móvil, y un lector de pantalla que sigue el orden equivocado lee una página a dos columnas como un sinsentido. Reducir un documento a sus palabras en el orden correcto lo hace utilizable de formas que el diseño original impedía.
Dos clases de PDF, y solo una tiene texto
Extraer texto de un PDF significa leer los caracteres guardados dentro del archivo. Eso funciona cuando el PDF tiene capa de texto: las letras reales, conservadas junto a las instrucciones que las dibujan. Un PDF escaneado no tiene capa de texto: es una imagen de una página, y dentro no hay ningún carácter.
La mayoría de los PDF creados por software —exportados desde un procesador de textos, impresos a PDF desde el navegador, generados por un sistema de facturación— llevan capa de texto. Se comprueba abriendo el archivo e intentando seleccionar una frase con el cursor. Si el resaltado sigue a las palabras, los caracteres están de verdad ahí y cualquier herramienta puede leerlos.
Un PDF hecho con un escáner o con la cámara del móvil es distinto. Cada página es una imagen. Tú ves las palabras porque el reconocimiento lo hacen tus ojos, pero para el archivo esa página contiene una fotografía y nada más. Seleccionar no hace nada, buscar no encuentra nada y extraer no devuelve nada: no porque la herramienta haya fallado, sino porque ahí no hay nada que devolver.
Convertir una imagen de palabras otra vez en palabras es otro trabajo, llamado OCR, y es un problema de reconocimiento y no de lectura: el software adivina cada forma y a veces se equivoca. Aquí no lo hacemos. Lo que hacemos es revisar cada página y decir en qué categoría cae, antes de que descargues nada. Una herramienta que te entrega un archivo vacío, o que cambia a OCR en silencio sin decírtelo, te deja sin manera de saber qué clase de documento tenías.
Esta comprobación no es una suposición. Una página con capa de texto devuelve sus caracteres; una sin ella no devuelve nada. No hay término medio en el que equivocarse. Por eso el resultado aparece encima del texto y no enterrado en un aviso más abajo.
Cómo extraer el texto de un PDF
No se instala nada y no se sube nada. Suelta el archivo, mira lo que hemos encontrado y llévate el texto como lo necesites.
Suelta tu PDF
Elige un archivo o arrástralo sobre el recuadro. Lo lee tu propio navegador: no se envía a ninguna parte, y no hay más límite de páginas o de tamaño que el que aguante tu dispositivo.
Lee primero el resumen
Antes de que aparezca ningún texto sabrás cuántas páginas llevan capa de texto, cuáles son escaneos, si el documento tiene campos de formulario rellenados y si se ha detectado y reordenado un diseño a dos columnas.
Ajusta la lectura si hace falta
Por defecto el texto sigue la página tal como la ves y las líneas sueltas se vuelven a unir en párrafos. Ambas cosas se pueden cambiar: el orden del documento conserva la secuencia que guarda el PDF, y dejar cada línea tal cual conserva los saltos originales.
Cópialo o guárdalo
Copiar pone el texto directamente en el portapapeles, que es lo que quiere casi todo el mundo al pegar en un documento o en un asistente de IA. Descargar escribe el mismo contenido en un archivo .txt en UTF-8.
Relacionado: Si solo necesitas el texto de unas pocas páginas, es más rápido extraer esas páginas primero.
Qué hace distinto este conversor de PDF a texto
La forma ingenua de extraer es coger la lista de fragmentos que devuelve pdf.js y unirlos sin más. Es una línea de código y produce algo que casi parece correcto, y por eso lo hacen tantas herramientas. En un formulario fiscal de dos páginas, ese enfoque pega palabras a través de setenta y seis saltos de línea. En ocho páginas de un artículo de investigación, doscientos noventa y tres. Salen cosas como «permission toreproduce» y «neural networksin particular», repartidas por el documento donde no las vas a ver necesariamente antes de usar el texto.
El problema de fondo es el orden. Un PDF guarda el texto en el orden en que se pinta sobre la página, que no es el orden en que lo lees. En un formulario, un campo de fecha puede salir como «MM DD YYYY/ /» porque los separadores se dibujan al final. En una página a dos columnas, las dos columnas se entrelazan línea a línea, que es exactamente lo que pasa cuando seleccionas una página entera en un lector de PDF y la pegas. Nosotros reconstruimos el orden de lectura a partir de dónde están realmente los caracteres, lo que devuelve «MM / DD / YYYY» y mantiene cada columna entera.
Y luego están las cosas que es fácil perderse por completo. Si has rellenado un formulario PDF, ninguna de tus respuestas está en el texto de la página: viven en los campos de formulario, y un extractor que solo lee la página te entrega una plantilla en blanco con toda la apariencia de haber funcionado. Nosotros los recogemos y los añadimos al final. Además, algunos generadores de PDF emiten caracteres que parecen correctos y no lo son: un documento en chino puede salir lleno de radicales Kangxi, indistinguibles en pantalla, invisibles para una búsqueda y erróneos al pegarlos. Todas las cadenas que entregamos se normalizan para que vuelvan a los caracteres que representan.
Para qué lo usa la gente:
- Buscar de verdad en un informe largo, o saltar entre sus secciones
- Pegar un documento en un asistente de IA sin el mobiliario de página
- Citar de un artículo sin arrastrar el formato
- Recuperar las respuestas de un formulario que alguien rellenó y devolvió
- Archivar un documento como texto plano que se abrirá en cualquier sitio
- Leer un diseño a varias columnas en el móvil, en una sola columna
Funciona donde ya estás
El trabajo ocurre dentro de tu navegador, así que no hay nada que instalar ni cuenta que crear. Vale cualquier navegador actual en cualquier sistema.
Windows
Chrome, Edge o Firefox. Sin lector, sin suscripción a Acrobat, sin nada que descargar.
macOS
Safari, Chrome o Firefox. Más rápido que abrir el archivo en Vista Previa y seleccionar página a página.
Linux
Cualquier navegador moderno. El mismo resultado que el comando pdftotext, sin salir de la página.
iPhone y iPad
Safari o Chrome. Útil cuando llega un PDF por correo y necesitas el texto en un mensaje.
Android
Chrome, Firefox o Samsung Internet. Práctico para leer un documento a dos columnas en una sola.
Chromebook
Funciona del todo sin conexión una vez cargada la página, lo que encaja con un dispositivo escolar gestionado.
Por qué copiar texto de un PDF suele salir mal
Si alguna vez has seleccionado una página en un lector de PDF, la has pegado y te has encontrado las frases descolocadas, este es el motivo, y es el mismo por el que la mayoría de las herramientas de conversión producen el mismo estropicio.
Lo que guarda el PDF
El orden en que se pinta la página. El texto se coloca en la secuencia que le convenía al programa que produjo el archivo: un titular, luego un pie, luego el cuerpo, luego los separadores que caen entre los campos. Copiar sigue esa secuencia, así que en una página a dos columnas obtienes una línea de la izquierda, una de la derecha, y así hasta abajo.
Lo que reconstruimos
El orden en que leerías. Los caracteres se agrupan en líneas según dónde están, las líneas se agrupan en columnas y las columnas se leen una después de otra. Vuelven los saltos de línea, las columnas quedan enteras y los separadores regresan al centro de los campos a los que pertenecen.
Dónde siguen estando los límites
Una imagen de una página no se puede leer en absoluto, y una tabla deja de ser una tabla en cuanto es texto plano: las filas sobreviven, la cuadrícula no. Una línea que cruza ambas columnas sin que ninguna parte atraviese el medianil, como una fila de nombres de autores, es indistinguible de una línea de cada columna, así que un bloque de título puede salir en un orden raro. La propia comunidad de Adobe dice lo mismo de Acrobat: con barras laterales y texto insertado, es «casi imposible» saber qué línea seguir. Cuando nuestra lectura parezca equivocada, cambia al orden del documento y compara.
¿Texto o Word?
El texto plano es la respuesta correcta cuando quieres las palabras y nada más: buscar, citar, pegar en un asistente, archivar. Es la respuesta equivocada cuando necesitas recuperar el documento como documento, con sus titulares, tablas e imágenes; eso es trabajo de una conversión de PDF a Word, y ningún .txt lo hará. Merece la pena saber a por cuál de las dos venías antes de juzgar el resultado.
Tu documento se queda en tu dispositivo
Los archivos que la gente lleva a una herramienta así rara vez son intrascendentes. Son contratos, facturas, currículums, informes médicos, formularios rellenados: documentos en los que lo delicado es todo el contenido. Vale la pena pensarlo antes de subir uno a ninguna parte.
Esta herramienta no sube nada. Tu navegador abre el PDF, lo lee y compone el texto en tu propia máquina. No hay ninguna petición que lleve tu archivo, ninguna cola en un servidor, nada en caché en ningún sitio y ninguna copia que alguien tenga que borrar después. Cierras la pestaña y se acabó.
También significa que los límites de siempre no se aplican. Ni tope de páginas, ni tope de tamaño, ni cuota diaria, porque detrás no hay factura de servidor: solo lo que tu propio dispositivo puede sostener con holgura.
Sin subida
El PDF se lee donde ya está. Nunca viaja.
Sin cuenta
Sin registro, sin correo, sin marca de agua en el resultado.
Sin guardar nada
En nuestro lado no hay copia que almacenar, registrar ni borrar.
Preguntas sobre extraer texto de PDF
¿Por qué el texto extraído sale vacío?⌄
¿Qué es una capa de texto?⌄
¿Hacéis OCR con los PDF escaneados?⌄
¿Por qué copiar y pegar desde un PDF sale desordenado?⌄
¿Por qué sigue mal el orden en mi documento a dos columnas?⌄
Rellené un formulario PDF, ¿por qué falta mi texto?⌄
¿Se mantiene el diseño de las tablas?⌄
¿Convierto a texto o a Word?⌄
¿Se suben mis archivos?⌄
¿Hay límite de tamaño de archivo?⌄
¿Funciona con PDF en chino, japonés, coreano o árabe?⌄
¿Qué codificación tiene el archivo .txt?⌄
Saca el texto de tu PDF
Gratis, sin límites y procesado enteramente en tu navegador, con una respuesta honesta sobre lo que hay realmente en tu archivo.
Extraer texto de un PDFArtículos relacionados
Profundiza en la conversión de PDF a PNG con nuestras guías y análisis más recientes
Cómo convertir PDF a PNG en línea (métodos gratis y rápidos)
Guía completa para convertir PDF a PNG en línea de forma gratuita. Compara los 5 mejores convertidores, sigue procesos paso a paso, consejos avanzados y resolución de problemas.
Leer artículoCómo pasar un PDF a PNG en Windows, Mac y móvil
Guía específica por plataforma para convertir PDF a PNG en cualquier dispositivo. Herramientas nativas, recomendaciones de software y apps móviles cubiertas.
Leer artículoPDF a PNG frente a PDF a JPG: ¿qué formato deberías elegir?
Comparativa detallada entre los formatos PNG y JPG al convertir desde PDF. Tamaños de archivo, diferencias de calidad, casos de uso y guía para decidir.
Leer artículoHerramientas de conversión relacionadas
Descubre más herramientas de nuestra suite completa de conversión de archivos
Extraer páginas de PDF
Saca las páginas que necesitas a un PDF nuevo, o un archivo por página. Tu original queda intacto. Sin subir nada.
Aplanar PDF
Fusiona los campos de formulario rellenados y los comentarios en la página. El texto sigue siendo texto, y lo que no se puede fusionar se avisa en lugar de borrarse.
Desbloquear un PDF
Quita una contraseña que ya tienes o levanta los límites de impresión y copia que no necesitan ninguna. Sin subir nada.