Ir al contenido

Cómo convertir una imagen de PDF a texto, gratis y en local

12 de septiembre de 2026

Un PDF es un contenedor, no un formato de texto. Algunas páginas guardan caracteres reales con posiciones y tipografías; otras no guardan más que la fotografía de una página. En un visor se ven idénticas, y solo una de las dos se puede copiar. Convertir una imagen de PDF a texto consiste en encontrar las del segundo tipo y pasarles reconocimiento óptico de caracteres.

Cómo saber qué tipo de página tienes

Abre el PDF e intenta seleccionar una línea arrastrando.

  • Aparece el cursor de texto y las palabras se resaltan: hay capa de texto real. No hay nada que convertir; una copia normal funcionará, aunque puede salir mal formateada.
  • No se resalta nada, o un rectángulo azul cubre la página entera: la página es una imagen. Esto es lo que necesita OCR.
  • El texto se resalta pero al pegar salen □□□ o letras equivocadas: hay capa de texto, pero su mapa de caracteres está roto, normalmente por una tipografía incrustada parcialmente. Copiar nunca funcionará bien en esa página. Trátala como una imagen y pásala por OCR.

El tercer caso sorprende. La página no es un escaneo ni está bloqueada; simplemente la correspondencia entre las formas de los glifos y los caracteres está dañada, y por mucho que repitas la copia no se arregla.

Cómo convertirla

Arrastra el archivo a extraer texto de un PDF. Cada página se comprueba por separado:

  1. Las páginas con una capa de texto utilizable se leen directamente de ella: más rápido y exacto carácter a carácter, porque no se está adivinando nada.
  2. Las que no la tienen se renderizan como mapa de bits y pasan por OCR en local.
  3. Los resultados se vuelven a coser en un único documento, en orden de página.

La comprobación página a página importa más de lo que parece. Los archivos mixtos son habituales: un informe digital con una página de firmas escaneada, un artículo con figuras fotografiadas, un contrato del que solo la página firmada volvió por el escáner. Una herramienta que decide una sola vez «este archivo es un escaneo» o «este archivo es digital» se equivoca en las dos direcciones: o pierde minutos pasando OCR a páginas que no lo necesitaban, o se salta en silencio las páginas que son solo imagen.

Si una página parece seleccionable pero el texto extraído es basura —el caso de la codificación rota de arriba—, usa Volver a extraer con OCR para forzar el camino de imagen en todo el archivo.

Qué sale, y qué hay que arreglar

Dos cosas piden atención de forma fiable después de convertir un PDF escaneado.

Encabezados y pies repetidos. Cada página de un informe lleva el título del documento, un número de página y quizá un aviso de confidencialidad. Extraídos sin más, esas líneas aparecen cada pocos cientos de palabras a lo largo de tu texto. Se detectan a lo largo del documento y se eliminan de la salida combinada, y esa es la mayor diferencia de calidad entre una conversión utilizable de un documento largo y una inservible.

Líneas cortadas. Un PDF guarda el texto como fragmentos colocados, así que al copiar suele llegar una palabra por línea, o con cada línea terminando donde terminaba la columna y no donde terminaba la frase. Activa la limpieza para volver a unirlas en párrafos y quitar la partición de palabras sobrante. Desactívala si los saltos de línea significan algo, como en un listado de código.

Las tablas de páginas escaneadas pasan por la misma reconstrucción que las imágenes: selecciona la zona y llévatela como Excel, Markdown o CSV en lugar de como texto plano, que aplanaría las columnas en espacios.

Cuánto tarda

Las páginas con capa de texto son prácticamente instantáneas. Las de OCR tardan unos segundos cada una, en tu propia CPU, porque el modelo de reconocimiento corre en tu navegador y no en un servidor. Un escaneo de 200 páginas es genuinamente lento: ese es el precio honesto de no subirlo. Para un puñado de páginas escaneadas dentro de un documento por lo demás digital, que es el caso habitual, no lo vas a notar.

Por qué aquí lo local importa

De todo lo que la gente pasa por OCR, los PDF son con diferencia la categoría más sensible: contratos, facturas, resultados médicos, extractos bancarios, acuerdos firmados, documentos de identidad. Son exactamente los archivos que no deberían subirse a un servicio web gratuito a cambio de una caja de texto.

Aquí pdf.js analiza el archivo y el modelo de OCR se ejecuta dentro de la pestaña. Los bytes del archivo no van a ninguna parte, y el texto extraído tampoco. El razonamiento completo está aquí.

Sacar un resultado mejor de un escaneo malo

Si el escaneo de partida es malo, la conversión también lo será. Vuelve a escanear a 300 ppp si tienes el original: los 150 ppp son la causa habitual de una salida ilegible. Escanea en escala de grises en vez de aplicar un umbral agresivo a blanco y negro, que se come los trazos finos en documentos desvaídos. Endereza las páginas torcidas antes de escanear, no después.

Hay más sobre todo esto en extraer texto de un PDF escaneado y en 7 formas de mejorar los resultados del OCR.