EasyPDFLoad

OCR PDF: reconocimiento de texto en un escaneo

Convierte un documento escaneado en un PDF con texto buscable, o extrae su texto plano, con un motor de OCR que funciona por completo en tu dispositivo. La mayoría de las herramientas de OCR gratuitas suben tu escaneo a un servidor para leerlo; esta no lo necesita.

Una página de papel escaneada que se convierte en un PDF buscable con texto resaltado: ilustración generada con IA, EasyPDFLoad

Tu archivo no sale de tu dispositivo. No se copia en ningún servidor ni se guarda en caché. Cada herramienta de este sitio funciona con JavaScript, directamente en la pestaña que tienes abierta.

↑

Suelta tu archivo aquí o haz clic para elegirlo

Por qué convertir en tu navegador y no con un programa de escritorio

  • El OCR se ejecuta por completo en tu navegador con WebAssembly: tu documento escaneado nunca se sube a un servidor para leerlo, a diferencia de la mayoría de las herramientas gratuitas.
  • Puedes elegir un PDF con texto buscable (conserva la imagen escaneada original y añade una capa de texto invisible que puedes seleccionar y buscar) o un archivo .txt si solo necesitas las palabras.
  • Somos claros con la contrapartida: el OCR en el navegador es más lento que una granja de servidores, sobre todo con escaneos largos o de mala calidad, pero nada de tu documento sale de tu dispositivo para lograrlo.
  • Gratis, sin límite de páginas impuesto por nosotros y sin marca de agua en el resultado.

Cómo funciona OCR, paso a paso

  1. Colorful PDF files dropping onto a dashed upload area labeled drop PDFs — AI-generated illustration, EasyPDFLoad1

    Elige el PDF

    Arrastra a la herramienta el PDF escaneado, o haz clic para elegirlo. El escaneo se queda en tu dispositivo.

  2. Laptop browser processing PDF files on the device with an unused cloud icon in the background — AI-generated illustration, EasyPDFLoad2

    Elige el resultado

    Elige qué hacer con el texto reconocido: «Convertirlo en un PDF con texto buscable» (conserva el aspecto original y añade texto seleccionable) o «Solo extraer el texto (.txt)».

  3. A scanned paper page transforming into a searchable PDF with highlighted text — AI-generated illustration, EasyPDFLoad3

    Ejecuta el OCR

    Pulsa «Ejecutar OCR» y espera mientras se lee cada página. Con más páginas hace falta más tiempo, ya que el trabajo lo hace tu dispositivo.

  4. Finished PDF with a green checkmark ready to download from the browser — AI-generated illustration, EasyPDFLoad4

    Descarga

    Descarga el resultado: un PDF con texto buscable o un archivo .txt, según lo que hayas elegido.

Cuándo hace falta

Una investigadora solo tiene como PDF escaneado un artículo de 15 páginas y necesita citar un párrafo de la página 9 sin volver a teclearlo. Ejecuta el OCR con «Solo extraer el texto (.txt)» y copia el párrafo directamente del archivo de texto en lugar de transcribirlo palabra por palabra.

Cómo funciona la conversión en realidad

Esta herramienta carga Tesseract.js, un motor de OCR compilado a WebAssembly, directamente en la pestaña de tu navegador, junto con los datos de idioma que necesita. En la primera ejecución se descargan una sola vez (unos pocos megabytes); después, todo el reconocimiento ocurre localmente. Cada página del escaneo se dibuja en un lienzo, se pasa al motor y se lee en la CPU de tu dispositivo: ninguna imagen de página ni texto extraído se envía a un servidor. Según tu elección, el resultado son las imágenes originales de las páginas con una capa de texto invisible y seleccionable (PDF con texto buscable) o un .txt con todo lo reconocido. Puedes comprobarlo tú mismo: F12, pestaña «Red», y ejecuta el OCR; no sale ninguna petición con tu archivo.

Qué conviene saber antes de convertir

  • Es bastante más lento que un servicio de OCR en servidor, porque el reconocimiento lo hace tu dispositivo y no una granja de servidores; los escaneos largos o de muchas páginas pueden tardar.
  • La precisión depende de la calidad del escaneo: el texto impreso nítido, derecho y de buena resolución se lee bien, mientras que la letra manuscrita, las páginas torcidas o las fotos de baja resolución generan más errores.
  • El motor de reconocimiento que se carga es el de inglés. En textos en español, las letras con acento y la ñ pueden salir mal reconocidas: revisa el resultado antes de fiarte de él.
  • La primera ejecución descarga el motor de OCR y los datos de idioma (unos pocos megabytes) antes de poder empezar; después quedan en la caché de tu navegador y las siguientes son más rápidas.
  • Un PDF protegido con contraseña hay que desbloquearlo antes, porque dibujar las páginas para reconocerlas exige abrir el archivo directamente.

OCR PDF: lo que el reconocimiento de texto no lee de forma fiable, comprueba el resultado antes de fiarte

  • Escritura a mano. Este motor está entrenado con texto impreso. La letra cursiva o las notas manuscritas darán una salida ilegible o incompleta, no una transcripción aproximada.
  • Páginas torcidas o giradas. Una página escaneada aunque sea un poco torcida se lee peor que una recta: gírala antes con Rotar PDF si un escaneo entró de lado.
  • Fotos de baja resolución o poco contraste. Una foto del móvil tomada en ángulo, con mala luz o muy comprimida pierde el detalle de los caracteres que necesita el OCR: un escaneo con escáner de cama plana se lee con mucha más precisión.
  • Idiomas distintos del inglés. Esta herramienta carga actualmente solo el modelo de idioma inglés. El texto en otros idiomas se reconocerá mal o no se reconocerá.
  • Tablas complejas y diseños de varias columnas. El OCR lee bien el texto de izquierda a derecha y de arriba abajo, pero la estructura de una tabla (qué celda pertenece a qué fila) no se conserva: espera las palabras, no el diseño.
  • Texto con marca de agua o poco contraste. El texto que se superpone a una marca de agua, un sello o un color de fondo claro es más difícil de separar de la página que el texto negro limpio sobre blanco.

Preguntas frecuentes

¿Se sube mi archivo?+
No. El reconocimiento se ejecuta localmente en tu navegador con WebAssembly. Lo único que se descarga es el motor de OCR y su modelo de idioma (unos pocos megabytes, la primera vez), nunca tu documento. Puedes verificarlo en la pestaña «Red».
¿Cuánto tarda el reconocimiento de texto?+
La primera vez también se descarga el motor de OCR (unos pocos megabytes, una sola vez). Después, el tiempo depende del número de páginas y de la calidad del escaneo: con pocas páginas suele ser rápido, con escaneos largos o de mala calidad puede tardar.
¿Se conserva el diseño original?+
Con «Convertirlo en un PDF con texto buscable», sí: las imágenes de las páginas no cambian y solo se agrega detrás una capa de texto invisible y seleccionable.
¿Qué tan preciso es el reconocimiento?+
Es muy confiable en escaneos nítidos y bien iluminados de texto impreso. La letra manuscrita, las fotos torcidas o el texto muy pequeño empeoran el resultado, y eso es un límite del OCR en general, no solo de esta herramienta.
¿Puedo obtener solo el texto plano?+
Sí. Elige «Solo extraer el texto (.txt)» para obtener un archivo de texto plano con todo lo que el motor pudo leer, en lugar de un PDF con texto buscable.
¿Uso OCR o PDF a texto?+
Si ya puedes seleccionar y copiar palabras del PDF en tu lector, tiene una capa de texto real y basta con extraerla. Usa OCR cuando el PDF es un escaneo o una foto de la página y no puedes marcar las palabras.

Herramientas relacionadas