Cómo hacer buscable un PDF escaneado
- Suelta tu PDF escaneado en la caja de arriba, o haz clic en Elegir archivo.
- Elige el Idioma del texto que coincida con el idioma escrito en el documento (inglés es el valor por defecto), y opcionalmente sube o baja la Resolución de OCR (más alta normalmente significa mejor precisión pero un procesamiento más lento).
- Haz clic en Hacer buscable y deja correr la barra de progreso, cada página necesita su propio paso de renderizado y su propia pasada completa de OCR, así que esto es más lento que la mayoría de las herramientas de este sitio. Consulta las preguntas frecuentes de abajo para expectativas reales y honestamente medidas.
- Descarga el resultado: un PDF que se ve exactamente igual que el que subiste, pero en el que ahora puedes seleccionar texto, copiarlo y encontrarlo con Ctrl+F.
¿Por qué hacer buscable un PDF escaneado?
Un documento escaneado (un contrato fotocopiado, un formulario de papel antiguo pasado por un escáner, un recibo fotografiado guardado como PDF) parece texto a un ojo humano, pero para cualquier programa informático es solo una imagen. No puedes seleccionar una frase, copiar una cláusula, buscar una palabra clave, o pasar el archivo por un traductor o un flujo de trabajo basado en texto, porque no hay ningún texto real en ningún sitio del archivo: solo píxeles dispuestos para parecer letras.
El reconocimiento óptico de caracteres (OCR) resuelve esto analizando esos píxeles, reconstruyendo los caracteres reales, y colocándolos de vuelta en el PDF como una capa de texto invisible que se sitúa exactamente encima de la imagen escaneada original, posicionada palabra por palabra para alinearse con lo que realmente está impreso en la página. La página todavía SE VE como el escaneo que subiste (nada de su apariencia cambia), pero por debajo, ahora existe una capa de texto genuinamente buscable, seleccionable y copiable. Esta es la misma técnica central que usan las herramientas comerciales de “hacer PDF buscable” y las apps de escaneo dedicadas.
Esta herramienta usa Tesseract, el motor de OCR de código abierto originalmente desarrollado en HP y ahora mantenido por Google, compilado a WebAssembly para que se ejecute directamente dentro de tu pestaña del navegador, combinado con PDF.js (el mismo motor detrás del visor de PDF integrado de Firefox) para renderizar cada página, y pdf-lib para escribir la capa de texto invisible de vuelta en el PDF sin tocar un solo píxel visible.
Cómputo pesado, honestamente divulgado
El OCR es genuinamente intensivo en CPU, y cada página de tu PDF necesita una pasada completa de renderizado y luego reconocimiento, no hay ningún atajo alrededor de eso. Además, este sitio (como cada herramienta aquí) nunca puede enviar las cabeceras de respuesta COOP/COEP que un navegador requiere para desbloquear WebAssembly multihilo, porque esas cabeceras rompen los anuncios que mantienen gratuitas todas las herramientas de este sitio, así que la versión WebAssembly de Tesseract se ejecuta en un solo núcleo de CPU, la misma restricción con la que ya viven las herramientas de vídeo, audio e imagen de este sitio. En nuestra propia medición real, reconocer una sola imagen de prueba modesta tardó unos 300ms de tiempo puro de reconocimiento tras un arranque único de motor de aproximadamente 400ms, una página completa y densa de texto escaneado, y un documento con muchas páginas, tardarán proporcionalmente más. Espera que un documento escaneado de varias páginas tarde entre decenas de segundos y varios minutos; prueba primero con un documento corto si quieres ver cómo se comporta tu propio dispositivo.
Tu documento nunca sale de tu dispositivo
Los documentos escaneados que vale la pena hacer buscables son a menudo exactamente los que menos querrías en el servidor de otra persona: un contrato firmado, un documento de identidad o pasaporte escaneado, un formulario médico, un documento bancario o fiscal. La mayoría de las herramientas online de “hacer PDF buscable” te piden subir exactamente ese archivo a sus servidores, donde puede quedar en registros o almacenamiento temporal sobre el que no tienes ninguna visibilidad.
SysFenix funciona al revés: el renderizador de PDF, el motor de OCR y el escritor de PDF se descargan una vez en tu pestaña del navegador y cada página se procesa localmente, en la propia CPU de tu dispositivo. Nada sobre el documento, y nada sobre el texto que contiene, se transmite jamás a ningún sitio. Cierra la pestaña y nada de ello existe en ningún sitio salvo en tu propio PDF descargado.
Usos habituales
- Hacer buscable un contrato, contrato de alquiler o documento legal antiguo escaneado para poder buscar con Ctrl+F una cláusula específica en lugar de leer todo de nuevo.
- Convertir un recibo, factura o formulario de gastos escaneado en algo que puedas buscar y de donde copiar texto para contabilidad.
- Hacer buscable un formulario fotocopiado, certificado o documento de identidad antes de archivarlo.
- Preparar un capítulo de libro, artículo o folleto escaneado para que las citas y pasajes puedan seleccionarse y copiarse.
- Digitalizar una pila de registros de papel antiguos en PDFs que realmente puedas buscar en lugar de abrir uno por uno.