CyvoDocOps
Español
Dark

Cómo hacer que un PDF escaneado sea buscable

Escaneas cuarenta páginas de contratos antiguos, las guardas en un único y ordenado PDF, y buscas la palabra «indemnización». Ctrl+F no encuentra nada. Puedes ver la palabra —está justo ahí en la página doce— pero tu ordenador no puede, porque para él esa página no contiene palabras. Contiene una fotografía.

Tres tipos de PDF que parecen idénticos

Casi toda la confusión sobre los escaneos comienza aquí. Tres archivos muy diferentes pueden aparecer iguales en pantalla:

El tercer tipo es lo que quieres, y OCR es cómo llegas allí.

La versión corta: un escaneo es una imagen de texto. OCR lee la imagen y escribe las palabras. Un PDF con capacidad de búsqueda conserva la imagen y guarda discretamente las palabras detrás de ella.

Lo que hace realmente el OCR

El Reconocimiento Óptico de Caracteres examina los píxeles, encuentra formas que parecen caracteres y decide qué caracteres son. Los motores modernos no comparan letras una por una como un estarcido; trabajan a lo largo de líneas de texto, utilizando las formas y el contexto circundante para resolver ambigüedades. Ese contexto es la razón por la que un buen motor lee "rn" como dos letras en "moderno", pero aún podría fallar con ello en un escaneo borroso: está haciendo una suposición informada, cada vez.

Esa palabra —suponer— es el núcleo honesto del OCR. Es una lectura probabilística de una imagen, no una conversión sin pérdidas. Generalmente una suposición muy buena. Nunca una garantizada.

Por qué un PDF con capacidad de búsqueda suele ser lo que quieres

Podrías hacer OCR a un escaneo y conservar solo el texto, pero tirarías por la borda el documento: la firma, el membrete, la mancha de café, el diseño; todo lo que hace que sea el original y no una transcripción. Y dado que el OCR es imperfecto, una versión de texto puro no tiene forma de comprobarse a sí misma.

Un PDF con capacidad de búsqueda evita ese compromiso. La imagen escaneada se mantiene exactamente como estaba, sin tocarla. El texto reconocido se añade como una capa invisible posicionada sobre las palabras a las que corresponde. Ves el original; tu ordenador ve el texto; cuando copias un párrafo obtienes las palabras, y cuando aparece un error de reconocimiento, la página real sigue ahí para compararlo.

Qué impulsa realmente la precisión

La calidad del OCR se decide mucho antes de que el motor funcione, sobre todo en el momento del escaneo:

Si un escaneo sale mal, la solución de mayor valor casi nunca es una configuración diferente de OCR. Es volver a escanearlo: más plano, más brillante, más recto, a 300 ppp. Diez segundos en el escáner valen más que una hora corrigiendo el resultado.

¿PDF con capacidad de búsqueda o texto sin formato?

Dos objetivos diferentes, dos herramientas distintas, y elegir la equivocada te hará perder tiempo:

Si no estás seguro, elige el PDF con capacidad de búsqueda. Siempre puedes extraer el texto más tarde; no puedes recuperar una página que descartaste.

Cómo hacerlo

OCR en CyvoDocOps se ejecuta en tu propio dispositivo — nunca se sube el escaneo a un servidor. Forma parte de CyvoDocOps Pro, y como Pro se compra a través de la App Store o Google Play en lugar de por la web, las herramientas de OCR residen en la aplicación móvil.

  1. Consigue el mejor escaneo posible. 300 ppp, plano, buena luz, recto. Este paso decide tu resultado más que cualquier otro.
  2. Abre el documento en la aplicación CyvoDocOps. Consulta la aplicación si no la tienes.
  3. Elige tu herramienta. Usa PDF con búsqueda para mantener la página y añadir la capa oculta; Extraer texto para sacar las palabras; o OCR en inglés o OCR en árabe según el idioma que estés leyendo.
  4. Revisa el resultado. Busca una palabra que sepas que está en la página uno. Si no aparece, significa que el reconocimiento tuvo dificultades, lo cual suele apuntar de nuevo al escaneo.

Obtén la aplicación CyvoDocOps

Ser sinceros sobre las limitaciones

Árabe y otros scripts

La dificultad del reconocimiento varía enormemente según el script. El árabe es notablemente más difícil que el inglés: las letras se unen, sus formas cambian según la posición en la palabra, los diacríticos tienen significado y el texto va de derecha a izquierda. Un modelo entrenado para inglés no sirve para él; necesitas el modelo de árabe, a través de OCR Árabe. Si ese es tu caso de uso, trabajar con PDFs en árabe cubre los detalles.

Por qué importa el procesamiento local

Piensa en lo que la gente escanea realmente: contratos, cartas médicas, extractos bancarios, pasaportes, registros fiscales. Escanear es lo que le haces a los documentos que existen en papel porque son importantes. Enviar esa pila a un servidor de otra persona para su procesamiento es un trato extraño —y común, porque la mayoría de los servicios OCR no tienen otra forma de funcionar. Ejecutar el reconocimiento en tu propio dispositivo mantiene el documento donde empezó. Nada se sube, así que no hay nada que retener, registrar o filtrar.

Preguntas frecuentes

¿Por qué no puedo buscar en mi PDF escaneado?

Porque no contiene texto. Cada página es una imagen, y la búsqueda busca caracteres. El OCR es lo que convierte la imagen en palabras que tu ordenador puede encontrar.

¿Hacer un PDF buscable cambia su apariencia?

No. La imagen escaneada se conserva exactamente. El texto reconocido se añade como una capa invisible detrás de ella.

¿Funcionará el OCR en la escritura a mano?

No. El motor está diseñado para texto impreso por máquina. La escritura a mano es un problema diferente y no es un caso de uso compatible.

¿Por qué el OCR está en la aplicación y no en el navegador?

Es parte de CyvoDocOps Pro, y Pro se compra a través de App Store o Google Play; no hay pago web, por lo que las herramientas viven en la aplicación. El reconocimiento funciona en tu dispositivo de todos modos.

¿Se sube mi escaneo para OCR?

No. El reconocimiento se ejecuta completamente en tu dispositivo y el documento no se envía a un servidor.

Guías y herramientas relacionadas