CyvoDocOps
Español
Dark

Trabajar con PDFs en árabe

Abres un contrato en árabe, seleccionas un párrafo, lo copias y lo pegas en un correo electrónico. Lo que aparece es una fila de letras desconectadas — o las letras correctas en el orden incorrecto, o una cadena de caracteres que parecen casi bien y no lo son. El PDF se muestra perfectamente. En el momento en que intentas extraer el texto, se desmorona. Esto no significa que tu software esté roto. Es un problema genuinamente difícil que está saliendo a la luz.

Por qué el árabe es más complicado que el alfabeto latino

El inglés exige muy poco de un sistema de texto: las letras están en una fila, de izquierda a derecha, y cada una tiene la misma forma dondequiera que aparezca. El árabe exige considerablemente más, y cada una de estas características es un punto donde fallan las herramientas:

Así que mostrar el árabe correctamente requiere que el renderizador seleccione la forma correcta para cada letra basándose en sus vecinas, y luego disponga las secuencias de direcciones mixtas de manera coherente. De ambos pasos proviene el problema.

La versión corta: un PDF almacena imágenes de letras y una nota sobre dónde dibujarlas. Para el alfabeto latino, generalmente puedes trabajar hacia atrás desde la imagen hasta el carácter. Para el árabe, esa ruta es con pérdida, por lo que la página se ve perfecta y la copia no.

Formado (Shaping), y por qué copiar y pegar falla

Aquí está el mecanismo, porque saberlo explica cada síntoma que encontrarás.

El texto se almacena en orden lógico —el orden en que lo dirías. Antes de dibujar, el software aplica el formado (shaping): eligiendo la forma posicional correcta para cada letra, y bidi (el algoritmo bidireccional), que calcula cómo se intercalan las secuencias de derecha a izquierda y de izquierda a derecha en la línea.

Sin embargo, un PDF no almacena tu oración. Almacena glifos —índices a una fuente— más posiciones. El formado ya ha ocurrido y está incrustado. Para copiar el texto de nuevo, el lector necesita un mapa del glifo al carácter, que el archivo puede incluir como una tabla ToUnicode. Y ahí radica la clave:

Fíjate lo que esto significa: si el árabe se copia correctamente desde un PDF fue decidido por lo que produjo el archivo, a menudo hace años. Ningún lector puede recuperar completamente la información que el generador desechó.

Qué puedes hacer con un archivo que no te cede su texto

  1. Intenta extraer primero. Si el documento fue creado por un generador competente, el texto está ahí y se copia limpiamente. Siempre vale la pena dedicar treinta segundos antes de usar algo más complejo.
  2. Prueba con otro lector. Los lectores difieren en qué tan bien revierten el modelado (shaping) y manejan bidi. Un archivo que pega mal desde uno puede pegar correctamente desde otro.
  3. Si es un escaneo, nunca fue texto. Entonces ninguna cantidad de copiado funcionará, y OCR es la única vía: mira más abajo.
  4. Si la extracción te da formularios de presentación, tienes texto, pero el tipo incómodo. Puede necesitar normalizarse antes de que sea buscable junto con el árabe ordinario.

OCR en árabe: más difícil y honesto al respecto

Cuando el documento es un escaneo, el reconocimiento es el único camino, y es notablemente más difícil para el árabe que para el inglés. Cada característica anterior trabaja en contra del motor: las letras se conectan, por lo que no hay un espacio limpio entre caracteres; las formas varían según la posición, multiplicando lo que debe reconocerse; los puntos encima y debajo distinguen letras de otro modo idénticas, por lo que una mota de ruido del escáner puede cambiar la palabra; los diacríticos pueden o no estar presentes.

Vale la pena declarar las consecuencias prácticas claramente:

El OCR se ejecuta en tu propio dispositivo y es parte de CyvoDocOps Pro; debido a que Pro se compra a través de la App Store o Google Play en lugar de por la web, las herramientas de OCR residen en la aplicación móvil. Para información general sobre cómo funciona el reconocimiento, consulta cómo hacer que un PDF escaneado sea searchable.

Sellos y anotaciones en documentos RTL

Los documentos comerciales árabes dependen mucho más de sellos y lacres que los occidentales: aprobaciones, recibos, respaldos oficiales. Añadirlos a un PDF tiene sus propios problemas: el texto dentro del sello necesita un correcto modelado (shaping), y las convenciones de colocación siguen la dirección de lectura, por lo que un sello que se ve natural en una página de izquierda a derecha puede quedar incómodo en una de derecha a izquierda.

Sellos árabes gestionan el modelado para que el texto se muestre como árabe unido y no como una línea de letras separadas, lo cual es el fallo que obtienes de herramientas que tratan el árabe como si fuera latín con diferentes caracteres. Herramientas relacionadas como sellos de fecha e iniciales siguen el mismo patrón.

Hábitos prácticos para documentos árabes

Por qué el procesamiento local importa aquí

Los documentos en árabe que necesitan este tipo de trabajo suelen ser los oficiales: contratos, documentación gubernamental, registros comerciales, documentos de identidad, registros notariados. Esa es precisamente la categoría donde subir a un servicio de terceros es menos apropiado — y donde "borramos después de una hora" es una promesa que no puedes auditar. En CyvoDocOps, las operaciones compatibles se ejecutan localmente en tu navegador, y el OCR en el dispositivo de la aplicación móvil procesa escaneos sin enviarlos a ningún sitio. Consulta herramientas PDF para árabe para ver lo que está disponible.

Ver las herramientas PDF para árabe

Preguntas frecuentes

¿Por qué el texto en árabe sale desconectado cuando lo copio de un PDF?

Porque el PDF almacena glifos preformados y falta o es incorrecto el mapa hacia los caracteres reales. La página se dibuja correctamente; la información necesaria para reconstruir el texto original fue descartada cuando se creó el archivo.

¿Por qué el texto aparece al revés cuando lo pego?

El archivo almacenó glifos en orden de dibujo sin suficiente información para recuperar el orden de lectura. Algunos lectores lo revierten correctamente y otros no; probar con un lector diferente es una solución real.

¿Es tan preciso el OCR árabe como el inglés?

No, y cualquiera que afirme lo contrario está exagerando. Las letras conectadas, las formas dependientes de la posición y los puntos portadores de significado lo hacen más difícil. Los escaneos impresos limpios dan buenos resultados que aún merecen una revisión.

¿Puedo buscar en un PDF árabe escaneado?

No, hasta que tenga una capa de texto. Ejecuta OCR para añadir una; aunque ten en cuenta que un resultado de búsqueda negativo en un documento con OCR no prueba la ausencia de la palabra.

¿Se han subido mis documentos árabes?

No. Las operaciones web compatibles se ejecutan localmente en tu navegador, y el OCR en la aplicación móvil se ejecuta en tu dispositivo. El documento no se envía a un servidor.

Guías y herramientas relacionadas