CyvoDocOps
Português
Dark

Trabalhando com PDFs em árabe

Você abre um contrato em árabe, seleciona um parágrafo, copia e cola em um e-mail. O que aparece é uma linha de letras desconectadas — ou as letras certas na ordem errada, ou uma sequência de caracteres que parece quase certa e não é. O PDF exibe perfeitamente. No momento em que você tenta extrair o texto, ele se desfaz. Isso não significa que seu software esteja com defeito. É um problema genuinamente difícil.

Por que o árabe é mais difícil do que o alfabeto latino

O inglês exige muito pouco de um sistema de texto: as letras ficam em uma linha, da esquerda para a direita, e cada uma tem a mesma forma onde quer que apareça. O árabe exige consideravelmente mais, e cada um desses recursos é um ponto onde as ferramentas falham:

Portanto, exibir o árabe corretamente exige que o renderizador escolha a forma certa para cada letra com base em seus vizinhos, e depois dispor sequências de direção mista de forma coerente. Ambos os passos são onde o problema surge.

A versão curta: um PDF armazena 'fotos de letras' e uma nota sobre onde desenhá-las. Para o alfabeto latino, você geralmente pode trabalhar do desenho para a imagem. Para árabe, esse caminho é perdedor — razão pela qual a página parece perfeita e a cópia não.

Formatação (Shaping) e por que copiar e colar falha

Aqui está o mecanismo, porque saber disso explica cada sintoma que você encontrará.

O texto é armazenado em ordem lógica — a ordem como você diria. Antes de desenhar, o software aplica formatação (shaping): escolhendo a forma posicional correta para cada letra, e bidi (o algoritmo bidirecional), que calcula como as sequências da direita para a esquerda e da esquerda para a direita se intercalam na linha.

Um PDF, no entanto, não armazena sua frase. Ele armazena glifos — índices em uma fonte — mais posições. A formatação já aconteceu e foi incorporada. Para copiar o texto de volta, o leitor precisa de um mapa do glifo para o caractere, que o arquivo pode incluir como uma tabela ToUnicode. E esse é o cerne:

Note o que isso significa: se cópias em árabe saem de um PDF corretamente foi decidido por quem produziu o arquivo, muitas vezes anos atrás. Nenhum leitor pode recuperar totalmente as informações que o gerador descartou.

O que fazer com um arquivo que não libera o texto

  1. Tente extrair primeiro. Se o documento foi feito por um gerador competente, o texto está lá e copia-se perfeitamente. Sempre vale a pena dedicar trinta segundos antes de qualquer coisa mais pesada.
  2. Tente um leitor diferente. Leitores diferem na forma como realizam o reversão de formação (reverse shaping) e lidam com bidi. Um arquivo que cola mal em um pode colar corretamente em outro.
  3. Se for uma digitalização, nunca foi texto. Então, não importa o quanto você copie, não vai funcionar, e OCR é o único caminho — veja abaixo.
  4. Se a extração fornecer formulários de apresentação, você terá texto, mas do tipo desajeitado. Ele pode precisar ser normalizado antes de poder ser pesquisável junto com o árabe comum.

OCR Árabe: mais difícil e honesto sobre isso

Quando o documento é um scan, o reconhecimento é o único caminho — e ele é notavelmente mais difícil para o árabe do que para o inglês. Cada característica acima trabalha contra o motor: as letras se conectam, então não há uma lacuna limpa para cortar entre os caracteres; as formas variam por posição, multiplicando o que deve ser reconhecido; pontos acima e abaixo distinguem letras de outra forma idêntica, então um pequeno ruído do scanner pode mudar a palavra; diacríticos podem ou não estar presentes.

As consequências práticas valem a pena serem declaradas claramente:

O OCR é executado no seu próprio dispositivo e faz parte do CyvoDocOps Pro; como o Pro é comprado pela App Store ou Google Play em vez de na web, as ferramentas de OCR estão disponíveis no aplicativo móvel. Para um contexto geral sobre como funciona o reconhecimento, veja como tornar um PDF escaneado pesquisável.

Carimbos e anotações em documentos RTL

Documentos comerciais árabes dependem muito mais de carimbos e selos do que os ocidentais — aprovações, recibos, endossos oficiais. Adicionar isso a um PDF traz suas próprias complicações: o texto dentro do carimbo precisa ter o formato correto, e as convenções de posicionamento seguem a direção da leitura, então um carimbo que parece natural em uma página de esquerda para direita pode ficar estranho em uma de direita para esquerda.

Carimbos Árabes cuida do formato para que o texto seja renderizado como árabe unido e não como uma linha de letras separadas — o modo de falha que você obtém de ferramentas que tratam o árabe como se fosse latim com diferentes caracteres. Ferramentas relacionadas, como carimbos de data e iniciais, seguem o mesmo padrão.

Hábitos práticos para documentos árabes

Por que o processamento local é importante aqui

Documentos em árabe que precisam desse tipo de trabalho são tipicamente os oficiais: contratos, documentos governamentais, registros comerciais, documentos de identidade, registros notarizados. Essa é precisamente a categoria onde fazer upload para um serviço de terceiros é menos apropriado — e onde "nós deletamos após uma hora" é uma promessa que você não pode auditar. No CyvoDocOps, as operações suportadas rodam localmente no seu navegador, e o OCR em dispositivo na aplicação móvel processa digitalizações sem enviá-las para qualquer lugar. Veja ferramentas de PDF em árabe para saber o que está disponível.

Ver as ferramentas de PDF em árabe

Perguntas frequentes

Por que o texto em árabe aparece desconectado quando eu o copio de um PDF?

Porque o PDF armazena glifos pré-moldados e o mapa para os caracteres reais está faltando ou errado. A página é desenhada corretamente; a informação necessária para reconstruir o texto original foi descartada quando o arquivo foi feito.

Por que o texto aparece invertido quando eu colo ele?

O arquivo armazenou os glifos na ordem de desenho sem informações suficientes para recuperar a ordem de leitura. Alguns leitores revertem isso corretamente e outros não — tentar um leitor diferente é uma solução real.

O OCR em árabe é tão preciso quanto o inglês?

Não, e qualquer pessoa que diga o contrário está exagerando. Letras conectadas, formas dependentes de posição e pontos portadores de significado tornam tudo mais difícil. Scans impressos limpos dão bons resultados que ainda merecem revisão.

Posso pesquisar em um PDF escaneado em árabe?

Não, até que ele tenha uma camada de texto. Execute o OCR para adicionar uma — embora note que um resultado de pesquisa negativo em um documento com OCR não prova que a palavra está ausente.

Meus documentos em árabe foram enviados?

Não. As operações web suportadas rodam localmente no seu navegador, e o OCR no aplicativo móvel roda no seu dispositivo. O documento não é enviado para um servidor.

Guias e ferramentas relacionadas