CyvoDocOps
Português
Dark

Como tornar um PDF escaneado pesquisável

Você escaneia quarenta páginas de contratos antigos, salva tudo em um único e organizado PDF, e procura pela palavra "indenização". Ctrl+F não encontra nada. Você consegue ver a palavra — ela está lá na página doze — mas seu computador não consegue, porque, para ele, aquela página não contém palavras. Ela contém uma fotografia.

Três tipos de PDF que parecem idênticos

Quase toda confusão sobre scans começa aqui. Três arquivos muito diferentes podem parecer iguais na tela:

O terceiro tipo é o que você quer, e OCR é como você chega lá.

Versão curta: um scan é uma imagem de texto. O OCR lê a imagem e escreve as palavras. Um PDF pesquisável mantém a imagem e encaixa as palavras discretamente por trás dela.

O que o OCR realmente faz

Reconhecimento Óptico de Caracteres analisa os pixels, encontra formas que parecem caracteres e decide quais caracteres eles são. Motores modernos não comparam letras uma por uma como um estêncil; eles trabalham ao longo das linhas de texto, usando as formas e o contexto circundante para resolver ambiguidades. Esse contexto é o motivo pelo qual um bom motor lê "rn" como duas letras em "moderno", mas ainda pode tropeçar nisso em um scan borrado — ele está fazendo um palpite informado, todas as vezes.

Essa palavra — palpite — é o núcleo honesto do OCR. É uma leitura probabilística de uma imagem, não uma conversão sem perdas. Geralmente um palpite muito bom. Nunca um garantido.

Por que um PDF pesquisável é geralmente o que você quer

Você poderia fazer OCR em um scan e manter apenas o texto, mas jogaria fora o documento: a assinatura, o cabeçalho, a mancha de café, o layout — tudo o que faz dele o original e não uma transcrição. E como o OCR é imperfeito, uma versão de texto puro não tem como se checar.

Um PDF pesquisável evita esse sacrifício. A imagem escaneada permanece exatamente como estava, intocada. O texto reconhecido é adicionado como uma camada invisível posicionada sobre as palavras às quais corresponde. Você vê o original; seu computador vê o texto; quando você copia um parágrafo, você obtém as palavras, e quando um erro de reconhecimento aparece, a página verdadeira ainda está lá para comparação.

O que realmente determina a precisão

A qualidade do OCR é decidida muito antes de o motor rodar — principalmente no momento da digitalização:

Se uma digitalização sair ruim, o conserto de maior valor quase nunca é uma configuração diferente de OCR. É rescanear: mais plana, mais clara, mais reta, em 300 dpi. Dez segundos no scanner superam uma hora corrigindo a saída.

PDF pesquisável ou texto simples?

Dois objetivos diferentes, duas ferramentas diferentes, e escolher a errada desperdiça tempo:

Se você não tem certeza, escolha o PDF pesquisável. Você sempre pode extrair o texto dele depois; você não consegue recuperar uma página que descartou.

Como fazer isso

O OCR no CyvoDocOps roda no seu próprio dispositivo — a digitalização nunca é enviada para um servidor. Faz parte do CyvoDocOps Pro, e como o Pro é comprado pela App Store ou Google Play em vez de na web, as ferramentas de OCR ficam no aplicativo móvel.

  1. Obtenha o melhor scan possível. 300 dpi, plano, boa iluminação, reto. Esta etapa decide seu resultado mais do que qualquer outra.
  2. Abra o documento no aplicativo CyvoDocOps. Veja o aplicativo se você não tiver.
  3. Escolha sua ferramenta. Use PDF pesquisável para manter a página e adicionar a camada oculta; use Extrair Texto para puxar as palavras; ou OCR Inglês ou OCR Árabe para o idioma que você está lendo.
  4. Verifique o resultado. Pesquise por uma palavra que você sabe que está na página um. Se não for encontrada, o reconhecimento teve dificuldades — o que geralmente aponta de volta para o scan.

Baixe o aplicativo CyvoDocOps

Sendo direto sobre os limites

Árabe e outros scripts

A dificuldade de reconhecimento varia enormemente por script. O árabe é notavelmente mais difícil que o inglês: as letras se juntam, suas formas mudam dependendo da posição na palavra, os diacríticos carregam significado e o texto corre da direita para a esquerda. Um modelo treinado para inglês é inútil nele — você precisa do modelo árabe, via OCR Árabe. Se esse for o seu caso de uso, trabalhar com PDFs em árabe cobre os detalhes.

Por que o processamento no dispositivo é importante aqui

Pense no que as pessoas realmente escaneiam: contratos, cartas médicas, extratos bancários, passaportes, registros fiscais. Escanear é o que você faz com documentos que existem em papel porque são importantes. Enviar essa pilha para o servidor de outra pessoa para processamento é um acordo estranho — e comum, porque a maioria dos serviços de OCR não tem outra maneira de funcionar. Executar o reconhecimento no seu próprio dispositivo mantém o documento onde ele começou. Nada é enviado, então não há nada para reter, registrar ou vazar.

Perguntas frequentes

Por que eu não consigo pesquisar meu PDF escaneado?

Porque não contém texto. Cada página é uma imagem, e a busca procura por caracteres. OCR é o que transforma a foto em palavras que seu computador consegue encontrar.

Fazer um PDF pesquisável muda a aparência dele?

Não. A imagem digitalizada é preservada exatamente. O texto reconhecido é adicionado como uma camada invisível por trás dela.

O OCR funciona em escrita à mão?

Não. O motor foi projetado para texto impresso por máquina. Escrita à mão é um problema diferente e não é um caso de uso suportado.

Por que o OCR está no aplicativo e não no navegador?

Faz parte do CyvoDocOps Pro, e o Pro é comprado pela App Store ou Google Play — não há checkout na web — então as ferramentas ficam no aplicativo. O reconhecimento roda no seu dispositivo de qualquer maneira.

Minha digitalização é enviada para OCR?

O reconhecimento é executado inteiramente no seu dispositivo e o documento não é enviado para um servidor.

Guias e ferramentas relacionadas