Tema

OCR e digitalização: transforme papel em texto

OCR é o que faz um documento escaneado virar texto pesquisável. Entenda como funciona, quando usar e como digitalizar papel direto pelo celular.

Existe uma diferença silenciosa entre dois PDFs que parecem idênticos na tela. Um deixa você selecionar uma frase, copiar, usar o Ctrl+F para achar uma palavra. O outro não deixa fazer nada disso, porque ali não há texto: há uma fotografia de texto. Para o computador, aquilo é um borrão de pixels tão legível quanto uma paisagem. Todo documento escaneado nasce assim.

OCR é a tecnologia que resolve isso. Ela olha a imagem, reconhece os desenhos das letras e escreve o texto correspondente por baixo, invisível, alinhado com o que aparece na página. O documento continua com a mesma aparência, mas agora pode ser pesquisado, copiado, convertido para Word e lido em voz alta por um leitor de tela. É o passo que transforma uma pilha de papel digitalizada em informação utilizável.

Por onde começar

Se o conceito ainda é novo, comece por o que é OCR. O guia explica como o reconhecimento funciona, por que ele erra em certos documentos e o que esperar de precisão em cada tipo de original.

Para aplicar num arquivo que você já tem, o tutorial como fazer OCR em PDF mostra o processo passo a passo, e a ferramenta OCR em PDF executa o reconhecimento no próprio navegador — detalhe que pesa quando o documento é um RG, um contracheque ou um contrato. Se o papel ainda está na sua mesa, como digitalizar documentos com o celular começa antes: enquadramento, luz e resolução, que é onde a qualidade do OCR se decide.

O que você encontra aqui

O tema cobre o caminho inteiro, do papel ao texto. Digitalização feita direito, com as escolhas que importam — resolução, cor, contraste, correção de perspectiva. O reconhecimento em si, incluindo o comportamento do OCR com acentuação, cedilha e os documentos brasileiros mais comuns. E o que vem depois: extrair o texto para reaproveitar em outro lugar, ou converter para Word agora que existe conteúdo de verdade para converter.

Boa parte dos problemas do site desemboca aqui. Texto que não seleciona no PDF é quase sempre falta de OCR. Conversão para Word que devolve uma página em branco com uma foto dentro, idem. Documento que o leitor de tela ignora, idem. Quando um PDF se comporta como se estivesse vazio, a primeira pergunta é se ele passou por reconhecimento.

O que mais melhora o resultado não é a ferramenta — é o original. Foto tremida, sombra da própria mão sobre a folha, papel amassado e enquadramento torto derrubam a precisão de qualquer OCR. Cinco segundos a mais na hora de escanear valem mais do que qualquer ajuste posterior.

Uma expectativa honesta para fechar: OCR não é perfeito e não precisa ser. Documento impresso e bem escaneado sai com precisão altíssima. Letra de médico, formulário preenchido à mão e fax dos anos noventa saem com erro — às vezes muito erro. Para texto que vai ser publicado ou virar contrato, revise o resultado. Para achar um documento na busca depois, o reconhecimento imperfeito já resolve.

Ferramentas

Ferramentas deste tema

Ver todas
Aprenda

Tutoriais

Ver todos
Entenda

Guias

Ver todos
Glossário

Termos deste tema

Ver glossário

Receba dicas e novidades sobre PDF e produtividade

Cadastre-se e receba conteúdos exclusivos direto no seu e-mail. Sem spam.