Um PDF produzido por um scanner pode ser apenas uma sequência de imagens. É possível lê-lo, mas pesquisar um nome, selecionar uma frase ou reutilizar o texto torna-se difícil. O OCR adiciona uma camada de texto e preparar primeiro a digitalização evita processamento desnecessário.
O modelo pronto a usar limpa a digitalização e depois aplica OCR para produzir um PDF pesquisável.
Abrir este Pipeline pronto a usar
Porquê limpar antes do OCR?
Um processo digitalizado pode conter páginas em branco, digitalizações intermédias ou características visuais desnecessárias. Removê-las ou normalizá-las antes do reconhecimento reduz trabalho inútil. O Pipeline mantém as operações na ordem correta para que o OCR trabalhe sobre o documento já preparado.
O que faz o OCR
O reconhecimento ótico de caracteres analisa as imagens das páginas para identificar caracteres e criar texto utilizável. O PDF pode assim tornar-se pesquisável mantendo o aspeto da digitalização.
O OCR não é infalível. A precisão depende da resolução, nitidez, orientação, contraste, idioma e complexidade da paginação.
Quando este fluxo é útil
É adequado para cartas digitalizadas, arquivos administrativos, contratos em papel, faturas e processos nos quais pretende localizar rapidamente uma palavra ou referência. Não transforma automaticamente uma estrutura complexa em dados estruturados.