Ir para o conteúdo principal
Bethemesh
GuiaBoas práticas

Duplicados e validação CSV: tornar uma tabela fiável antes da importação

Descubra como identificar duplicados, escolher as colunas-chave certas e validar a estrutura de um CSV antes de o importar ou comparar.

Publicado 29 de agosto de 2026Leitura : 3 minPor Equipa Bethemesh
Iniciante
Mostrar índice
  1. O que é um duplicado?
  2. Primeira ou última ocorrência?
  3. Maiúsculas, minúsculas e espaços
  4. O que valida um CSV?
  5. Controlar antes de importar
  6. Chave simples ou composta?
  7. Falsos duplicados e quase duplicados
  8. Validação sintática e validação funcional
  9. Medir em vez de supor

Um ficheiro pode abrir corretamente e continuar a conter duplicados. Inversamente, dados corretos do ponto de vista funcional podem estar presos num CSV mal formado. Deduplicação e validação são dois controlos diferentes, a realizar antes de uma importação importante.

O que é um duplicado?

A resposta depende do conjunto de dados. Duas linhas estritamente idênticas são duplicados evidentes, mas duas fichas de cliente com o mesmo identificador também podem ser consideradas duplicadas mesmo que outra coluna seja diferente.

Com Remover duplicados CSV, escolha as colunas que devem servir de chave quando a linha inteira não é o critério certo.

Uma chave estável — identificador, referência de produto, número de processo — é geralmente preferível a um nome livre.

Primeira ou última ocorrência?

Quando várias linhas partilham a mesma chave, é preciso decidir qual conservar. Manter a primeira ocorrência é adequado se o ficheiro já estiver ordenado do mais antigo para o mais recente e a primeira for a referência. Manter a última pode ser preferível se as linhas mais recentes contiverem a informação atualizada.

Esta escolha deve ser explícita: eliminar «duplicados» sem compreender a ordem do ficheiro pode remover a versão correta.

Maiúsculas, minúsculas e espaços

CLIENT-42 e client-42 podem designar o mesmo identificador em alguns sistemas, mas não em todos. Da mesma forma, um espaço final pode tornar dois valores diferentes numa comparação estrita.

A normalização deve seguir as regras funcionais. Não torne todas as comparações insensíveis a maiúsculas e minúsculas por reflexo se a capitalização transportar informação.

O que valida um CSV?

O Validador CSV verifica a estrutura do ficheiro: coerência das linhas, separadores e sintaxe esperada.

Isto não significa que um e-mail exista realmente, que um montante esteja correto ou que uma data respeite uma regra funcional. A validação sintática é uma primeira barreira, não uma certificação da qualidade dos dados.

Controlar antes de importar

Antes de enviar um CSV para um CRM, loja ou software profissional:

  1. verifique o separador e os cabeçalhos;
  2. valide a sintaxe;
  3. identifique a coluna-chave;
  4. meça os duplicados;
  5. controle algumas linhas removidas ou conservadas;
  6. guarde o ficheiro original.

Se precisar de comparar duas versões do mesmo export, Comparar CSV ou Comparar dois ficheiros Excel ou CSV permite ir além de uma simples deduplicação.

Chave simples ou composta?

Uma só coluna nem sempre basta para definir unicidade. Duas pessoas podem ter o mesmo nome, dois produtos a mesma designação e duas encomendas a mesma data.

Uma chave composta combina várias colunas, por exemplo email + data_encomenda ou referencia_produto + fornecedor. Reduz o risco de eliminar indevidamente duas linhas semelhantes que representam acontecimentos diferentes.

Antes de qualquer deduplicação, identifique portanto a regra funcional que permite dizer que uma linha representa realmente a mesma entidade que outra.

Falsos duplicados e quase duplicados

João Silva, JOÃO SILVA e João Silva podem ser a mesma pessoa depois de normalização. Pelo contrário, duas linhas perfeitamente idênticas podem ser legítimas se representarem dois acontecimentos distintos.

Uma ferramenta de deduplicação sabe aplicar uma regra, mas não conhece o seu contexto. Quanto maiores forem as consequências, mais importante é controlar uma amostra das linhas removidas antes de aceitar o resultado.

Validação sintática e validação funcional

Um ficheiro pode ser tecnicamente válido e funcionalmente errado. Um CSV bem formado pode conter uma taxa de IVA impossível, uma data fora do intervalo ou um identificador desconhecido.

A validação técnica verifica a estrutura. A validação funcional verifica o significado. São complementares e devem ser distinguidas quando os dados alimentam outro sistema.

Medir em vez de supor

Antes de eliminar, conte. Se um ficheiro de 20.000 linhas passar de repente para 12.000 após deduplicação, o resultado merece verificação.

A qualidade dos dados assenta tanto nestes controlos de coerência como na própria operação técnica.

Ferramentas relacionadas

Dados e folhas de cálculo

Remover duplicados CSV

Remova linhas duplicadas de um ficheiro CSV segundo as colunas que escolher.

100% local
Utilizar esta ferramenta
Dados e folhas de cálculo

Validador CSV

Valide a estrutura de um ficheiro CSV e identifique rapidamente linhas ou colunas problemáticas.

100% local
Utilizar esta ferramenta
Dados e folhas de cálculo

Comparar dois CSV

Compare dois ficheiros CSV para identificar rapidamente linhas e valores diferentes.

100% local
Utilizar esta ferramenta
Dados e folhas de cálculo

Limpar um ficheiro Excel ou CSV

Remova duplicados, linhas vazias e espaços desnecessários.

100% localEm destaque
Utilizar esta ferramenta

Coleção

Dominar dados e tabelas

  1. 01Dados e tabelas: compreender CSV, Excel, JSON e a estrutura de um conjunto de dados
  2. 02Limpar um ficheiro CSV ou Excel antes de o utilizar
  3. 03Duplicados e validação CSV: tornar uma tabela fiável antes da importação
  4. 04Filtrar, ordenar e escolher colunas de um CSV sem quebrar a estrutura
  5. 05Juntar vários ficheiros CSV ou Excel: alinhar colunas antes de combinar
  6. 06Dividir um CSV ou separar uma tabela: escolher o método certo
  7. 07Comparar dois ficheiros CSV ou Excel e identificar diferenças
  8. 08Converter CSV, Excel, JSON e TSV sem perder a estrutura dos dados
  9. 09Construir um workflow reproduzível de preparação de dados

Este artigo foi útil?