Aller au contenu principal
Bethemesh
GuideBonnes pratiques

Doublons et validation CSV : fiabiliser un tableau avant import

Découvrez comment identifier les doublons, choisir les bonnes colonnes clés et valider la structure d’un CSV avant de l’importer ou de le comparer.

Publié le 29 août 2026Lecture : 3 minPar Équipe Bethemesh
Débutant
Afficher le sommaire
  1. Qu’est-ce qu’un doublon ?
  2. Première ou dernière occurrence ?
  3. Casse et espaces
  4. Que valide un CSV ?
  5. Contrôler avant un import
  6. Clé simple ou clé composite ?
  7. Faux doublons et quasi-doublons
  8. Validation syntaxique et validation métier
  9. Mesurer plutôt que supposer

Un fichier peut s’ouvrir correctement tout en contenant des doublons. À l’inverse, des données métier correctes peuvent être enfermées dans un CSV mal formé. Déduplication et validation sont deux contrôles différents, à effectuer avant un import important.

Qu’est-ce qu’un doublon ?

La réponse dépend du jeu de données. Deux lignes strictement identiques sont des doublons évidents, mais deux fiches clients portant le même identifiant peuvent également être considérées comme un doublon même si une autre colonne diffère.

Avec Supprimer les doublons CSV, choisissez les colonnes qui doivent servir de clé lorsque l’ensemble de la ligne n’est pas le bon critère.

Une clé stable — identifiant, référence produit, numéro de dossier — est généralement préférable à un nom libre.

Première ou dernière occurrence ?

Lorsque plusieurs lignes partagent la même clé, il faut décider laquelle conserver. Garder la première occurrence est adapté si le fichier est déjà ordonné de la plus ancienne à la plus récente et que la première valeur fait référence. Garder la dernière peut être préférable si les lignes les plus récentes contiennent les informations mises à jour.

Ce choix doit être explicite : supprimer « les doublons » sans comprendre l’ordre du fichier peut éliminer la bonne version.

Casse et espaces

CLIENT-42 et client-42 peuvent désigner le même identifiant dans certains systèmes, mais pas dans tous. De même, un espace final peut rendre deux valeurs différentes lors d’une comparaison stricte.

La normalisation doit suivre les règles métier. Ne rendez pas toutes les comparaisons insensibles à la casse par réflexe si la casse porte une information.

Que valide un CSV ?

Le Validateur CSV vérifie la structure du fichier : cohérence des lignes, séparateurs et syntaxe attendue.

Cela ne signifie pas qu’un e-mail existe réellement, qu’un montant est correct ou qu’une date respecte une règle métier. Une validation syntaxique est une première barrière, pas une certification de la qualité des données.

Contrôler avant un import

Avant d’envoyer un CSV vers un CRM, une boutique ou un logiciel métier :

  1. vérifiez le séparateur et les en-têtes ;
  2. validez la syntaxe ;
  3. identifiez la colonne clé ;
  4. mesurez les doublons ;
  5. contrôlez quelques lignes supprimées ou conservées ;
  6. gardez le fichier original.

Si vous devez confronter deux versions d’un même export, Comparer des CSV ou Comparer deux fichiers Excel ou CSV permet d’aller plus loin qu’une simple déduplication.

Clé simple ou clé composite ?

Une seule colonne ne suffit pas toujours à définir l’unicité. Deux personnes peuvent partager un même nom, deux produits un même libellé et deux commandes la même date.

Une clé composite combine plusieurs colonnes, par exemple email + date_commande ou reference_produit + fournisseur. Elle réduit le risque de supprimer à tort deux lignes qui se ressemblent mais représentent des événements différents.

Avant toute déduplication, identifiez donc la règle métier qui permet de dire qu’une ligne représente réellement la même entité qu’une autre.

Faux doublons et quasi-doublons

Jean Dupont, JEAN DUPONT et Jean Dupont peuvent être la même personne après normalisation. À l’inverse, deux lignes parfaitement identiques peuvent parfois être légitimes si elles représentent deux événements distincts.

Un outil de déduplication sait appliquer une règle, mais il ne connaît pas votre métier. Plus les conséquences sont importantes, plus il faut contrôler un échantillon des lignes supprimées avant d’accepter le résultat.

Validation syntaxique et validation métier

Un fichier peut être valide techniquement tout en étant faux fonctionnellement. Un CSV correctement formé peut contenir un taux de TVA impossible, une date hors plage ou un identifiant inconnu.

La validation technique vérifie la structure. La validation métier vérifie le sens. Les deux sont complémentaires et doivent être distinguées lorsque les données alimentent un autre système.

Mesurer plutôt que supposer

Avant de supprimer, comptez. Si un fichier de 20 000 lignes tombe soudainement à 12 000 après déduplication, le résultat mérite une vérification.

La qualité des données repose autant sur ces contrôles de cohérence que sur l’opération technique elle-même.

Outils associés

Données & tableaux

Supprimer les doublons CSV

Supprimez les lignes en double d’un fichier CSV selon les colonnes que vous choisissez.

100 % local
Utiliser l’outil
Données & tableaux

Validateur CSV

Validez la structure d’un fichier CSV et repérez rapidement les lignes ou colonnes problématiques.

100 % local
Utiliser l’outil
Données & tableaux

Comparer deux CSV

Comparez deux fichiers CSV pour identifier rapidement les lignes et valeurs qui diffèrent.

100 % local
Utiliser l’outil

Collection

Maîtriser ses données et tableaux

  1. 01Données et tableaux : comprendre CSV, Excel, JSON et la structure d’un jeu de données
  2. 02Nettoyer un fichier CSV ou Excel avant de l’utiliser
  3. 03Doublons et validation CSV : fiabiliser un tableau avant import
  4. 04Filtrer, trier et choisir les colonnes d’un CSV sans casser sa structure
  5. 05Fusionner plusieurs fichiers CSV ou Excel : assembler ou joindre les tableaux
  6. 06Découper un CSV ou séparer un tableau : choisir la bonne méthode
  7. 07Comparer deux fichiers CSV ou Excel et repérer les différences
  8. 08Convertir CSV, Excel, JSON et TSV sans perdre la structure des données
  9. 09Construire un workflow de préparation de données reproductible

Cet article vous a-t-il été utile ?