Aller au contenu principal
Bethemesh
GuideBonnes pratiques

Nettoyer un fichier CSV ou Excel avant de l’utiliser

Apprenez à préparer un tableau en supprimant doublons, lignes vides et espaces parasites, puis à réutiliser ce nettoyage dans un Pipeline.

Publié le 29 août 2026Lecture : 3 minPar Équipe Bethemesh
Débutant
Afficher le sommaire
  1. Commencer par une copie du fichier
  2. Supprimer les lignes réellement vides
  3. Espaces inutiles : un petit défaut aux grandes conséquences
  4. Définir ce qu’est un doublon
  5. Ne pas « corriger » les identifiants comme des nombres
  6. Vérifier les en-têtes et la structure
  7. Deux Pipelines existent maintenant pour ce besoin
  8. Traiter les valeurs manquantes avec prudence
  9. Définir un ordre de nettoyage
  10. Préparer le traitement suivant

Avant un import CRM, une analyse ou une fusion, il est souvent utile de nettoyer le tableau source. L’objectif n’est pas de modifier les données au hasard, mais de retirer les défauts mécaniques qui empêchent les traitements suivants de fonctionner correctement.

Le Nettoyeur Excel et CSV regroupe plusieurs opérations courantes. Depuis la rédaction initiale de ce guide, le Workspace dispose aussi de recettes réutilisables pour ce besoin.

Commencer par une copie du fichier

Gardez toujours le fichier d’origine. Un nettoyage peut supprimer des lignes ou modifier des valeurs ; il doit donc rester possible de comparer le résultat avec la source.

Cette précaution est particulièrement importante lorsque le tableau sert de référentiel, contient des identifiants métier ou doit être réimporté dans un logiciel.

Supprimer les lignes réellement vides

Une feuille de calcul peut contenir des lignes qui semblent vides mais possèdent encore des cellules formatées ou des caractères invisibles. Dans un jeu de données, supprimer ces lignes réduit le bruit et évite qu’elles soient interprétées comme de vrais enregistrements.

Espaces inutiles : un petit défaut aux grandes conséquences

Paris et Paris paraissent identiques à l’écran, mais une comparaison stricte peut les considérer comme deux valeurs différentes. Les espaces en début ou fin de cellule peuvent provoquer des doublons non détectés, des regroupements séparés, des jointures qui échouent ou des filtres incomplets.

Définir ce qu’est un doublon

Deux lignes entièrement identiques sont faciles à reconnaître. Mais dans un fichier clients, deux lignes peuvent désigner la même personne tout en ayant une adresse ou un téléphone différent.

Pour une déduplication contrôlée par colonnes, utilisez Supprimer les doublons CSV. Avant de supprimer quoi que ce soit, identifiez la colonne qui représente réellement l’enregistrement.

Ne pas « corriger » les identifiants comme des nombres

Un code 00125 peut être un identifiant et non le nombre 125. Le même principe vaut pour les numéros de téléphone, codes produits, numéros de dossier et certains codes postaux.

Avant de normaliser une colonne, identifiez sa sémantique, pas seulement son apparence.

Vérifier les en-têtes et la structure

Des noms de colonnes explicites simplifient toutes les étapes suivantes. Renommer les colonnes CSV permet de corriger les intitulés sans modifier le reste du tableau.

Après nettoyage, vérifiez le nombre de lignes, la présence des en-têtes, quelques enregistrements et les colonnes identifiantes. Le Validateur CSV contrôle la syntaxe et Statistiques CSV fournit une vue synthétique.

Deux Pipelines existent maintenant pour ce besoin

Le modèle Nettoyer un fichier Excel enchaîne automatiquement nettoyage des valeurs, suppression des lignes vides et suppression des doublons avant export.

Pour aller plus loin, Nettoyer et normaliser un tableau ajoute le traitement des valeurs manquantes à cette chaîne.

Ces modèles sont intéressants lorsqu’un même type de fichier revient régulièrement. Pour un contrôle ponctuel ou une règle métier très spécifique, l’outil autonome reste plus simple.

Traiter les valeurs manquantes avec prudence

Une cellule vide peut signifier qu’une information est inconnue, facultative ou non applicable. Avant de remplir automatiquement une valeur, vérifiez si la colonne est obligatoire, si une valeur par défaut a un sens métier et si l’absence doit être distinguée de zéro ou d’une chaîne vide.

Définir un ordre de nettoyage

Une séquence robuste ressemble souvent à ceci :

conserver la source
→ vérifier les en-têtes
→ nettoyer les espaces
→ supprimer les lignes vides
→ normaliser les valeurs connues
→ traiter les doublons
→ contrôler les valeurs manquantes
→ valider
→ exporter

L’ordre limite les faux doublons et rend les contrôles finaux plus fiables.

Préparer le traitement suivant

Le niveau de nettoyage dépend de la destination. Pour fusionner plusieurs fichiers, harmonisez surtout les colonnes. Pour comparer deux exports, stabilisez la clé de comparaison. Pour une jointure, nettoyez précisément les clés qui devront correspondre.

Un bon nettoyage n’est pas une fin en soi : il prépare une opération précise. C’est cette logique qui permet ensuite de transformer une suite de corrections en workflow reproductible.

Outils associés

Données & tableaux

Supprimer les doublons CSV

Supprimez les lignes en double d’un fichier CSV selon les colonnes que vous choisissez.

100 % local
Utiliser l’outil
Données & tableaux

Validateur CSV

Validez la structure d’un fichier CSV et repérez rapidement les lignes ou colonnes problématiques.

100 % local
Utiliser l’outil
Données & tableaux

Statistiques CSV

Analysez les colonnes d’un CSV et obtenez rapidement des statistiques utiles sur vos données.

100 % local
Utiliser l’outil

Collection

Maîtriser ses données et tableaux

  1. 01Données et tableaux : comprendre CSV, Excel, JSON et la structure d’un jeu de données
  2. 02Nettoyer un fichier CSV ou Excel avant de l’utiliser
  3. 03Doublons et validation CSV : fiabiliser un tableau avant import
  4. 04Filtrer, trier et choisir les colonnes d’un CSV sans casser sa structure
  5. 05Fusionner plusieurs fichiers CSV ou Excel : assembler ou joindre les tableaux
  6. 06Découper un CSV ou séparer un tableau : choisir la bonne méthode
  7. 07Comparer deux fichiers CSV ou Excel et repérer les différences
  8. 08Convertir CSV, Excel, JSON et TSV sans perdre la structure des données
  9. 09Construire un workflow de préparation de données reproductible

Cet article vous a-t-il été utile ?