Un fichier de données paraît souvent simple : quelques colonnes, des lignes et des valeurs. Pourtant, beaucoup de problèmes apparaissent au moment de nettoyer, comparer, fusionner ou convertir ces informations. Une colonne peut changer de nom, un séparateur CSV peut être mal détecté, un nombre peut être interprété comme du texte ou deux fichiers peuvent décrire la même information avec des structures différentes.
Cette première partie de la collection Maîtriser ses données et tableaux pose les bases : comprendre ce que contient réellement un tableau et choisir le bon format avant de lancer une transformation.
La structure compte plus que l’extension
Dans un tableau classique, chaque ligne représente généralement un enregistrement et chaque colonne un attribut. Un fichier de clients peut par exemple contenir id, nom, email et pays.
La première ligne joue souvent le rôle d’en-tête. Elle donne un sens aux valeurs placées dessous. Si deux fichiers utilisent email et adresse_email pour la même information, une fusion automatique ne peut pas toujours deviner qu’il s’agit de la même colonne.
La qualité d’un jeu de données dépend donc autant de sa structure que de son format.
CSV : simple, portable, mais pas sans ambiguïté
CSV signifie Comma-Separated Values, mais la virgule n’est pas le seul séparateur rencontré. Selon les logiciels et les paramètres régionaux, on trouve aussi le point-virgule, la tabulation ou d’autres caractères.
Un CSV est essentiellement du texte. Il ne conserve pas la mise en forme d’un classeur Excel, ses formules, ses couleurs ou plusieurs feuilles. Cette simplicité le rend très portable, mais impose d’être attentif aux séparateurs, aux guillemets, à l’encodage et aux retours à la ligne contenus dans certaines cellules.
Le Validateur CSV permet de vérifier la structure d’un fichier avant d’enchaîner d’autres opérations.
TSV : la même logique avec une tabulation
TSV suit une logique proche du CSV, mais utilise une tabulation comme séparateur. Ce format peut être pratique lorsque les valeurs contiennent fréquemment des virgules ou des points-virgules.
CSV et TSV restent cependant des formats tabulaires plats : ils décrivent des lignes et des colonnes, pas une hiérarchie complexe.
Excel : davantage qu’un tableau de valeurs
Un fichier Excel peut contenir plusieurs feuilles, des formules, des types de cellules, des dates, des mises en forme et d’autres informations absentes d’un CSV.
Lors d’une conversion vers CSV, il faut donc accepter qu’une partie de cette richesse ne puisse pas être représentée. Le but n’est pas toujours de reproduire le classeur à l’identique, mais d’en extraire une table de données exploitable.
Le Convertisseur Excel, CSV et JSON est adapté lorsqu’un changement de format est réellement nécessaire.
JSON : objets, tableaux et structures imbriquées
JSON n’est pas limité aux tableaux. Il peut représenter des objets, des listes, des valeurs imbriquées et des structures hiérarchiques.
Un tableau CSV se convertit assez naturellement en une liste d’objets JSON : chaque ligne devient un objet et chaque en-tête une clé. L’opération inverse demande que les objets puissent être ramenés à des colonnes cohérentes.
Si les objets JSON contiennent des sous-objets ou des listes différentes d’une ligne à l’autre, une conversion tabulaire nécessite des choix : aplatir les propriétés, ignorer certaines valeurs ou conserver le JSON comme format principal.
Types de valeurs : un piège discret
Dans un fichier texte, 00123, 123 et "123" peuvent représenter des intentions différentes. Un code postal, un identifiant ou une référence produit ne doit pas nécessairement être traité comme un nombre.
Les dates posent un problème similaire : 01/02/2026 n’a pas la même interprétation partout.
Avant une conversion ou un nettoyage, demandez-vous donc quelles colonnes sont réellement numériques, textuelles, calendaires ou identifiantes.
Nettoyer n’est pas convertir
Transformer un CSV en JSON ne supprime pas les doublons. Convertir Excel en CSV ne corrige pas les espaces inutiles. Changer le nom d’un fichier ne normalise pas ses colonnes.
Pour corriger les données elles-mêmes, utilisez plutôt Nettoyer un fichier Excel ou CSV, puis appliquez si nécessaire les opérations spécialisées de la collection.
Observer avant de modifier
Sur un fichier inconnu, une bonne séquence consiste à :
- identifier le format et le séparateur ;
- vérifier les en-têtes ;
- repérer les colonnes importantes ;
- contrôler les valeurs manquantes ou atypiques ;
- décider du format final attendu ;
- seulement ensuite nettoyer, filtrer, fusionner ou convertir.
L’outil Statistiques CSV peut aider à obtenir une première vue d’ensemble d’un tableau.
En-têtes, séparateurs et encodage : trois détails qui changent tout
Trois fichiers peuvent contenir les mêmes données tout en se comportant très différemment selon la manière dont ils sont encodés et structurés.
Les en-têtes doivent être stables
Un en-tête comme Nom client peut sembler équivalent à nom_client, mais un outil de fusion ou un script ne les considérera pas nécessairement comme identiques. Avant d’assembler plusieurs sources, il est souvent préférable d’harmoniser les noms de colonnes et d’éviter les variantes liées aux accents, aux espaces ou aux majuscules.
Le séparateur n’est pas toujours une virgule
En environnement francophone, le point-virgule est fréquent parce que la virgule sert déjà de séparateur décimal. Un fichier CSV peut donc très bien contenir :
nom;prix;quantite
Clavier;49,90;2
Un import réalisé avec le mauvais séparateur peut transformer toute une ligne en une seule cellule.
L’encodage décide de la lisibilité des caractères
UTF-8 est aujourd’hui le choix le plus sûr pour échanger des données contenant accents, symboles ou alphabets variés. Lorsqu’un fichier est ouvert avec le mauvais encodage, Élodie peut devenir une suite de caractères incohérente. Ce problème ne vient pas des données métier mais de leur représentation textuelle.
Schéma, types et valeurs manquantes
Un tableau n’est pas seulement une liste de cellules. Il possède aussi un schéma implicite : quelles colonnes existent, ce qu’elles représentent et quelles valeurs sont attendues.
Une colonne prix devrait par exemple contenir des nombres, tandis qu’une colonne reference peut avoir besoin de conserver des zéros en tête. Une cellule vide peut signifier « inconnu », « non applicable » ou simplement « donnée oubliée ». Ces trois cas ne sont pas équivalents.
Avant une automatisation, il est utile de définir :
- les colonnes obligatoires ;
- les colonnes facultatives ;
- les types attendus ;
- les valeurs autorisées ;
- la manière de représenter une donnée absente.
Cette discipline évite qu’une conversion réussie techniquement produise malgré tout un jeu de données inutilisable.
Pour un échange simple entre logiciels, CSV reste souvent un excellent choix. Pour un travail humain dans un tableur, Excel conserve davantage d’informations. Pour une API ou une structure qui dépasse le tableau plat, JSON est généralement plus naturel.
Le « meilleur format » n’existe donc pas dans l’absolu. Le bon format est celui qui préserve les informations nécessaires au prochain usage sans ajouter de complexité inutile.
Les parties suivantes montrent comment nettoyer, valider, filtrer, fusionner, comparer et convertir ces données sans perdre de vue cette structure.