Caractères étranges dans un CSV : comment les corriger
Pourquoi un CSV affiche du mojibake, comment retrouver l'encodage source probable et quand un changement d'encodage ne peut pas réparer la structure.
Voir François à la place de François indique généralement un mauvais décodage, pas une colonne endommagée. Le fichier a été écrit avec un encodage et lu comme s'il en utilisait un autre.
Retrouver l'encodage à partir de l'origine du fichier
Commencez par le logiciel qui a produit le CSV. Un export récent peut être en UTF-8 ; un ancien logiciel Windows, un logiciel de gestion ou un export métier peut utiliser un encodage historique. Si vous pouvez refaire un export, ajoutez ou repérez une ligne dont vous connaissez exactement le texte.
Ligne de contrôle pour un export français
client;nom;ville;commentaire
F-27;François;Évry-Courcouronnes;réglé à réception
La comparaison doit porter sur des caractères discriminants : accents, cédille, apostrophe typographique, symbole monétaire, ou texte non latin si votre fichier en contient.
Dans Excel français, contrôlez l'import avant de modifier le fichier
Passez par Données › À partir d’un fichier Texte/CSV et vérifiez l'aperçu. Le même écran permet aussi de choisir le Délimiteur ; ce réglage ne corrige pas l'encodage.
En France, la virgule sert couramment de séparateur décimal et le point-virgule de séparateur de liste. Un fichier peut donc avoir simultanément un encodage correct et un mauvais choix de délimiteur à l'ouverture. Distinguez les symptômes avant d'agir.
Repartir de la copie originale
Décodez l'original avec l'encodage correspondant à sa source, contrôlez plusieurs valeurs connues, puis enregistrez une nouvelle copie en UTF-8.
Nablyx applique un ordre de détection volontairement prudent. Une marque d'ordre des octets UTF-8, UTF-16LE ou UTF-16BE est prioritaire. En son absence, l'outil exige d'abord que le contenu soit un UTF-8 valide ; si ce contrôle échoue, il utilise Windows-1252 et signale ce repli afin que vous le considériez comme une hypothèse moins fiable, et non comme une certitude.
Le fichier UTF-8 réparé peut être plus volumineux que la source. Windows-1252 stocke de nombreux caractères accentués sur un seul octet, alors que les mêmes caractères nécessitent plusieurs octets en UTF-8. Une sortie plus grande après une réparation réussie ne prouve donc pas, à elle seule, que des lignes ont été ajoutées ou dupliquées.
Relire le CSV avec son encodage sourceSi vous ne connaissez pas l'encodage et que plusieurs réglages donnent des résultats plausibles, la solution la plus fiable est souvent de réexporter depuis le système d'origine avec un encodage explicitement choisi.
Ce qu'un changement d'encodage ne peut pas réparer
Un problème de structure reste un problème de structure. Des lignes de largeur inégale, des guillemets non fermés, des en-têtes dupliqués ou des champs qui se décalent ne seront pas reconstruits par une conversion de texte ; utilisez alors le diagnostic d'un CSV corrompu.
À l'inverse, si les colonnes sont parfaitement alignées et que seuls é, ç, œ ou la ponctuation sont déformés, l'encodage est une piste prioritaire.
Valider la correction dans le vrai parcours d'import
Ouvrez la copie corrigée avec le logiciel qui doit réellement la recevoir. Vérifiez une ligne avec accents, une valeur comportant une virgule décimale et un champ texte. Vous confirmez ainsi séparément que le texte est lisible et que le découpage des colonnes n'a pas changé.
Voir la transformation
Le texte corrompu et les séparateurs mixtes deviennent un CSV fiable
Réparez le texte illisible et les séparateurs incohérents sans modifier les valeurs réelles des cellules.
Besoin de le faire maintenant ?
Corriger l'encodage du CSVOutils associés
Ouvrez l'outil dont parle ce guide, ou explorez un outil associé.
- Réparer l'encodage et les délimiteurs CSV gratuitementDétectez les problèmes d’encodage, de délimiteur et de guillemets, puis téléchargez un CSV UTF-8 normalisé.
- Nettoyer et réparer un fichier CSV gratuitementRéparez les problèmes CSV courants : délimiteurs incorrects, lignes inégales, lignes vides, espaces, marqueurs BOM et en-têtes en double.