← Retour au blog

Dédoublonner son CRM avec l'IA sans perdre d'historique

Les règles exactes laissent passer beaucoup de doublons. L'IA les repère, mais une fusion se défait mal : comment détecter, trier et fusionner sans rien perdre.

September 15, 2026

5 min

Terence Acher

Dédoublonner son CRM avec l'IA sans perdre d'historique

📌 Résumé de l’article

Les règles exactes laissent passer beaucoup de doublons. L'IA les repère, mais une fusion se défait mal : comment détecter, trier et fusionner sans rien perdre.

Les doublons d'un CRM naissent rarement d'une erreur. Un salon produit un import, un formulaire du site crée une fiche, un commercial saisit un prospect rencontré au téléphone, un outil de prospection synchronise sa liste. Chaque entrée est légitime. Ensemble, elles donnent trois fiches pour la même personne, avec un historique éclaté entre les trois, et un commercial qui ouvre la mauvaise sans savoir qu'un collègue a eu un rendez-vous la semaine précédente.

Pourquoi les règles exactes ne suffisent pas

La plupart des CRM dédoublonnent déjà sur un identifiant exact. HubSpot, par exemple, rapproche les contacts par adresse email et les entreprises par nom de domaine, d'après sa documentation consultée en septembre 2026. Ces règles attrapent les doublons évidents et laissent passer le reste :

  • la même personne enregistrée avec son adresse professionnelle et son adresse personnelle ;
  • une adresse qui change après un rachat ou un changement de nom de domaine ;
  • « Transports Lefèvre », « TRANSPORTS LEFEVRE SARL » et « Lefèvre Logistique », la dernière étant la nouvelle marque de la même société ;
  • une entreprise sans site web, cas fréquent chez les artisans et les TPE, donc sans domaine à comparer ;
  • un groupe et ses filiales, qui ressemblent à des doublons et n'en sont pas.

Écrire une règle pour chacun de ces cas mène à des dizaines de conditions fragiles. C'est précisément là que l'IA fait gagner du temps, et c'est souvent le premier chantier d'une remise en état des données du CRM.

La méthode en trois temps

1. Réduire le nombre de paires à comparer

Comparer chaque fiche à toutes les autres devient vite ingérable : dix mille entreprises forment près de cinquante millions de paires. On regroupe d'abord les fiches qui ont une chance d'être liées (même code postal, mêmes premières lettres du nom nettoyé, même domaine, même numéro de téléphone), et seules les paires d'un même groupe sont examinées.

2. Faire juger les paires ambiguës

Pour chaque paire candidate, un modèle de langage reçoit les champs utiles (nom, domaine, adresse, téléphone, SIREN s'il est connu) et répond dans un format imposé : même entité, entités différentes ou incertain, avec la raison en une phrase. Il gère bien les variantes d'écriture, les abréviations et les changements de marque, à condition de lui interdire de deviner quand l'information manque.

En France, un identifiant tranche une bonne partie des cas : le SIREN, qui désigne l'entreprise, et le SIRET, qui désigne chacun de ses établissements. L'API publique Recherche d'entreprises, gratuite et ouverte sans inscription, retrouve le SIREN à partir d'un nom et d'une commune. Deux fiches qui partagent un SIREN décrivent la même entreprise. Deux SIRET différents sous le même SIREN décrivent deux sites, qu'il vaut parfois mieux garder séparés si chacun a son propre interlocuteur.

3. Trier selon le degré de certitude

  • Certitude forte (même SIREN pour une entreprise, même email nominatif pour un contact) : fusion automatique, consignée dans un journal.
  • Rapprochement probable : file de validation, où une personne tranche en quelques secondes grâce à la raison fournie par le modèle.
  • Cas incertain : on ne touche à rien et on marque la paire pour le prochain passage.

Avant de lancer le traitement sur toute la base, on relit à la main une cinquantaine de paires dans chaque catégorie. Si l'échantillon « probable » contient des erreurs grossières, on corrige les consignes avant d'aller plus loin.

Fusionner sans perdre d'information

Détecter est la partie facile. Selon le CRM, une fusion se défait mal ou pas du tout, d'où quatre règles à écrire avant de fusionner quoi que ce soit.

  • Désigner la fiche qui survit par une règle écrite : la plus ancienne, celle qui porte des affaires, ou celle qui compte le plus d'activités.
  • Décider champ par champ quelle valeur l'emporte : la plus récente pour une fonction, la valeur vérifiée pour un email, et jamais une valeur vide qui écrase une valeur remplie.
  • Conserver les anciennes valeurs : un email secondaire, un ancien nom d'entreprise, une note qui trace la fusion.
  • Exporter les fiches concernées avant de fusionner, pour pouvoir reconstituer une information si une règle était mal écrite.

Empêcher les doublons de revenir

Un dédoublonnage ponctuel se défait en quelques mois si rien ne change à l'entrée. Les imports passent par un contrôle contre la base existante avant d'être chargés. Les formulaires et les outils synchronisés mettent à jour une fiche à partir d'un identifiant commun (email, domaine, SIREN) au lieu d'en créer une nouvelle. Un passage automatique, chaque semaine ou chaque mois, envoie les nouvelles paires suspectes dans la file de validation. Le dédoublonnage devient une routine de quelques minutes plutôt qu'un chantier annuel.

Questions fréquentes

Quel outil utiliser pour dédoublonner avec l'IA ?

Les CRM ont leurs propres outils de gestion des doublons, souvent suffisants pour les cas évidents. Pour les cas ambigus, on combine un outil de traitement de données comme Clay, ou une automatisation n8n ou Make, avec un modèle de langage appelé sur chaque paire. Le choix dépend du volume et de la fréquence des passages.

Faut-il dédoublonner avant d'enrichir ?

Toujours. Enrichir d'abord revient à payer plusieurs fois la même information, puis à choisir entre des valeurs contradictoires au moment de la fusion. La normalisation des champs vient juste après : voir nettoyer son CRM avec l'IA.

Que faire des contacts qui ont changé d'entreprise ?

Ce ne sont pas des doublons. On crée ou on rattache le contact à sa nouvelle entreprise quand on la connaît, on marque l'ancienne fiche comme inactive et on garde l'historique. Un ancien interlocuteur qui arrive chez un nouveau compte est une bonne occasion de reprendre contact.

Repérer et fusionner les doublons sans perte d'information fait partie du module « La propreté » de la journée Faire de son CRM le centre de son système d'acquisition B2B, avec les règles d'entrée des données et l'exclusion automatique des clients et des affaires en cours. Les participants appliquent la méthode à leur propre CRM, en intra-entreprise, par groupes de douze personnes au plus. La formation peut être prise en charge par l'OPCO de votre entreprise.

Écrit par

Automation

Terence

Automation

Formateur et consultant Growth & IA. Intervenant en école supérieure.

Acquisition
IA & Automation

Vous voulez vous former ?

Formations certifiantes éligibles CPF. Réponse sous 24h.

Nous contacter
Financement

Faites financer votre formation

CPF, OPCO, plan de développement des compétences… selon votre situation, votre formation peut être prise en charge jusqu'à 100 %. Un conseiller monte votre dossier avec vous.

Nous contacter ↗