Rapprochement de données : les doublons probables, les critères visibles
Deux bases métier décrivent souvent les mêmes usagers avec des écritures différentes. Votre agent rapproche ces enregistrements, présente les correspondances probables avec les critères qui les fondent et laisse la fusion à votre décision. Hébergé en France : les données des usagers restent dans votre administration. Aucune fusion n'est appliquée automatiquement — une identité confondue a des conséquences durables.
Mis à jour le
Les correspondances sont classées par niveau de concordance des critères.
Aucune fusion n'est appliquée : chaque paire est présentée pour validation.
🔗 Sourcé · enregistrements des deux bases, critères affichés
La fusion elle-même reste votre geste : confondre deux identités d'usagers produit des effets durables sur leurs droits.
✎ Appui · lot préparé, fusion décidée par vous
Un agent Blue Lemon Agent de rapprochement croise vos bases métier et présente les correspondances probables avec les critères qui les fondent — nom, date de naissance, adresse, identifiant — classées par niveau de concordance. Aucune fusion n'est appliquée automatiquement. Il fonctionne en inférence locale ou est hébergé en France : les données des usagers restent chez vous, architecture conçue pour réduire l'exposition aux législations extraterritoriales, la localisation ne garantissant pas à elle seule l'immunité.
Repères décrivant notre offre, et non des résultats mesurés chez un client. L'ampleur du gain sur le nombre de bases rapprochées et leur volumétrie se confirme par un pilote.
Qu'apporte un agent IA à la qualité de vos données ?
Un doublon repéré et documenté se traite en quelques instants ; non repéré, il se propage dans tous les traitements.
! L'enjeu
Rapprocher deux bases demande de comparer des enregistrements écrits différemment et d'expliquer pourquoi ils se correspondent. La comparaison est systématique ; la décision de fusionner engage les droits d'un usager. L'agent prend en charge la première et documente chaque correspondance par ses critères concordants.
✓ Notre réponse
Votre service de la donnée valide des correspondances déjà documentées, classées par niveau de concordance, et concentre son attention sur les cas ambigus. Aucune fusion n'est appliquée sans décision : confondre deux identités produit des effets durables sur les droits des personnes. Inférence locale ou ressource isolée hébergée en France : les données personnelles des usagers ne sortent pas de l'administration.
Les données personnelles des usagers : souveraineté & conformité
Un rapprochement de bases manipule par nature des données personnelles issues de plusieurs traitements. Voici comment il est encadré.
Inférence locale
L'agent peut tourner sur une machine de votre organisation : aucune donnée d'usager ni enregistrement ne sort du réseau.
Hébergement en France
Sinon, une ressource dédiée et isolée hébergée en France, sous droit français — vos bases métier et vos référentiels : traitements et accès opérés dans l'Union européenne visés par l'architecture.
Exposition extraterritoriale réduite
Pour les données personnelles des usagers, l'architecture vise à réduire l'exposition au Cloud Act et au FISA 702 ; la seule localisation en France ou dans l'Union européenne ne garantit pas l'immunité.
Ressource isolée
Aucune mutualisation : un environnement strictement dédié à votre administration et à ses référentiels.
Critères de rapprochement affichés
Chaque correspondance indique les critères concordants et son niveau de concordance ; chiffrement, accès par rôle (RBAC) et journalisation des rapprochements proposés.
AI Act : déploiement encadré
Agent strictement en appui ; aucune fusion appliquée ni identité modifiée automatiquement ; traçabilité et supervision humaine de bout en bout.
Ce qui dépend de l'architecture retenue Ces points ne sont pas des garanties générales : ils sont arrêtés déploiement par déploiement, au devis.
- La localisation applicable est celle de l'architecture décrite au devis et vérifiée avant mise en service.
- L'exécution locale n'est annoncée que pour la configuration explicitement décrite et recettée au devis.
- L'isolation applicable dépend du mode de déploiement décrit au devis ; aucune isolation dédiée n'est présumée.
- Les rôles et permissions sont configurés et recettés pour les identités et systèmes effectivement raccordés.
- Les événements journalisés, leur contenu, leur durée de conservation et leurs accès sont définis pour le déploiement retenu.
Voyez l'agent au travail
4 situations réelles, prises parmi celles qui reviennent le plus. Choisissez-en une : l'échange se déroule comme il se déroulerait chez vous.
Démonstration écrite à l'avance. Ces échanges illustrent le comportement de l'agent — ses sources, ses refus, ce qu'il laisse à vos équipes. Rien n'est envoyé depuis cette page, aucun modèle n'y est interrogé, et les dossiers cités sont fictifs. C'est précisément ce que nous promettons à vos données.
Les comportements montrés ici — surveillance, règles d'automatisation, routage et relances — sont paramétrés avec vous lors du déploiement, à partir de vos outils, de vos règles et de vos seuils.
Les points d'architecture cités dans ces échanges — localisation, exécution locale, isolation, chiffrement, accès par rôle, journalisation — ne sont pas une garantie attachée à la démonstration : ils sont ceux de l'architecture décrite à votre devis, et vérifiés avant mise en service.
· Un même équipement est inventorié dans deux fichiers avec deux valeurs d'achat. L'écart est de 12 400 €, et le bilan comptable retient la plus basse.
· Deux fiches portent la même adresse, la même date de naissance et deux orthographes du même nom. Elles ne seront pas fusionnées — je vous dis pourquoi plus bas.
· Un fichier de subventions et un fichier de conventions divergent sur 9 montants. Les deux ont été mis à jour, à deux dates différentes.
· 412 lignes d'un fichier n'ont aucun équivalent dans l'autre. Ce n'est pas une anomalie : les deux fichiers ne couvrent pas la même chose, et personne ne l'avait écrit. veille-matin_4-signalements.pdf4 signalements · 1 périmètre à écrire
⛓ Sourcé · inventaire, fichier comptable, fichier des subventions, conventions
Ce qui concorde : même adresse, même date de naissance, deux orthographes proches du même nom. Trois signaux forts.
Ce qui ne concorde pas : deux prénoms différents, et deux dossiers ouverts à quatre ans d'intervalle sur deux dispositifs sans rapport.
L'explication la plus probable, et elle est banale : deux personnes de la même famille, au même domicile, nées le même jour d'années différentes — ou le même jour, cela arrive. Une fusion ici mélangerait deux vies dans un seul dossier.
Ce que ça coûterait : des droits calculés sur les revenus de deux personnes, un historique médical ou social attribué à la mauvaise, et un dossier qu'on ne sait plus séparer — parce que rien ne dit plus quelle ligne appartenait à qui.
Ce que je fais à la place : je les signale côte à côte, avec ce qui concorde et ce qui diverge, et un agent tranche en trente secondes avec une pièce d'identité au dossier. 2-fiches_ce-qui-concorde-et-diverge.pdf3 concordances · 2 divergences · aucune fusion
⛓ Sourcé · 2 fiches, 3 signaux concordants, 2 signaux divergents
Le routage suit la nature de l'écart : un écart de valeur au service qui tient le fichier de référence ; deux fiches proches à l'agent qui peut ouvrir la pièce d'identité, jamais à un tableau de bord ; les divergences de montants aux deux services, avec les deux dates de mise à jour ; les 412 lignes au chef de service, en une fois.
Avec une relance : 7 jours sur tout, sauf ce qui alimente un état financier en cours — 24 h dans ce cas. Puis une synthèse mensuelle : par type d'écart et par couple de fichiers, jamais par usager.
Ce que cette comparaison a déjà produit : un écart de 12 400 € sur un même équipement porté au service qui tient le fichier de référence avant l'arrêté des comptes, neuf montants divergents entre subventions et conventions présentés avec leurs deux dates de mise à jour, 412 lignes expliquées — les deux fichiers ne couvrent pas le même périmètre, et c'est désormais écrit —, et deux fiches proches posées côte à côte avec ce qui concorde et ce qui diverge.
Ce que ça rend au service dès demain : des états financiers sincères, et un agent qui tranche en trente secondes sur une paire de fiches au lieu de reprendre deux bases à la main. La fusion reste sa décision, et c'est ce qui protège l'usager : deux vies mélangées dans un même dossier ne se séparent plus, parce que rien ne dit plus quelle ligne appartenait à qui. Je lui rends cette décision déjà instruite — critères concordants, critères divergents, niveau de concordance, et la pièce d'identité ouverte au bon endroit. Le jour où vous voulez que j'applique les fusions moi-même au-dessus d'un niveau que vous fixez, vous m'en donnez le mandat : écrit, borné à ce niveau, daté, retirable d'un mot. Les données des usagers ne quittent pas l'administration : je compare ce que vous m'ouvrez, base par base, et chaque comparaison est tracée.
Le pas suivant est prêt : les paires sont regroupées par niveau de concordance, les plus sûres en tête, pour que la validation avance par lots. Dites-moi quel niveau vous voulez traiter en premier.
✎ Proposition · surveillance et relances à paramétrer — vous fixez les seuils
Ce qui a du poids : un identifiant partagé — le signal le plus sûr, et le seul qui suffise seul ; une combinaison de champs improbable par hasard ; une référence croisée, quand une ligne cite l'autre.
Ce qui n'a presque pas de poids : un nom seul, une adresse seule, une date seule. Deux personnes peuvent partager n'importe lequel de ces champs sans être la même.
Ce que je produis pour chaque rapprochement : les champs qui concordent, les champs qui divergent — donnés avec autant de soin — et ce qu'il faudrait pour trancher.
Le niveau de concordance que je produis pour chaque paire, et il est nommé plutôt que chiffré : « identifiant partagé », « combinaison improbable », « référence croisée », « signal faible seul » — et les rapprochements arrivent groupés par niveau, prêts à valider par lots. Pourquoi un nom et pas un pourcentage : « 87 % » ne dit pas ce qui manque, et un agent qui voit 87 % valide ; un agent qui lit « deux prénoms différents » ouvre le dossier. Le lot « identifiant partagé » se valide d'un geste ; les paires à divergence se regardent une par une.
Sur 18 400 lignes comparées : 1 240 rapprochements proposés, dont 96 avec au moins une divergence — ce sont les 96 qui comptent. rapprochement_18400-lignes.pdf1 240 rapprochements · 96 à divergence
⛓ Sourcé · 18 400 lignes, 2 fichiers, règles de rapprochement du service
Ce qu'ils représentent : 96 cas sur 18 400 lignes, soit un demi pour cent. À raison de deux minutes chacun, c'est trois heures — une fois, et le stock est traité.
Ce que j'ai fait pour ces trois heures : chaque cas arrive avec la pièce du dossier qui trancherait, quand elle existe. Sur 74 des 96, elle existe déjà : une pièce d'identité, un avis d'imposition, un acte. L'agent l'ouvre, il tranche, il passe au suivant.
Sur les 22 autres, la pièce n'est pas au dossier, et je le dis plutôt que de proposer quand même. Ces 22 demandent un appel ou un courrier.
Ce qui compte dans ce chiffre : ce n'est pas que l'outil trouve 1 240 rapprochements — c'est qu'il ramène la décision humaine de 18 400 lignes à 96 cas, dont 74 se tranchent avec une pièce déjà là. 96-cas_74-avec-la-piece.pdf96 cas · 74 tranchables · 22 à documenter
✎ Appui · 96 cas préparés — 74 avec la pièce qui tranche
Les deux valeurs : l'inventaire porte 34 200 €, le fichier comptable 21 800 €. Écart de 12 400 €.
Ce que j'ai cherché : une pièce d'achat rattachée à l'une ou à l'autre. La facture existe, elle est rattachée à la ligne comptable, et elle porte 34 200 €.
Ce que ça veut dire : la valeur juste est dans l'inventaire, et la ligne comptable porte la mauvaise malgré sa facture. C'est le sens contraire de ce qu'on attendrait, et c'est exactement pour cela qu'il fallait ouvrir la pièce plutôt que présumer.
Ce qui se signe, et pourquoi : la correction de la ligne comptable. Une valeur d'inventaire corrigée change un amortissement et un bilan — elle revient au comptable, la facture sous les yeux, et elle porte son nom. Le travail, lui, est fait : l'écart est établi sur pièce, et je lui remets le nouvel amortissement recalculé sur la durée restante, à côté de l'ancien.
Ce que j'ai préparé : les deux lignes, la facture, et les 6 autres équipements dans le même cas que j'ai trouvés en cherchant celui-ci. 7-equipements_ecart-de-valeur.pdf7 équipements · pièce ouverte pour chacun
⛓ Sourcé · inventaire, fichier comptable, facture d'achat rattachée
Ce que j'ai regardé : la date de dernière mise à jour de chaque ligne. Les 9 divergences correspondent à 9 avenants signés entre mars et juin. Le fichier des conventions les a intégrés ; le fichier des subventions est resté sur les montants initiaux.
Ce n'est donc pas une erreur de saisie : c'est un fichier qui suit les avenants et un autre qui ne les reçoit pas. Le problème est le circuit, pas les données.
Ce que ça produit aujourd'hui : les états de subventions versées sont établis sur les montants d'avant avenant. L'écart cumulé est de 47 600 €, dans les deux sens.
Ce que je propose : signaler chaque avenant signé au service qui tient le second fichier — et non recopier les montants moi-même. Un fichier alimenté par un outil sans que personne ne sache d'où vient la valeur est un fichier que plus personne ne vérifie. 9-avenants_47600-eur.pdf9 avenants · 2 fichiers · écart cumulé
✎ Proposition · signalement à la signature d'un avenant — aucune recopie automatique
Ce que j'ai trouvé en les regardant : les 412 ne sont pas éparpillées. 390 partagent une caractéristique : elles concernent des bénéficiaires rattachés à une commune qui a rejoint l'intercommunalité en 2024. Le second fichier n'a jamais été étendu à ce périmètre.
Ce que ça veut dire : les deux fichiers ne décrivent pas le même territoire, et aucun document ne le dit. Chaque état croisé produit depuis deux ans sous-estime donc une partie du territoire sans que personne ne le sache.
Les 22 restantes sont des cas isolés : 14 créations récentes non encore reprises, 8 lignes closes d'un côté et pas de l'autre.
Ce que je propose : pas de reprise de données — d'abord écrire ce que chaque fichier couvre. Une note d'une page, deux périmètres, deux dates. Reprendre les données avant d'avoir écrit cela reviendrait à mélanger deux territoires sans le savoir. 412-lignes_2-perimetres.pdf390 même cause · 22 cas isolés
⛓ Sourcé · 412 lignes, rattachements communaux, dates de création des fichiers
Ce qui est conservé : le rapprochement proposé, les champs concordants et divergents, la décision prise, et sa date.
Ce qui n'est pas conservé : aucun rapprochement entre des fichiers que vous n'avez pas explicitement appariés, aucun profil constitué en croisant plusieurs sources, aucune donnée d'un fichier recopiée dans un autre.
Pourquoi c'est écrit ici, et c'est le point le plus important de cette page : un outil qui rapproche des fichiers est, techniquement, à un pas d'un outil qui les croise tous. Ce pas n'est pas franchi, et il ne l'est pas par construction : chaque paire de fichiers est appariée explicitement par vous, et deux fichiers non appariés ne se voient jamais.
Ce que ça vous donne concrètement : vous pouvez répondre à un usager qui demande ce qui est fait de ses données — la réponse est une liste de paires de fichiers, écrite, courte, et vraie. ce-qui-est-conserve.pdf4 données gardées · 3 interdites par construction
✎ Cadre · appariements de fichiers à déclarer — rien n'est rapproché par défaut
Votre cas n'est pas ici ? C'est exactement ce dont on parle en 15 minutes. Réserver l'audit gratuit →
Que fait l'agent concrètement ?
Un agent, plusieurs travaux de qualité des données. Tous ces usages fonctionnent en appui, sous votre validation.
Rapprochement entre bases
Croise les enregistrements de vos bases métier et référentiels.
Critères documentés
Affiche les critères concordants et le niveau de concordance de chaque paire.
Lots préparés à valider
Regroupe les correspondances par niveau pour accélérer la validation.
En 15 minutes, nous identifions l'agent qui rendra le plus de temps à vos agents — sans surdimensionner le projet.
Combien d'enregistrements un service peut-il rapprocher ?
En prenant en charge la comparaison et la documentation, on déplace l'effort vers l'arbitrage des cas ambigus. L'ampleur du gain dépend de votre volume et reste à confirmer par un pilote.
Les étapes de votre projet d'agent IA
Audit & cadrage
15 min pour cibler le cas d'usage le plus rentable.
Devis ou souscription directe
Une offre du catalogue se souscrit en ligne ; un besoin particulier reçoit un devis chiffré.
Conception
Nous concevons l'agent et ses garde-fous.
Intégration & tests
Nous raccordons vos outils à l'agent, lui-même hébergé en France.
Déploiement
Mise en service et formation de votre équipe.
Exploitation
Supervision continue et amélioration.
Une formule, un seul agent
Un agent de rapprochement de données (croisement, critères, lots à valider), installé et exploité pour vous — abonnement annuel, le temps que les gains s'installent durablement.
Installation + abonnement maîtrisé
- Installation, paramétrage et formation de vos équipes
- Exploitation, supervision humaine, mises à jour et support
- Hébergement souverain en France, ressource dédiée et isolée
Tout inclus, sans frais d'installation
- Mise en service incluse (installation, paramétrage, formation)
- Exploitation, supervision humaine, mises à jour et support
- Hébergement souverain en France, géré de bout en bout
Sur site, vous êtes propriétaire
- Matériel installé dans vos locaux (vous en êtes propriétaire)
- Modèles IA français / européens exécutés en local
- Maintenance à distance sécurisée (Suivi Pro inclus)
Quatre garanties qui comptent pour vos référentiels
Ressources liées
Vos questions, nos réponses
L'agent fusionne-t-il les doublons ?
Sur quels critères repose un rapprochement ?
Que fait-il des correspondances ambiguës ?
Comment le RGPD est-il respecté ?
Les données des usagers sont-elles protégées ?
Combien de temps pour déployer cet agent ?
D'autres agents pour vos données
Estimons le potentiel sur vos référentiels
15 minutes pour cadrer vos bases et vos critères — hébergé en France, supervisé, sans engagement.