Définition
Tâche consistant à identifier, apparier et fusionner des enregistrements qui se réfèrent à la même entité du monde réel à travers un ou plusieurs jeux de données ou domaines, produisant des représentations consolidées tout en maîtrisant l'incertitude et l'erreur.
Principe
Principe
Combiner blocage/indexation, scoring de similarité pair-à-pair ou par groupe, et linkage supervisé ou probabiliste optionnel pour décider quels enregistrements représentent la même entité ; intégrer des seuils, des revues humaines et des retours pour gérer faux appariements et omissions.
Démonstration
Démonstration
Fusionner des fiches client provenant de plusieurs systèmes métiers en comparant similarités de nom, adresse et contacts, en regroupant les enregistrements au-dessus d'un seuil de similarité en une seule entité client tout en signalant les paires ambiguës pour revue manuelle.
Mauvaise application
Mauvaise application
Des fusions trop agressives qui confondent des individus distincts (faux positifs) ou des règles trop conservatrices qui laissent des doublons (faux négatifs) ; l'utilisation de mesures de similarité faibles ou biaisées peut nuire de façon disproportionnée aux groupes sous-représentés.
Conséquence
Conséquence
Une résolution d'entités efficace produit des jeux de données unifiés et des analyses plus claires, permettant des comptes dédupliqués, des profils consolidés et de meilleurs apports pour les modèles en aval ; les erreurs entraînent des agrégats trompeurs, des risques pour la vie privée et des erreurs opérationnelles.
Inversion
Inversion
S'appuyer uniquement sur des jointures par clé exacte ou des identifiants non normalisés qui échouent à identifier des enregistrements équivalents variant par orthographe, format ou champs manquants, laissant la fragmentation non traitée.
Limite
Limite
Couvre le linkage et la déduplication mais pas la vérification d'identité ou l'authentification ; les méthodes de résolution varient selon l'échelle des données, leur qualité et les contraintes de confidentialité et équilibrent souvent rappel et précision.
Tension sémantique
Tension sémantique
Tension avec la gestion d'identité : la résolution d'entités produit des enregistrements unitaires pour l'analyse mais n'établit pas une identité vérifiée à des fins juridiques ou de sécurité ; elle met en balance appariement probabiliste et nécessité d'identité prouvable.
Synthèse
Synthèse
La résolution d'entités est une chaîne d'indexation, d'évaluation de similarité et de prise de décision (éventuellement avec supervision humaine) qui consolide des enregistrements hétérogènes en représentations d'entités cohérentes tout en gérant explicitement les compromis entre incertitude et erreur.