Définition
Tâche consistant à identifier, apparier et fusionner des enregistrements qui se réfèrent à la même entité du monde réel à travers un ou plusieurs jeux de données ou domaines, produisant des représentations consolidées tout en maîtrisant l'incertitude et l'erreur.

Principe

Principe
Combiner blocage/indexation, scoring de similarité pair-à-pair ou par groupe, et linkage supervisé ou probabiliste optionnel pour décider quels enregistrements représentent la même entité ; intégrer des seuils, des revues humaines et des retours pour gérer faux appariements et omissions.

Démonstration

Démonstration
Fusionner des fiches client provenant de plusieurs systèmes métiers en comparant similarités de nom, adresse et contacts, en regroupant les enregistrements au-dessus d'un seuil de similarité en une seule entité client tout en signalant les paires ambiguës pour revue manuelle.

Mauvaise application

Mauvaise application
Des fusions trop agressives qui confondent des individus distincts (faux positifs) ou des règles trop conservatrices qui laissent des doublons (faux négatifs) ; l'utilisation de mesures de similarité faibles ou biaisées peut nuire de façon disproportionnée aux groupes sous-représentés.

Conséquence

Conséquence
Une résolution d'entités efficace produit des jeux de données unifiés et des analyses plus claires, permettant des comptes dédupliqués, des profils consolidés et de meilleurs apports pour les modèles en aval ; les erreurs entraînent des agrégats trompeurs, des risques pour la vie privée et des erreurs opérationnelles.

Inversion

Inversion
S'appuyer uniquement sur des jointures par clé exacte ou des identifiants non normalisés qui échouent à identifier des enregistrements équivalents variant par orthographe, format ou champs manquants, laissant la fragmentation non traitée.

Limite

Limite
Couvre le linkage et la déduplication mais pas la vérification d'identité ou l'authentification ; les méthodes de résolution varient selon l'échelle des données, leur qualité et les contraintes de confidentialité et équilibrent souvent rappel et précision.

Tension sémantique

Tension sémantique
Tension avec la gestion d'identité : la résolution d'entités produit des enregistrements unitaires pour l'analyse mais n'établit pas une identité vérifiée à des fins juridiques ou de sécurité ; elle met en balance appariement probabiliste et nécessité d'identité prouvable.

Synthèse

Synthèse
La résolution d'entités est une chaîne d'indexation, d'évaluation de similarité et de prise de décision (éventuellement avec supervision humaine) qui consolide des enregistrements hétérogènes en représentations d'entités cohérentes tout en gérant explicitement les compromis entre incertitude et erreur.