Figer la source avant de comparer les lignes
Enregistrez le fichier reçu sans le modifier, avec sa date et sa provenance. Ajoutez un identifiant de ligne source avant de trier, filtrer ou normaliser la copie de travail. Créez un journal qui conserve chaque paire candidate, les éléments examinés, la décision, l'ID survivant, les champs repris, la personne qui relit et la date. Chaque ligne retirée obtient ainsi une destination.
La normalisation facilite la comparaison mais ne doit pas réécrire la source. Créez un email de comparaison sans espaces parasites et avec une casse cohérente, puis des champs de comparaison pour noms et médias sans les variations superficielles de ponctuation. Gardez orthographe, accents, email et notes d'origine à côté.
| Élément de revue | Champs nécessaires | Rôle |
|---|---|---|
| Source intacte | Nom du fichier, date de réception, propriétaire | Préserver les éléments d'origine |
| Copie de travail | ID ligne source, champs originaux, champs de comparaison | Trier sans perdre la provenance |
| File de candidats | Ligne A, ligne B, niveau d'indice, conflits | Séparer détection et décision |
| Journal de décisions | Décision, ID survivant, champs repris, relecteur, date | Expliquer chaque fusion ou séparation |
Trier les candidats selon la force des indices
Commencez par les adresses utilisables partagées, car elles révèlent un recouvrement direct. Comparez ensuite nom exact et média exact. Examinez enfin les signaux plus souples : orthographe proche, même nom de famille, ancien et nouveau média, identifiants sociaux ou notes similaires. Toute ressemblance sert à trouver un candidat, jamais à décider seule d'une fusion.
La documentation officielle d'OpenRefine montre la même limite : le clustering regroupe des valeurs qui pourraient représenter la même chose, sans effectuer de rapprochement sémantique. Son interface demande la validation des suggestions. Ce guide reprend ce principe de relecture humaine pour les identités ; il ne prescrit pas OpenRefine et ne prétend pas que ses algorithmes sont ceux de l'import cutePR.
| Indice | Ce qu'il établit | Action par défaut |
|---|---|---|
| Même email personnel utilisable | Fort recouvrement du moyen de contact | Comparer identité et conflits avant fusion |
| Même email générique de rédaction | Point de contact éditorial partagé | Envisager une fiche générique sans fusionner aveuglément les personnes |
| Même nom + même média | Identité probable | Relire fonction, sujets, provenance et campagnes |
| Même nom + médias différents | Mobilité ou homonymie possible | Chercher une preuve datée et garder les deux contextes |
| Nom ressemblant seulement | Variation orthographique possible | Laisser en attente sans second identifiant |
| Noms différents + notes proches | Ressemblance contextuelle faible | Garder séparé |
Décider ce qui survit avant de retirer une ligne
Pour une identité confirmée, choisissez l'ID survivant et tranchez chaque champ. Gardez la valeur actuelle vérifiée pour la fonction et le média, puis placez l'ancien média dans l'historique daté. Conservez toutes les provenances, références de campagne, réponses utiles, exclusions, envois et retombées. Si deux valeurs se contredisent sans preuve, gardez les deux dans la note et marquez le champ actuel comme inconnu.
Pour un rapprochement probable, conservez les deux fiches tant que l'identité reste incertaine. La baisse du nombre de lignes n'est pas le critère de réussite. Comptez plutôt les fusions confirmées, les identités distinctes confirmées, les contacts génériques, les candidats ouverts, les adresses invalides et les lignes sources entièrement rapprochées.
- Choisir l'identifiant stable survivant avant de déplacer le contexte.
- Résoudre un par un nom, média, fonction et adresse utilisable.
- Ajouter provenances et faits historiques au lieu de les remplacer.
- Conserver exclusions et préférences avec leur périmètre.
- Laisser les candidats non résolus séparés et datés.
Rapprocher une revue fictive de douze lignes
La source fictive Solstice commence avec 12 lignes. Deux lignes J-014 partagent un email personnel et représentent bien une seule personne. Deux lignes identiques avec l'adresse générique de Northline deviennent un contact éditorial générique. Deux lignes décrivent un changement de média vérifié et deviennent une personne dont l'historique conserve les deux contextes. Ces trois rapprochements réduisent la copie de travail de trois lignes.
Deux Alex Lee dans le même média n'ont pas d'email et couvrent des rubriques différentes : les deux fiches restent dans une paire candidate ouverte. Deux Sam Laurent dans des médias différents sont des homonymes vérifiés et restent séparés. Un contact avec email invalide demeure non joignable avec un avertissement, et une créatrice unique ne change pas. Le résultat compte 9 fiches : 7 résolues et 2 dans une paire ouverte. Les 12 lignes sources ont une destination.
| Groupe source | Lignes | Décision | Fiches de travail |
|---|---|---|---|
| J-014, email personnel exact | 2 | Une identité confirmée | 1 |
| Adresse générique Northline | 2 | Un contact éditorial générique | 1 |
| Changement de média vérifié | 2 | Une identité, deux contextes conservés | 1 |
| Alex Lee, même média | 2 | Rapprochement probable ouvert | 2 |
| Sam Laurent, médias différents | 2 | Homonymes confirmés | 2 |
| Contact avec email invalide | 1 | Garder avec avertissement | 1 |
| Créatrice unique | 1 | Garder sans changement | 1 |
| Total | 12 | 3 rapprochements confirmés | 9 |
Comprendre la limite de l'import cutePR actuel
L'import actuel ajoute un indice lorsqu'un même email normalisé apparaît plusieurs fois dans le fichier ou appartient déjà à un contact. À la validation, une adresse exacte existante, ou déjà reliée par une ligne acceptée plus tôt dans la session, rattache la ligne à ce contact. Une boîte générique pouvant être partagée, résolvez les identités contradictoires avant d'accepter l'import.
Un couple même nom, même média suit une autre voie. Sans liaison par email exact, le parcours actuel crée la fiche importée et un candidat de fusion ouvert pour relecture humaine. Il ne fusionne pas silencieusement les deux personnes. Gardez la source, corrigez ou rejetez les erreurs bloquantes, puis rapprochez créations, liaisons, lignes ignorées et candidats après la session. Ne supposez pas qu'une fusion dispose toujours d'un retour arrière universel.
Terminer avec les volumes et des contrôles ciblés
Rapprochez les lignes sources avec les fiches conservées, combinaisons confirmées, rejets et candidats ouverts. Ouvrez ensuite une fiche de chaque type de décision. Vérifiez que l'ID survivant porte toutes les provenances, notes utiles, exclusions délimitées, campagnes, envois et retombées. Contrôlez séparément les boîtes génériques et les changements de média, qui donnent facilement une fausse impression de certitude.
N'utilisez la copie rapprochée comme fichier actif qu'après avoir sauvegardé le journal de décisions. Gardez la source d'origine intacte. Dans cutePR, l'espace de bêta est privé et individuel, les contacts viennent de l'opérateur et le périmètre de migration est convenu avant traitement. Lorsque l'identité reste incertaine, la revue dans un tableur demeure la première étape adaptée.
- Chaque ligne source aboutit à une fiche gardée, combinée, rejetée ou ouverte.
- Chaque combinaison confirmée possède un ID survivant.
- Aucune provenance, exclusion, campagne, envoi ou retombée n'a disparu.
- Les boîtes génériques et changements de média ont une décision explicite.
- Les candidats ouverts restent séparés et visibles.