cutePR

Revue des doublons du fichier presse

Dédoublonnez votre fichier presse en préservant son contexte.

Ne commencez pas le nettoyage par Supprimer les doublons. Créez d'abord une copie source intacte, une copie de travail et un journal de décisions. L'objectif consiste à retrouver une relation unique sans jeter les conflits, l'historique des campagnes, les exclusions ou l'ancien média qui explique la fiche.

Un email identique et une identité probable appartiennent à deux files de revue. Même une adresse partagée prouve seulement que deux lignes utilisent la même adresse ; elle ne prouve pas toujours que deux personnes nommées n'en forment qu'une. Une ressemblance de nom est plus faible encore. Les décisions possibles sont fusionner, garder séparé, créer un contact générique de rédaction ou laisser en attente.

Par cutePR · Publié le

Télécharger le modèle Excel

Gratuit, sans inscription. Choisissez le fichier vierge ou l'exemple fictif. Consultez la notice du classeur avant de l'adapter à vos données.

Modèle de fichier contacts presse (vierge) · XLSX (21 KB)Modèle de fichier contacts presse (exemple fictif) · XLSX (24 KB)

Figer la source avant de comparer les lignes

Enregistrez le fichier reçu sans le modifier, avec sa date et sa provenance. Ajoutez un identifiant de ligne source avant de trier, filtrer ou normaliser la copie de travail. Créez un journal qui conserve chaque paire candidate, les éléments examinés, la décision, l'ID survivant, les champs repris, la personne qui relit et la date. Chaque ligne retirée obtient ainsi une destination.

La normalisation facilite la comparaison mais ne doit pas réécrire la source. Créez un email de comparaison sans espaces parasites et avec une casse cohérente, puis des champs de comparaison pour noms et médias sans les variations superficielles de ponctuation. Gardez orthographe, accents, email et notes d'origine à côté.

Élément de revueChamps nécessairesRôle
Source intacteNom du fichier, date de réception, propriétairePréserver les éléments d'origine
Copie de travailID ligne source, champs originaux, champs de comparaisonTrier sans perdre la provenance
File de candidatsLigne A, ligne B, niveau d'indice, conflitsSéparer détection et décision
Journal de décisionsDécision, ID survivant, champs repris, relecteur, dateExpliquer chaque fusion ou séparation

Trier les candidats selon la force des indices

Commencez par les adresses utilisables partagées, car elles révèlent un recouvrement direct. Comparez ensuite nom exact et média exact. Examinez enfin les signaux plus souples : orthographe proche, même nom de famille, ancien et nouveau média, identifiants sociaux ou notes similaires. Toute ressemblance sert à trouver un candidat, jamais à décider seule d'une fusion.

La documentation officielle d'OpenRefine montre la même limite : le clustering regroupe des valeurs qui pourraient représenter la même chose, sans effectuer de rapprochement sémantique. Son interface demande la validation des suggestions. Ce guide reprend ce principe de relecture humaine pour les identités ; il ne prescrit pas OpenRefine et ne prétend pas que ses algorithmes sont ceux de l'import cutePR.

IndiceCe qu'il établitAction par défaut
Même email personnel utilisableFort recouvrement du moyen de contactComparer identité et conflits avant fusion
Même email générique de rédactionPoint de contact éditorial partagéEnvisager une fiche générique sans fusionner aveuglément les personnes
Même nom + même médiaIdentité probableRelire fonction, sujets, provenance et campagnes
Même nom + médias différentsMobilité ou homonymie possibleChercher une preuve datée et garder les deux contextes
Nom ressemblant seulementVariation orthographique possibleLaisser en attente sans second identifiant
Noms différents + notes prochesRessemblance contextuelle faibleGarder séparé

Décider ce qui survit avant de retirer une ligne

Pour une identité confirmée, choisissez l'ID survivant et tranchez chaque champ. Gardez la valeur actuelle vérifiée pour la fonction et le média, puis placez l'ancien média dans l'historique daté. Conservez toutes les provenances, références de campagne, réponses utiles, exclusions, envois et retombées. Si deux valeurs se contredisent sans preuve, gardez les deux dans la note et marquez le champ actuel comme inconnu.

Pour un rapprochement probable, conservez les deux fiches tant que l'identité reste incertaine. La baisse du nombre de lignes n'est pas le critère de réussite. Comptez plutôt les fusions confirmées, les identités distinctes confirmées, les contacts génériques, les candidats ouverts, les adresses invalides et les lignes sources entièrement rapprochées.

  • Choisir l'identifiant stable survivant avant de déplacer le contexte.
  • Résoudre un par un nom, média, fonction et adresse utilisable.
  • Ajouter provenances et faits historiques au lieu de les remplacer.
  • Conserver exclusions et préférences avec leur périmètre.
  • Laisser les candidats non résolus séparés et datés.

Rapprocher une revue fictive de douze lignes

La source fictive Solstice commence avec 12 lignes. Deux lignes J-014 partagent un email personnel et représentent bien une seule personne. Deux lignes identiques avec l'adresse générique de Northline deviennent un contact éditorial générique. Deux lignes décrivent un changement de média vérifié et deviennent une personne dont l'historique conserve les deux contextes. Ces trois rapprochements réduisent la copie de travail de trois lignes.

Deux Alex Lee dans le même média n'ont pas d'email et couvrent des rubriques différentes : les deux fiches restent dans une paire candidate ouverte. Deux Sam Laurent dans des médias différents sont des homonymes vérifiés et restent séparés. Un contact avec email invalide demeure non joignable avec un avertissement, et une créatrice unique ne change pas. Le résultat compte 9 fiches : 7 résolues et 2 dans une paire ouverte. Les 12 lignes sources ont une destination.

Les fiches sont fictives. Les nombres illustrent le rapprochement, pas un taux habituel de doublons.
Groupe sourceLignesDécisionFiches de travail
J-014, email personnel exact2Une identité confirmée1
Adresse générique Northline2Un contact éditorial générique1
Changement de média vérifié2Une identité, deux contextes conservés1
Alex Lee, même média2Rapprochement probable ouvert2
Sam Laurent, médias différents2Homonymes confirmés2
Contact avec email invalide1Garder avec avertissement1
Créatrice unique1Garder sans changement1
Total123 rapprochements confirmés9

Comprendre la limite de l'import cutePR actuel

L'import actuel ajoute un indice lorsqu'un même email normalisé apparaît plusieurs fois dans le fichier ou appartient déjà à un contact. À la validation, une adresse exacte existante, ou déjà reliée par une ligne acceptée plus tôt dans la session, rattache la ligne à ce contact. Une boîte générique pouvant être partagée, résolvez les identités contradictoires avant d'accepter l'import.

Un couple même nom, même média suit une autre voie. Sans liaison par email exact, le parcours actuel crée la fiche importée et un candidat de fusion ouvert pour relecture humaine. Il ne fusionne pas silencieusement les deux personnes. Gardez la source, corrigez ou rejetez les erreurs bloquantes, puis rapprochez créations, liaisons, lignes ignorées et candidats après la session. Ne supposez pas qu'une fusion dispose toujours d'un retour arrière universel.

Terminer avec les volumes et des contrôles ciblés

Rapprochez les lignes sources avec les fiches conservées, combinaisons confirmées, rejets et candidats ouverts. Ouvrez ensuite une fiche de chaque type de décision. Vérifiez que l'ID survivant porte toutes les provenances, notes utiles, exclusions délimitées, campagnes, envois et retombées. Contrôlez séparément les boîtes génériques et les changements de média, qui donnent facilement une fausse impression de certitude.

N'utilisez la copie rapprochée comme fichier actif qu'après avoir sauvegardé le journal de décisions. Gardez la source d'origine intacte. Dans cutePR, l'espace de bêta est privé et individuel, les contacts viennent de l'opérateur et le périmètre de migration est convenu avant traitement. Lorsque l'identité reste incertaine, la revue dans un tableur demeure la première étape adaptée.

  • Chaque ligne source aboutit à une fiche gardée, combinée, rejetée ou ouverte.
  • Chaque combinaison confirmée possède un ID survivant.
  • Aucune provenance, exclusion, campagne, envoi ou retombée n'a disparu.
  • Les boîtes génériques et changements de média ont une décision explicite.
  • Les candidats ouverts restent séparés et visibles.

Sources et méthode

Passer de vos fichiers à un espace RP ?

Le fondateur vous accompagne et prend en charge la migration initiale convenue. Vos retours contribuent à la suite du produit.

Demander un accès

Tarif préférentiel pendant la bêta, puis tarif standard annoncé à l'avance.