Bonnes pratiques
Bien s'en servir
Bibliominer est délibérément plus lent qu'un script qui nettoie tout d'un coup. La raison est simple : un corpus dont on ne peut pas rendre compte est un corpus qu'on ne peut pas défendre. Voici ce que l'outil s'impose, et ce qu'il attend de vous.
Les deux guides
Chaque écran, chaque règle et chaque chiffre expliqués, avec des captures.
Guide du nettoyage
Un vrai corpus de 128 articles, étape par étape : le problème tel qu'il est dans le fichier importé, ce que Bibliominer fait seul (Crossref, OpenAlex, SCImago, GeoNames, ROR), ce que vous décidez, et le résultat.
Télécharger le PDFGuide de l'analyse
Chaque écran et chaque graphique de l'analyse, avec la formule exacte derrière chaque valeur et la façon de la lire.
Télécharger le PDFLe paquet d'analyse
Tout le calcul vit dans les paquets. Les applications web ne font que charger un corpus, appliquer un filtre et les appeler, un indicateur écrit dans une API serait invisible à tous ceux qui utilisent la bibliothèque, donc aucun ne l'est. Tout ce que les applications savent faire, vos scripts le savent aussi.
bibliominer-analysis
Bibliometric analysis of a cleaned Scopus corpus: indicators, co-authorship and co-citation networks, figures.
pip install bibliominer-analysisversion 0.1.0 · Python >=3.9 · pas encore publié
Analyser depuis un script
Corpus est le point d'entrée unique. Il lit le CSV nettoyé en six tables liées, et tous les indicateurs s'en déduisent.
from bibliominer_analysis import Corpus
corpus = Corpus.from_csv("corpus_cleaned.csv")
print(corpus.documents) # the corpus, as tablesLe paquet est rangé par préoccupation : io/ lit le CSV en six tables liées par eid, metrics/ porte les indicateurs, un module par famille, networks/ construit et mesure les réseaux, et model/ expose Corpus.
Le nettoyage reste une interface
Le nettoyage se fait dans l'application web, pas avec pip : chaque étape demande votre décision, et c'est l'interface qui les recueille et les garde. Seule l'analyse est distribuée comme paquet.
Les cinq principes
Rien n'est décidé à votre place
Chaque suggestion montre sur quoi elle s'appuie, et vous l'acceptez ou la refusez. Une fusion automatique confondrait deux établissements qui partagent seulement un nom, et l'erreur serait indétectable dans le corpus final.
Rien ne disparaît en silence
Les documents retirés sont écrits dans un fichier, avec leur raison. Un corpus dont on ne peut pas rendre compte est un corpus qu'on ne peut pas défendre.
Le fichier EST la sauvegarde
Téléchargez le corpus à tout moment et réimportez-le plus tard pour reprendre où vous en étiez. Votre travail ne dépend jamais d'une session restée ouverte.
Vos clés, votre quota
GeoNames, OpenAlex et Semantic Scholar sont appelés avec vos propres identifiants. Ils restent privés, et aucune étape ne tourne sur le compte de quelqu'un d'autre.
Chaque chiffre est traçable
L'export final est accompagné d'un rapport de nettoyage : d'où part le corpus, ce qui a été retiré et pourquoi, ce qui a été récupéré et avec quel outil. C'est la section Méthodes de votre article.
Ce que l'outil refuse
Certaines étapes ne vous laissent pas continuer. Ce ne sont pas des obstacles gratuits, chacune bloque un corpus qui produirait des figures auxquelles personne ne pourrait se fier.
Métadonnées incomplètes
L'année, les citations, le type de document et la langue doivent être remplis avant Sources. Une année manquante retire le document de toutes les séries temporelles sans le dire.
Auteurs sans affiliation
Vous complétez l'article ou vous le retirez explicitement, et le retrait est journalisé. Un article sans auteur fausse toute analyse de collaboration et de productivité.
Fusionner sur une ville inachevée
Les noms d'organisme se fusionnent d'après la fréquence de chaque graphie. Ces comptes ne sont pas définitifs tant que toutes les affiliations de la ville ne sont pas résolues : la fusion attend.
Exporter avant la réconciliation
Le fichier final remplace la colonne References par la liste réconciliée. Bâti trop tôt, il emporterait le texte Scopus brut, qu'aucune analyse de co-citation ne sait lire.
Avant de publier vos chiffres
Quatre choses à vérifier, dans l'ordre de fréquence des problèmes.
Lire les retraits
removed_articles.csv liste chaque document sorti du corpus, avec sa raison. Si un compte vous surprend plus tard, c'est le premier fichier à ouvrir.
Revoir les fusions confirmées
Chaque fusion a réécrit un nom d'organisme dans tout le corpus. La liste des fusions confirmées reste consultable, et chacune peut être annulée, les noms d'origine reviennent.
Regarder ce qui s'est résolu tout seul
Corriger un article en rend souvent d'autres cohérents par ricochet. Ceux-là portent la mention « résolu par une autre correction », personne ne les a relus. Ouvrez-en quelques-uns.
Garder le rapport de nettoyage
Il dit d'où part le corpus, ce qui a été retiré et pourquoi, ce qui a été récupéré et avec quel outil. C'est lui qui rend la manipulation reproductible.
Clés d'API
Trois services sont appelés pendant le nettoyage, chacun avec vos propres identifiants : GeoNames pour les villes et les pays, OpenAlex pour la récupération des DOI et la réconciliation des références, et Semantic Scholar, facultatif, il double à peu près la durée pour un gain marginal.
Ils sont gratuits à obtenir et restent privés. Sans eux, les étapes de rapprochement restent verrouillées plutôt que de tourner sur le quota de quelqu’un d’autre. Vous pouvez enregistrer plusieurs clés par service : quand l’une atteint sa limite quotidienne, le traitement bascule sur la suivante au lieu de s’arrêter.
Travailler sur le code
Un seul environnement Python sert tout le projet, à la racine du dépôt. Il est là plutôt que dans l'une des briques précisément parce qu'il n'appartient à aucune : l'API et les paquets en dépendent tout autant.
.\setup.ps1 # build the environment, install everything
.\setup.ps1 -Force # rebuild from scratch
.\run.ps1 test # run the package testsLes paquets sont installés en mode éditable : ils pointent vers leurs sources, donc une modification est prise en compte sans réinstallation. Une copie figée dans site-packages s'importerait tout aussi bien, et l'on testerait une version qu'on ne modifie plus.