# Données de recherche du mémoire, gestion et diffusion des données de recherche ouvertes pour le domaine Economie et Services de la HES-SO

Ce dépôt rassemble les données produites et collectées dans le cadre d'un travail de master en Sciences de l'information, réalisé à la Haute école de gestion de Genève (HES-SO) et remis en août 2026.

Le mémoire porte sur la gestion et la diffusion des données de recherche ouvertes (Open Research Data) pour le domaine Economie et Services de la HES-SO. Il combine une revue de littérature, une enquête par questionnaire auprès des référent-es ORD des hautes écoles, des entretiens semi-directifs, une analyse comparative de vingt-quatre solutions de dépôt, et un proof of concept mené sur Zenodo.

## Formats

Les données tabulaires sont diffusées en CSV encodé en UTF-8, séparateur virgule, première ligne d'en-tête. La documentation est en Markdown. Les documents mis en page sont en PDF/A-1b. Les scripts sont en Python, en texte brut, réunis dans une archive ZIP. Ces formats ouverts sont ceux à privilégier pour la réutilisation et la conservation.

Le classeur de travail d'origine est néanmoins déposé lui aussi, au format XLSX. Il n'est pas nécessaire à la lecture des données, que les CSV suffisent à restituer, mais il conserve deux choses que la conversion ne peut pas porter, les formules de calcul du score pondéré et la structure en onglets. Les CSV en sont l'export fidèle. La comparaison cellule à cellule ne fait apparaître aucune divergence, hors les cellules de formule dont les CSV portent le résultat calculé.

La mise en forme conditionnelle par couleur du classeur est reprise en clair dans une colonne dédiée de chaque CSV, de sorte que rien n'est perdu à la conversion.

## Contenu du dépôt

### Analyse comparative des solutions

**00_grille_comparative_complete.xlsx**, Le classeur complet, quatre onglets, tel qu'il a servi à conduire l'analyse. Les scores pondérés de l'onglet de scoring sont des formules vivantes, ce qui permet de modifier un poids ou une note et d'observer l'effet sur le classement. Utile pour rejouer l'analyse de sensibilité présentée dans le mémoire.

Les quatre fichiers suivants sont l'export en format ouvert des quatre onglets de ce classeur, séparés pour rester lisibles.

**01_grille_comparative_ponderation.csv**, Les vingt critères retenus, leur catégorie, leur poids dans la moyenne pondérée, la justification empirique de ce poids et l'origine de cette justification. Sur les vingt critères, quatorze s'appuient sur une question du questionnaire, trois sur les entretiens ou sur le monitoring institutionnel, un sur l'analyse documentaire et deux sur des choix argumentés de l'autrice, signalés comme tels.

**02_grille_comparative_scoring.csv**, L'intégralité des notes attribuées à chaque solution pour chaque critère, sur une échelle de 1 à 5. Le critère A4 a été fusionné avec le critère A6 en cours d'analyse, son poids ayant été reporté sur ce dernier, ce qui explique un poids nul en colonne A4.

**03_grille_comparative_classement.csv**, Le classement complet des vingt-quatre solutions, avec le score pondéré global, ses quatre composantes et le statut d'accès au dépôt pour une haute école de la HES-SO.

**04_grille_comparative_justifications.csv**, Les éléments factuels et les sources qui fondent chaque note, avec le niveau de preuve de chacune. Les informations sur les plateformes décrivent leur état au 11 août 2026. Les conditions d'accès et les tarifs évoluent, le cas de Dryad en donne un exemple, et toute réutilisation de la grille suppose une revérification des sources citées.

SWISSUbase et le FORS Data Service, comptés comme deux entrées distinctes dans une version antérieure de la grille, ont été fusionnés en une seule. FORS n'est pas un dépôt mais un membre du consortium SWISSUbase et son unité de service pour les sciences sociales, aux côtés de LaRS pour la linguistique et de DaSCH pour les sciences humaines.

### Proof of concept

**05_suivi_evaluation_FAIR.csv**, Scores FAIR mesurés avec l'outil F-UJI pour chacun des quatorze jeux de données. Trois mesures par jeu, le dépôt d'origine, le re-dépôt dans le sandbox Zenodo, puis le dépôt après correction des métadonnées. Moyennes obtenues, 78,6 pour cent sur les dépôts d'origine, 77,2 pour cent après re-dépôt, 81,6 pour cent après correction.

**06_gabarit_documentation.csv**, Socle minimal de métadonnées appliqué aux quatorze jeux de données, quelle que soit la discipline ou la haute école d'origine. Pour chacun des sept éléments, le champ Zenodo ou DataCite correspondant, le contenu attendu, le statut obligatoire ou recommandé et un exemple.

**09_journal_corrections_FAIR.md**, Journal chronologique des tests F-UJI et des tentatives de correction menées sur les dépôts sandbox. Il documente les essais réussis comme les échecs, notamment les trois versions successives du script de correction et le problème d'incompatibilité entre l'ancien schéma Zenodo et le schéma InvenioRDM sur l'instance sandbox.

**13_scripts_proof_of_concept.zip**, Quinze scripts Python, répartis en trois familles. Création des communautés Zenodo et rattachement des dépôts. Dépôt des jeux de données par haute école, via l'interface de programmation REST de Zenodo. Diagnostic et correction des métadonnées, ajout des liens qualifiés et des mots-clés manquants. Les scripts lisent la clé d'accès depuis la variable d'environnement ZENODO_SANDBOX_TOKEN, aucune clé n'est incluse.

### Enquête par questionnaire

**07_reponses_questionnaire_anonymisees.csv**, Réponses individuelles, une ligne par répondant-e et une colonne par variable. Ce fichier permet de recalculer l'ensemble des moyennes, des fréquences et des pondérations présentées dans le mémoire.

Traitement d'anonymisation appliqué avant dépôt. Suppression des adresses IP, des coordonnées de géolocalisation, des horodatages, de la durée de passation et de l'identifiant technique de réponse. Remplacement du nom de la haute école par un code, de E01 à E13, aucune table de correspondance n'étant diffusée. Attribution d'un identifiant pseudonyme à chaque répondant-e, de R01 à R17.

Le nom de la haute école a été codé parce que chaque établissement ne compte qu'un-e référent-e ORD. Le conserver en clair aurait permis de réidentifier presque toutes les personnes, alors même que le fichier ne contient aucun nom.

Effectifs. Vingt-trois référent-es ont été sollicité-es et dix-sept ont répondu, soit un taux de participation de 74 %. Douze questionnaires ont été menés à leur terme. Une dix-huitième réponse enregistrée par la plateforme correspondait au test effectué avant diffusion, elle a été retirée du fichier. Les colonnes Progress et Finished sont conservées pour rendre la déperdition vérifiable.

**08_dictionnaire_variables.csv**, Dictionnaire des variables du fichier précédent. Pour chaque colonne, l'intitulé complet de la question et l'échelle de réponse lorsqu'elle s'applique.

**10_questionnaire_qualtrics.pdf**, Questionnaire de dix-huit questions diffusé via la plateforme Qualtrics, ouvert du 24 avril au 1er juin 2026.

**11_resultats_questionnaire.pdf**, Résultats agrégés, présentés sous forme de graphiques et de tableaux de synthèse.

### Entretiens

**12_comptes_rendus_entretiens_anonymises.pdf**, Comptes rendus de trois entretiens semi-directifs conduits entre le 15 avril et le 7 mai 2026, auprès de professionnel-les de l'information scientifique et de la gouvernance de la recherche. Les personnes interrogées sont désignées par leur fonction et leur service, sans mention nominative. Chaque compte rendu a été soumis à l'interlocutrice concernée pour validation.

## Conditions d'utilisation

L'ensemble est diffusé sous licence Creative Commons Attribution 4.0 International (CC BY 4.0), à l'exception des scripts, diffusés sous licence MIT.

Les données issues du questionnaire et des entretiens ont été collectées avec le consentement des personnes concernées, dans le cadre d'un travail académique. Elles sont diffusées sous forme agrégée ou anonymisée, conformément au principe selon lequel les résultats d'un traitement mené à des fins de recherche doivent être publiés sous une forme ne permettant pas d'identifier les personnes concernées.

## Contexte et limites

Les dépôts réalisés pour le proof of concept l'ont été sur l'instance de test de Zenodo. Les identifiants pérennes attribués par cette instance portent le préfixe 10.5072 et ne résolvent pas. Les dépôts ne sont pas conservés de manière durable. Les scores FAIR mesurés sur ces dépôts doivent être lus en tenant compte de cette limite, documentée dans le journal des corrections.

L'enquête porte sur les référent-es Open Research Data et non sur les chercheur-euses qui produisent les données. Les résultats restituent donc l'état d'un réseau de personnes chargées d'organiser le partage, non celui du domaine dans son ensemble.

Le périmètre du travail couvre le dépôt, le signalement et la diffusion des données. Il ne traite pas des pratiques de gestion des données en amont du dépôt, comme la planification ou le nettoyage.

## Citation

Pour citer ce dépôt, se référer aux métadonnées de l'enregistrement Zenodo.
