Données de recherche

By
GT Vallet

Organisation des données

Le laboratoire recommande d'utiliser un fichier Excel qui contienne plusieurs feuilles.

Une de ces feuilles correspond aux données brutes. Il s'agit d'un tableau dont la 1re colonne correspond aux identifiants (code participant) et la 1re ligne aux noms des variables. Cette feuille ne doit pas contenir de sous-tableau, de saut de ligne, de calcul par ligne ou par colonne qui ne correspondent pas à des variables.

Une seconde feuille devrait contenir un dictionnaire des données, parfois appelé CodeBook. Il s'agit de documenté à quoi correspond le nom de varialbe utilisée, les valeurs possibles, et le format à respecter. Par exemple, pour indiquer le sexe biologique, nous pourrions utiliser M/F ou H/F ou 0/1 ou male/female ou Homme/Femme ou homme/femme... Il suffit qu'une des données soit enregistrée différement des autres (homme vs Homme) pour que les logiciels d'analyse considère qu'il y a trois catégories (homme, Homme, femme) au lieux de deux (homme vs femme).

Voici une ressource sur les dictionnaires de données : https://datamanagement.hms.harvard.edu/collect-analyze/documentation-metadata/data-dictionary

Nomenclature des variables

Le nom des variables dans le fichier de données n'est pas anodin. Il est essentiel que ces noms soient signifiants, spécifiques et faciles à utiliser dans la analyses subséquentes.

Pour ce faire, le laboratoire utilse le snake_case qui consiste à remplacer les espaces par des tirets du bas. De même, on priviligie des noms anglophones afin de (1) rendre universel l'accès à ces données lors d'un possible partage à la communité scientifique et (2) éviter les accents et aux symboles orthographiques qui sont parfois mal reconnus par les systèmes informatiques.

Voici un guide sur le nomenclature des variables pour R, qui peut être transposer à toutes les variable : https://www.varsitytutors.com/practice/subjects/r-programming/lessons/naming-and-formatting

Modèle pour le laboratoire