Autodiagnostic - Module 3
STT-1100 Introduction à la science des données
Cet autodiagnostic non noté vérifie les notions du module 3. Il produit une correction détaillée, un résultat global, un bilan par compétence et un plan de révision ciblé.
- Première tentative: sans documentation, sans exécuter le code et sans aide extérieure, afin d’obtenir un portrait honnête.
- Après le bilan: consultez les ressources proposées, refaites les exercices ciblés, puis reprenez le diagnostic.
- Usage: ce diagnostic n’est pas noté et ne sert ni à attribuer une note ni à décider de l’admission au cours.
- Confidentialité: aucune réponse n’est transmise à l’enseignant. La progression et l’historique sont conservés uniquement dans ce navigateur.
Les seuils sont des repères pédagogiques propres à STT-1100. Ils n’ont pas fait l’objet d’une validation psychométrique. Une réponse exacte peut aussi résulter du hasard; les exercices pratiques demeurent donc essentiels.
Question 1
Vrai ou faux: une variable catégorique contient des modalités ou des groupes, même si ces modalités sont stockées comme du texte dans R.
Vrai. Une variable catégorique peut être stockée comme character ou comme factor. Ce qui compte, c’est que ses valeurs représentent des catégories.
Question 2
Quelle fonction de stringr permet de détecter si une chaîne contient un motif?
str_detect()str_squish()str_replace()fct_lump()
Réponse: a. str_detect() retourne TRUE ou FALSE selon la présence du motif.
Question 3
Vrai ou faux: str_squish() retire les espaces au début et à la fin, puis réduit les espaces multiples à un seul espace.
Vrai. Cette fonction est utile pour harmoniser des champs textuels avant de créer des catégories.
Question 4
Quelle fonction permet d’extraire un code postal canadien d’une adresse quand on fournit une expression régulière adaptée?
str_extract()summarise()geom_bar()count()
Réponse: a. str_extract() extrait la partie d’une chaîne qui correspond au motif.
Question 5
Pourquoi convertir une colonne comme Amende en variable numérique avant de calculer une moyenne?
- Parce que les graphiques exigent toujours des facteurs
- Parce qu’une moyenne ne se calcule pas correctement sur une chaîne de caractères
- Parce que
ggplot2ne peut pas lire de texte - Parce qu’un commit GitHub est obligatoire
Réponse: b. Si les montants sont stockés comme texte, il faut d’abord créer une variable numérique reproductible.
Question 6
Quelle fonction de dplyr est la plus directe pour obtenir un tableau de fréquences?
count()mutate()pull()slice()
Réponse: a. count(variable) compte le nombre d’observations dans chaque modalité.
Question 7
Vrai ou faux: un diagramme à barres empilées standardisé avec position = "fill" montre des proportions plutôt que des nombres absolus.
Vrai. La hauteur totale de chaque barre vaut 1, ce qui permet de comparer la composition des groupes.
Question 8
Quel outil est utile pour regrouper des catégories rares dans une modalité “Autre”?
forcats::fct_lump()readxl::read_excel()base::mean()ggplot2::theme_void()
Réponse: a. fct_lump() regroupe des modalités peu fréquentes, ce qui peut rendre un tableau ou un graphique plus lisible.
Question 9
Vrai ou faux: un graphique de catégories devrait généralement être ordonné selon une variable utile plutôt que laissé dans un ordre alphabétique arbitraire.
Vrai. Un ordre par fréquence ou par valeur moyenne aide souvent le lecteur à comprendre le message du graphique.
Question 10
Dans le défi, pourquoi faut-il garder le jeu listecondamnation original intact?
- Pour que le nettoyage soit documenté dans le code et reproductible
- Parce que
UlavalSSDinterdit les graphiques - Parce que les catégories ne peuvent pas être modifiées
- Parce que GitHub ne conserve pas les fichiers HTML
Réponse: a. Le rapport doit pouvoir être rendu à nouveau après un redémarrage de R, avec les mêmes choix de nettoyage.
Question 11
Vrai ou faux: si un graphique utilise des proportions, le texte doit préciser qu’il ne montre pas les nombres absolus.
Vrai. Les proportions sont utiles, mais elles peuvent masquer la taille réelle des groupes.
Question 12
Quelle phrase correspond le mieux à un bon chiffre narratif dans un article de données?
- “La variable est intéressante.”
- “Le graphique est beau.”
- “Environ la moitié des constats du fichier sont associés à des codes postaux montréalais, selon le critère utilisé.”
- “Le code fonctionne.”
Réponse: c. Un chiffre narratif combine un résultat calculé, un contexte et une formulation compréhensible.