Autodiagnostic - Module 7

STT-1100 Introduction à la science des données

Cet autodiagnostic non noté vérifie les notions du module 7. Il produit une correction détaillée, un résultat global, un bilan par compétence et un plan de révision ciblé.

NoteModalités
  • Première tentative: sans documentation, sans exécuter le code et sans aide extérieure, afin d’obtenir un portrait honnête.
  • Après le bilan: consultez les ressources proposées, refaites les exercices ciblés, puis reprenez le diagnostic.
  • Usage: ce diagnostic n’est pas noté et ne sert ni à attribuer une note ni à décider de l’admission au cours.
  • Confidentialité: aucune réponse n’est transmise à l’enseignant. La progression et l’historique sont conservés uniquement dans ce navigateur.

Les seuils sont des repères pédagogiques propres à STT-1100. Ils n’ont pas fait l’objet d’une validation psychométrique. Une réponse exacte peut aussi résulter du hasard; les exercices pratiques demeurent donc essentiels.

Question 1

Vrai ou faux: dans un graphique à barres, tronquer l’axe des valeurs peut amplifier visuellement les écarts.

Vrai. La longueur des barres encode la quantité. Si l’axe ne commence pas à zéro, les différences de longueur peuvent paraître plus grandes que les différences réelles.

Question 2

Quelle information devrait accompagner une proportion calculée sur un petit groupe?

  1. L’effectif utilisé pour calculer la proportion
  2. Une couleur plus vive
  3. Une carte plus détaillée
  4. Un titre plus alarmant

Réponse: a. L’effectif aide à juger si la proportion repose sur beaucoup ou très peu d’observations.

Question 3

Vrai ou faux: retirer les noms suffit toujours à rendre un fichier anonyme.

Faux. Des quasi-identifiants comme l’âge, le lieu, le programme ou une combinaison rare de variables peuvent encore permettre de reconnaître une personne.

Question 4

Quel champ est un identifiant direct?

  1. Un numéro de téléphone
  2. Une classe d’âge
  3. Un total par quartier
  4. Un mois agrégé

Réponse: a. Un numéro de téléphone peut identifier directement une personne.

Question 5

Vrai ou faux: un commentaire libre peut poser un risque de confidentialité même si aucun nom n’est demandé.

Vrai. Un commentaire libre peut contenir spontanément un nom, une situation personnelle, un employeur, une adresse ou un détail reconnaissable.

Question 6

Quelle action réduit le risque de ré-identification dans un petit sondage?

  1. Grouper les âges en classes
  2. Publier toutes les lignes individuelles
  3. Garder les commentaires libres tels quels
  4. Ajouter des coordonnées plus précises

Réponse: a. Regrouper une variable précise peut réduire le risque, même si cela ne suffit pas toujours à anonymiser complètement.

Question 7

Vrai ou faux: un graphique responsable doit toujours éviter toute conclusion.

Faux. Il peut proposer une conclusion descriptive prudente, mais il doit éviter les affirmations causales ou opérationnelles non appuyées.

Question 8

Dans une communication publique, pourquoi mentionner les limites d’un jeu de données?

  1. Pour éviter une interprétation trop forte
  2. Pour cacher les résultats
  3. Pour rendre le graphique moins lisible
  4. Pour remplacer l’analyse

Réponse: a. Les limites aident la personne lectrice à comprendre ce que les données permettent, ou ne permettent pas, de conclure.

Question 9

Vrai ou faux: les principes FAIR concernent notamment la facilité de trouver, d’accéder, d’interopérer et de réutiliser des données.

Vrai. FAIR signifie Findable, Accessible, Interoperable et Reusable.

Question 10

Quelle décision est la plus prudente pour une cellule contenant seulement deux personnes?

  1. La publier telle quelle pour plus de transparence
  2. La masquer ou la regrouper avec une catégorie plus large
  3. Ajouter les noms pour clarifier
  4. Produire une carte très précise

Réponse: b. Un très petit effectif peut rendre des personnes reconnaissables. Le regroupement ou le masquage réduit ce risque.

Question 11

Vrai ou faux: une palette de couleurs peut influencer l’interprétation d’un risque.

Vrai. Des couleurs très alarmantes peuvent exagérer la perception d’urgence si elles ne sont pas justifiées par le contexte.

Question 12

Quelle formulation est la plus responsable?

  1. “Le quartier A est dangereux.”
  2. “Dans ces données fictives, le quartier A a plus de signalements par 10 000 personnes, mais les données ne permettent pas d’expliquer les causes.”
  3. “Les habitants du quartier A causent le problème.”
  4. “Le graphique prouve qu’il faut agir immédiatement.”

Réponse: b. La formulation décrit le résultat, rappelle le contexte des données et évite une conclusion causale ou stigmatisante.

GPT STT-1100