Mini-projet - Défavorisation des écoles

En classe, cette activité sert à…

Cette activité sert à travailler les notions suivantes : régression linéaire, prédiction, résidus, validation entraînement-test, biais algorithmiques, éthique à partir d’une question située dans le contexte suivant : Éducation et équité. Elle demande aux étudiantes et étudiants de répondre à la question directrice suivante : Comment construire un modèle descriptif de l’IMSE sans transformer un indicateur éducatif sensible en outil de décision non justifié?

Élément Information
Durée 2-3 heures
Niveau Introduction à intermédiaire
Usage recommandé Mini-projet guidé
Préparation enseignant Préparation requise : exécuter Rscript datasets/defavorisation-ecoles-primaires/preparation.R depuis la racine, puis vérifier que data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv existe.
Production attendue Un court rapport reproductible avec contexte, tableau ou graphique, interprétation et limites.
Données data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv

Objectifs d’apprentissage

  • Travailler régression linéaire.
  • Travailler prédiction.
  • Travailler résidus.
  • Travailler validation entraînement-test.
  • Nommer au moins une limite d’interprétation.

Données utilisées

Source : Données Québec / Ministère de l’Éducation et Ministère de l’Enseignement supérieur. Licence : Attribution (CC-BY 4.0) selon les métadonnées CKAN vérifiées le 2026-06-20. Fichier principal pour l’activité : data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv

Préparation enseignante

  • Préparation requise : exécuter Rscript datasets/defavorisation-ecoles-primaires/preparation.R depuis la racine, puis vérifier que data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv existe.
  • Fichier préparé : data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv.
  • Script de préparation : datasets/defavorisation-ecoles-primaires/preparation.R.
  • Point à surveiller : Demander une interprétation en langage simple des coefficients, une mesure d’erreur et une distinction claire entre prédiction statistique et indice officiel.

Consignes

  1. Importer defavorisation_ecoles_primaires.csv ou exécuter datasets/defavorisation-ecoles-primaires/preparation.R si le fichier est absent.
  2. Identifier ce que représente une ligne du fichier.
  3. Produire un tableau ou un graphique adapté à la question directrice.
  4. Rédiger une interprétation courte qui distingue description et explication.
  5. Nommer au moins une limite méthodologique ou une information absente.

Appui R minimal

library(dplyr)
library(readr)

if (!file.exists("data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv")) {
  source("datasets/defavorisation-ecoles-primaires/preparation.R")
}

donnees <- read_csv(
  "data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv",
  show_col_types = FALSE
)

glimpse(donnees)

Résultat attendu

Un court rapport reproductible avec contexte, tableau ou graphique, interprétation et limites. La production doit aussi contenir une phrase sur l’unité statistique et une phrase sur une limite de la source.

Questions

  1. Quelle est l’unité statistique utilisée dans cette activité?
  2. Quelle transformation ou agrégation est nécessaire avant de répondre à la question?
  3. Quelle information manque pour aller plus loin?
  4. Quelle conclusion serait trop forte avec ces seules données?
  5. Comment formuler une conclusion prudente à partir du résultat obtenu?

Déroulé suggéré

  1. Cadrer la source, la licence et l’unité statistique.
  2. Préparer ou importer les données.
  3. Produire un premier résumé descriptif.
  4. Construire la visualisation ou le tableau principal.
  5. Rédiger l’interprétation et les limites.

Limites à faire nommer

  • Demander une interprétation en langage simple des coefficients, une mesure d’erreur et une distinction claire entre prédiction statistique et indice officiel.
  • Si une variable ou un dénominateur nécessaire n’est pas disponible dans les données, l’écrire explicitement plutôt que l’inférer.

Contexte

Ce mini-projet reprend la logique de l’aventure 9 : construire un modèle prédictif simple, évaluer ses erreurs, puis discuter ses limites et les risques de biais.

Question directrice

Comment construire un modèle descriptif de l’IMSE sans transformer un indicateur éducatif sensible en outil de décision non justifié?

Livrables

  1. Un fichier Quarto reproductible.
  2. Une exploration descriptive des variables clés.
  3. Un modèle linéaire pour prédire IMSE à partir de SFR et Nbre_Eleves.
  4. Une validation simple par séparation entraînement-test.
  5. Un graphique des résidus.
  6. Une section sur les lignes où Diffusion vaut NON.
  7. Une discussion sur les limites statistiques et éthiques.

Critères d’évaluation suggérés

  • Reproductibilité du code.
  • Interprétation correcte des coefficients.
  • Qualité de la visualisation.
  • Évaluation explicite des erreurs de prédiction.
  • Prudence dans les prédictions pour les écoles non diffusées.
  • Discussion claire des biais potentiels.

Contraintes d’interprétation

Le rapport doit contenir une phrase qui refuse explicitement l’interprétation causale du modèle. Il doit aussi distinguer un résultat descriptif, une prédiction statistique et un indice officiel publié.

Fiche de mise en œuvre

Contrat pédagogique

Le statut pédagogique décrit le degré de préparation de l’activité. Il ne remplace pas la vérification de la source de données.

Objectifs d'apprentissage
  • Travailler régression linéaire.
  • Travailler prédiction.
  • Travailler résidus.
  • Travailler validation entraînement-test.
  • Nommer au moins une limite d'interprétation.
  • Préparation requise : exécuter Rscript datasets/defavorisation-ecoles-primaires/preparation.R depuis la racine, puis vérifier que data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv existe.
  • Fichier préparé : data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv.
  • Script de préparation : datasets/defavorisation-ecoles-primaires/preparation.R.
  • Point à surveiller : Demander une interprétation en langage simple des coefficients, une mesure d'erreur et une distinction claire entre prédiction statistique et indice officiel.
  • Demander une interprétation en langage simple des coefficients, une mesure d'erreur et une distinction claire entre prédiction statistique et indice officiel.
  • Si une variable ou un dénominateur nécessaire n'est pas disponible dans les données, l'écrire explicitement plutôt que l'inférer.
  • Reproductibilité du code.
  • Interprétation correcte des coefficients.
  • Qualité de la visualisation.
  • Évaluation explicite des erreurs de prédiction.
  • Prudence dans les prédictions pour les écoles non diffusées.
  • Discussion claire des biais potentiels.
Prérequis
  • Vérifier le fichier ou le script de préparation annoncé avant la séance; adapter la mise en route au niveau indiqué.
Préparation enseignante
  • Préparation requise : exécuter Rscript datasets/defavorisation-ecoles-primaires/preparation.R depuis la racine, puis vérifier que data/processed/defavorisation-ecoles-primaires/defavorisation_ecoles_primaires.csv existe.
Production attendue
  • Un court rapport reproductible avec contexte, tableau ou graphique, interprétation et limites.
Critères de réussite
  • La production attendue est remise : Un court rapport reproductible avec contexte, tableau ou graphique, interprétation et limites.
  • Les résultats sont interprétés sans dépasser les limites de la source.
Adaptations possibles
  • Fournir une table préparée ou réduire le nombre de variables pour une première utilisation.
  • Ajouter une comparaison, une justification méthodologique ou une discussion des limites pour approfondir.

Statut pédagogique : Prête à enseigner