Ressources et références

Aide-mémoire du parcours

Question Réflexe
Veut-on expliquer, prédire ou décider? Écrire l’objectif avant de choisir le modèle.
La réponse est-elle continue ou binaire? Choisir une famille de modèles compatible.
Les données futures ressemblent-elles aux données observées? Définir la population cible et le mécanisme de collecte.
Une transformation utilise-t-elle la réponse ou tout le jeu? L’apprendre dans les données d’entraînement seulement.
Les observations sont-elles ordonnées dans le temps? Valider sur une période postérieure à l’entraînement.
Quelle erreur coûte le plus cher? Choisir les métriques et le seuil selon le contexte.
Le modèle est-il calibré? Comparer probabilités prédites et fréquences observées.
L’amélioration est-elle utile? Comparer performance, stabilité, complexité et interprétabilité.

Présentations à télécharger

Les versions PDF conservent la mise en page paysage des présentations et placent une diapositive par page. Elles peuvent être téléchargées avant la séance et annotées en classe.

  1. Jour 1: régression linéaire
  2. Jour 2: régression logistique
  3. Jour 3: apprentissage automatique

Cahiers QMD guidés

Chaque cahier reprend intégralement les trois missions de la journée, dans leur ordre d’animation. Les questions sont suivies de zones de réponse afin que les équipes puissent conserver leur code, leurs graphiques et leurs interprétations dans un même document.

  1. Jour 1: cahier QMD guidé ou trousse ZIP
  2. Jour 2: cahier QMD guidé ou trousse ZIP
  3. Jour 3: cahier QMD guidé ou trousse ZIP avec les données 311

Sources pédagogiques

Le parcours s’appuie sur la progression de l’apprentissage statistique décrite par James et ses collègues (G. James et al., 2021), ainsi que sur le cadre reproductible de tidymodels présenté par Kuhn et Silge (M. Kuhn et J. Silge, 2022). La forêt aléatoire est introduite dans le sens de Breiman (L. Breiman, 2001).

Pour l’évaluation des modèles binaires, la courbe ROC est présentée comme une mesure de discrimination sur l’ensemble des seuils (T. Fawcett, 2006). La calibration est traitée séparément, conformément à la hiérarchie proposée par Van Calster et ses collègues (B. Van Calster et al., 2019).

Lectures complémentaires du jour 1

Lecture Utilité
James et ses collègues, chapitre 3 Régression simple et multiple, inférence, variables qualitatives et extensions linéaires.
OpenIntro, chapitre 7 Paramètres, moindres carrés, tests, intervalles et prédicteurs catégoriels.
Kuhn et Silge, données Ames Provenance, exploration et préparation du jeu immobilier.
Kuhn et Silge, fondamentaux des modèles dans R Formules, objets ajustés, résidus et prédictions.
Kuhn et Silge, flux de modélisation Séparation entre préparation, ajustement et évaluation sur des données réservées.
Documentation officielle de lm() Arguments, formules, contrastes, valeurs manquantes et objet retourné.
De Cock, article original sur Ames Construction du jeu, variables et intention pédagogique.

Lectures complémentaires du jour 2

Lecture Utilité
James et ses collègues, chapitre 4 Classification, régression logistique, rapports de cotes et frontière de décision.
Documentation officielle de glm() Formule, famille binomiale, prédictions et objet ajusté.
Documentation de la famille binomiale Réponse binaire, lien logit et conventions de codage dans R.
Kuhn et Silge, séparation entraînement-test Budget de données, rôle du jeu test et reproductibilité du partage.
Fawcett, introduction aux courbes ROC Sensibilité, spécificité, courbe ROC et interprétation de l’aire.
Van Calster et ses collègues Pourquoi la calibration doit être examinée séparément de la discrimination.
Documentation CRAN de titanic Provenance, structure et variables du jeu titanic_train.

Lectures complémentaires du jour 3

Lecture Utilité
Breiman, Random Forests Construction et motivation originale des forêts aléatoires.
Kuhn et Silge, rééchantillonnage Rôle du test, analyses et évaluations répétées.
Documentation de sliding_period() Fenêtres temporelles et signification de lookback.
Documentation de decision_tree() Profondeur, taille minimale et pénalité de complexité.
Documentation de rand_forest() Nombre d’arbres, mtry et min_n.
Documentation de brier_class() Orientation de l’événement et interprétation du score de Brier.
Documentation de step_novel() Traitement des catégories futures jamais observées.
Documentation de step_unknown() Traitement explicite des catégories manquantes.
Documentation de step_other() Regroupement des catégories rares.
Données ouvertes 311 de Montréal Provenance, structure et limites de la source.

Sources de données

Les données du jour 1 décrivent 2 930 ventes résidentielles à Ames, en Iowa, et sont accessibles dans le paquet R AmesHousing (D. De Cock, 2011; M. Kuhn, 2020). Le jour 2 utilise l’échantillon individuel titanic_train du paquet titanic (P. Hendricks, 2015). Les demandes de services citoyennes utilisées au jour 3 proviennent du système 311 de la Ville de Montréal (Ville de Montréal, 2026).

Références

L. Breiman. (2001). Random Forests. Machine Learning. https://doi.org/10.1023/A:1010933404324.
D. De Cock. (2011). Ames, Iowa: Alternative to the Boston Housing Data as an End of Semester Regression Project. Journal of Statistics Education. https://doi.org/10.1080/10691898.2011.11889627.
T. Fawcett. (2006). An Introduction to ROC Analysis. Pattern Recognition Letters. https://doi.org/10.1016/j.patrec.2005.10.010.
P. Hendricks. (2015). titanic: Titanic Passenger Survival Data Set. https://CRAN.R-project.org/package=titanic.
G. James, D. Witten, T. Hastie, et R. Tibshirani. (2021). An Introduction to Statistical Learning: With Applications in R. https://www.statlearning.com/.
M. Kuhn. (2020). AmesHousing: The Ames Iowa Housing Data. https://CRAN.R-project.org/package=AmesHousing.
M. Kuhn et J. Silge. (2022). Tidy Modeling with R. https://www.tmwr.org/.
B. Van Calster, D. J. McLernon, M. van Smeden, L. Wynants, et E. W. Steyerberg. (2019). Calibration: The Achilles Heel of Predictive Analytics. BMC Medicine. https://doi.org/10.1186/s12916-019-1466-7.
Ville de Montréal. (2026). Demandes de services citoyennes (Requêtes 311). https://www.donneesquebec.ca/recherche/dataset/vmtl-requete-311.