Ressources et références
Aide-mémoire du parcours
| Question | Réflexe |
|---|---|
| Veut-on expliquer, prédire ou décider? | Écrire l’objectif avant de choisir le modèle. |
| La réponse est-elle continue ou binaire? | Choisir une famille de modèles compatible. |
| Les données futures ressemblent-elles aux données observées? | Définir la population cible et le mécanisme de collecte. |
| Une transformation utilise-t-elle la réponse ou tout le jeu? | L’apprendre dans les données d’entraînement seulement. |
| Les observations sont-elles ordonnées dans le temps? | Valider sur une période postérieure à l’entraînement. |
| Quelle erreur coûte le plus cher? | Choisir les métriques et le seuil selon le contexte. |
| Le modèle est-il calibré? | Comparer probabilités prédites et fréquences observées. |
| L’amélioration est-elle utile? | Comparer performance, stabilité, complexité et interprétabilité. |
Présentations à télécharger
Les versions PDF conservent la mise en page paysage des présentations et placent une diapositive par page. Elles peuvent être téléchargées avant la séance et annotées en classe.
Cahiers QMD guidés
Chaque cahier reprend intégralement les trois missions de la journée, dans leur ordre d’animation. Les questions sont suivies de zones de réponse afin que les équipes puissent conserver leur code, leurs graphiques et leurs interprétations dans un même document.
Sources pédagogiques
Le parcours s’appuie sur la progression de l’apprentissage statistique décrite par James et ses collègues (G. James et al., 2021), ainsi que sur le cadre reproductible de tidymodels présenté par Kuhn et Silge (M. Kuhn et J. Silge, 2022). La forêt aléatoire est introduite dans le sens de Breiman (L. Breiman, 2001).
Pour l’évaluation des modèles binaires, la courbe ROC est présentée comme une mesure de discrimination sur l’ensemble des seuils (T. Fawcett, 2006). La calibration est traitée séparément, conformément à la hiérarchie proposée par Van Calster et ses collègues (B. Van Calster et al., 2019).
Lectures complémentaires du jour 1
| Lecture | Utilité |
|---|---|
| James et ses collègues, chapitre 3 | Régression simple et multiple, inférence, variables qualitatives et extensions linéaires. |
| OpenIntro, chapitre 7 | Paramètres, moindres carrés, tests, intervalles et prédicteurs catégoriels. |
| Kuhn et Silge, données Ames | Provenance, exploration et préparation du jeu immobilier. |
| Kuhn et Silge, fondamentaux des modèles dans R | Formules, objets ajustés, résidus et prédictions. |
| Kuhn et Silge, flux de modélisation | Séparation entre préparation, ajustement et évaluation sur des données réservées. |
Documentation officielle de lm() |
Arguments, formules, contrastes, valeurs manquantes et objet retourné. |
| De Cock, article original sur Ames | Construction du jeu, variables et intention pédagogique. |
Lectures complémentaires du jour 2
| Lecture | Utilité |
|---|---|
| James et ses collègues, chapitre 4 | Classification, régression logistique, rapports de cotes et frontière de décision. |
Documentation officielle de glm() |
Formule, famille binomiale, prédictions et objet ajusté. |
| Documentation de la famille binomiale | Réponse binaire, lien logit et conventions de codage dans R. |
| Kuhn et Silge, séparation entraînement-test | Budget de données, rôle du jeu test et reproductibilité du partage. |
| Fawcett, introduction aux courbes ROC | Sensibilité, spécificité, courbe ROC et interprétation de l’aire. |
| Van Calster et ses collègues | Pourquoi la calibration doit être examinée séparément de la discrimination. |
Documentation CRAN de titanic |
Provenance, structure et variables du jeu titanic_train. |
Lectures complémentaires du jour 3
| Lecture | Utilité |
|---|---|
| Breiman, Random Forests | Construction et motivation originale des forêts aléatoires. |
| Kuhn et Silge, rééchantillonnage | Rôle du test, analyses et évaluations répétées. |
Documentation de sliding_period() |
Fenêtres temporelles et signification de lookback. |
Documentation de decision_tree() |
Profondeur, taille minimale et pénalité de complexité. |
Documentation de rand_forest() |
Nombre d’arbres, mtry et min_n. |
Documentation de brier_class() |
Orientation de l’événement et interprétation du score de Brier. |
Documentation de step_novel() |
Traitement des catégories futures jamais observées. |
Documentation de step_unknown() |
Traitement explicite des catégories manquantes. |
Documentation de step_other() |
Regroupement des catégories rares. |
| Données ouvertes 311 de Montréal | Provenance, structure et limites de la source. |
Sources de données
Les données du jour 1 décrivent 2 930 ventes résidentielles à Ames, en Iowa, et sont accessibles dans le paquet R AmesHousing (D. De Cock, 2011; M. Kuhn, 2020). Le jour 2 utilise l’échantillon individuel titanic_train du paquet titanic (P. Hendricks, 2015). Les demandes de services citoyennes utilisées au jour 3 proviennent du système 311 de la Ville de Montréal (Ville de Montréal, 2026).