Jour 1: comprendre une relation
Régression linéaire multiple et diagnostics
Question directrice
Comment le prix de vente d’une propriété varie-t-il avec sa surface, sa qualité, son année de construction et son garage, et jusqu’où peut-on interpréter ou utiliser le modèle?
Objectifs
À la fin de la matinée, vous pourrez:
- définir une réponse continue et des prédicteurs pertinents;
- ajuster une régression linéaire multiple en R;
- interpréter un coefficient conditionnel et un intervalle;
- diagnostiquer forme fonctionnelle, variance, résidus et influence;
- distinguer association, prédiction et causalité;
- formuler une conclusion proportionnée aux données.
Matériel
Présentation centraleLe fil complet de la matinée: théorie, questions, missions et débriefs. PDF annotableLes 40 diapositives en format paysage, une page par écran. Tutoriel completCode exécutable, résultats et interprétations. MissionsTrois enquêtes en équipe, intégrées au fil de la présentation. Cahier QMD guidéLes trois missions, toutes les questions et des zones de réponse dans un seul fichier.
La trousse complète du jour 1 contient le cahier QMD et un court mode d’emploi.
Déroulement
La matinée alterne trois cycles:
- théorie et participation collective;
- mission guidée en équipe;
- débrief et mise en commun.
La présentation reste le fil principal de 8 h 45 à 12 h 15. Le tutoriel sert de référence détaillée et les missions s’ouvrent lorsque leur diapositive de transition apparaît.
Production de la matinée
Une fiche modèle de cinq phrases:
- la question analysée;
- le modèle retenu;
- le principal résultat conditionnel;
- un diagnostic qui modifie ou nuance l’interprétation;
- la limite qui encadre une prédiction ou interdit une conclusion causale.
Deux niveaux de parcours
Le parcours essentiel couvre l’ajustement, l’interprétation et les diagnostics de résidus, de colinéarité et d’influence. Les extensions ajoutent les interactions et la prédiction sur l’échelle originale.
Couverture théorique
La présentation introduit les notions nécessaires sans demander de dérivation calculatoire:
- objectifs descriptif, explicatif et prédictif;
- moyenne conditionnelle, valeurs ajustées, résidus et moindres carrés;
- codage des variables quantitatives, ordinales et nominales;
- interprétation conditionnelle des coefficients;
- distinction entre estimation, intervalle, valeur p et utilité pratique;
- colinéarité, hypothèses, diagnostics et influence;
- intervalles de confiance et de prédiction;
- transformation logarithmique, sensibilité et validation hors échantillon.
Le tutoriel complet développe ces notions avec davantage de texte, les sorties R, des formulations d’interprétation et une section de lectures complémentaires.
Données
Une ligne représente une vente résidentielle à Ames, en Iowa. Le jeu contient 2 930 ventes et 80 caractéristiques des propriétés. Les montants sont en dollars américains et la surface habitable est exprimée en pieds carrés (D. De Cock, 2011; M. Kuhn, 2020).
Lectures suggérées
- An Introduction to Statistical Learning, chapitre 3, pour la théorie de la régression linéaire (G. James et al., 2021).
- Tidy Modeling with R, données Ames, pour prolonger l’exploration du jeu.
- Tidy Modeling with R, fondamentaux des modèles dans R, pour les formules, objets ajustés et prédictions (M. Kuhn et J. Silge, 2022).
- OpenIntro, chapitre 7, pour une présentation détaillée de la régression multiple.