Jour 1: comprendre une relation

Régression linéaire multiple et diagnostics

Question directrice

Comment le prix de vente d’une propriété varie-t-il avec sa surface, sa qualité, son année de construction et son garage, et jusqu’où peut-on interpréter ou utiliser le modèle?

Objectifs

À la fin de la matinée, vous pourrez:

  1. définir une réponse continue et des prédicteurs pertinents;
  2. ajuster une régression linéaire multiple en R;
  3. interpréter un coefficient conditionnel et un intervalle;
  4. diagnostiquer forme fonctionnelle, variance, résidus et influence;
  5. distinguer association, prédiction et causalité;
  6. formuler une conclusion proportionnée aux données.

Matériel

La trousse complète du jour 1 contient le cahier QMD et un court mode d’emploi.

Déroulement

La matinée alterne trois cycles:

  1. théorie et participation collective;
  2. mission guidée en équipe;
  3. débrief et mise en commun.

La présentation reste le fil principal de 8 h 45 à 12 h 15. Le tutoriel sert de référence détaillée et les missions s’ouvrent lorsque leur diapositive de transition apparaît.

Production de la matinée

Une fiche modèle de cinq phrases:

  1. la question analysée;
  2. le modèle retenu;
  3. le principal résultat conditionnel;
  4. un diagnostic qui modifie ou nuance l’interprétation;
  5. la limite qui encadre une prédiction ou interdit une conclusion causale.

Deux niveaux de parcours

Le parcours essentiel couvre l’ajustement, l’interprétation et les diagnostics de résidus, de colinéarité et d’influence. Les extensions ajoutent les interactions et la prédiction sur l’échelle originale.

Couverture théorique

La présentation introduit les notions nécessaires sans demander de dérivation calculatoire:

  1. objectifs descriptif, explicatif et prédictif;
  2. moyenne conditionnelle, valeurs ajustées, résidus et moindres carrés;
  3. codage des variables quantitatives, ordinales et nominales;
  4. interprétation conditionnelle des coefficients;
  5. distinction entre estimation, intervalle, valeur p et utilité pratique;
  6. colinéarité, hypothèses, diagnostics et influence;
  7. intervalles de confiance et de prédiction;
  8. transformation logarithmique, sensibilité et validation hors échantillon.

Le tutoriel complet développe ces notions avec davantage de texte, les sorties R, des formulations d’interprétation et une section de lectures complémentaires.

Données

Une ligne représente une vente résidentielle à Ames, en Iowa. Le jeu contient 2 930 ventes et 80 caractéristiques des propriétés. Les montants sont en dollars américains et la surface habitable est exprimée en pieds carrés (D. De Cock, 2011; M. Kuhn, 2020).

Lectures suggérées

  1. An Introduction to Statistical Learning, chapitre 3, pour la théorie de la régression linéaire (G. James et al., 2021).
  2. Tidy Modeling with R, données Ames, pour prolonger l’exploration du jeu.
  3. Tidy Modeling with R, fondamentaux des modèles dans R, pour les formules, objets ajustés et prédictions (M. Kuhn et J. Silge, 2022).
  4. OpenIntro, chapitre 7, pour une présentation détaillée de la régression multiple.

Les références

D. De Cock. (2011). Ames, Iowa: Alternative to the Boston Housing Data as an End of Semester Regression Project. Journal of Statistics Education. https://doi.org/10.1080/10691898.2011.11889627.
G. James, D. Witten, T. Hastie, et R. Tibshirani. (2021). An Introduction to Statistical Learning: With Applications in R. https://www.statlearning.com/.
M. Kuhn. (2020). AmesHousing: The Ames Iowa Housing Data. https://CRAN.R-project.org/package=AmesHousing.
M. Kuhn et J. Silge. (2022). Tidy Modeling with R. https://www.tmwr.org/.