Comprendre une relation
Régression linéaire multiple avec les propriétés d’Ames
Le fil de la matinée
8 h 45
Question de départ et brise-glace
9 h
Bloc 1: choisir avant d’ajuster
9 h 30
Mission 1 et débrief
10 h 10
Pause
10 h 20
Bloc 2: interpréter et prédire
10 h 50
Mission 2 et débrief
11 h 30
Bloc 3: mettre le modèle à l’épreuve
11 h 50
Mission finale et synthèse
3 minutes. Présenter la matinée comme trois cycles: théorie courte, participation, mission, débrief. Dire que cette présentation restera le fil conducteur jusqu’à 12 h 15.
Ce que vous produirez
À 12 h 15, chaque équipe aura produit une fiche modèle de cinq phrases:
la question étudiée;
le modèle retenu;
le principal résultat conditionnel;
le diagnostic qui nuance ce résultat;
la limite qui encadre son utilisation.
Le but n’est pas seulement d’obtenir une équation, mais de décider quand lui faire confiance.
2 minutes. Annoncer la production finale. Chaque mission fournira une partie de la fiche. Demander de conserver les décisions intermédiaires.
Qu’est-ce qui fait varier le prix d’une maison?
5 minutes. Brise-glace. Faire proposer des caractéristiques sans les juger. Classer au tableau: taille, qualité, âge, emplacement, équipements et contexte de vente.
Une relation visible, mais pas encore comprise
3 minutes. Laisser le groupe décrire le nuage avant de nommer une association. Faire relever la tendance positive, la dispersion croissante et les propriétés très grandes.
Que faudrait-il vérifier avant de raconter cette relation?
5 minutes. Recueillir au tableau: unité statistique, distribution du prix, variables omises, forme de la relation, observations atypiques, incertitude, population visée et causalité.
Bloc 1
Choisir avant d’ajuster
De la question au petit ensemble de prédicteurs
Trois usages, trois critères de réussite
Décrire
Le résumé représente-t-il les données?
Expliquer une association
Le coefficient conditionnel est-il interprétable?
Prédire
L’erreur sur de nouvelles ventes est-elle acceptable?
Un bon ajustement ne transforme pas des données observationnelles en expérience causale.
4 minutes. Faire voter pour un objectif principal. Aujourd’hui, commencer par l’explication conditionnelle, puis ouvrir la porte à la prédiction.
L’unité statistique fixe la portée
2930 ventes résidentielles
28 quartiers codés
une période de 2006 à 2010 dans le jeu original
Une ligne n’est ni une personne, ni un quartier, ni la valeur actuelle d’une propriété.
4 minutes. Demander ce qu’une ligne représente. Insister sur vente observée, lieu et période. Les résultats ne s’appliquent pas automatiquement à Québec en 2026.
[Sources]
De Cock, D. (2011), https://doi.org/10.1080/10691898.2011.11889627
Kuhn et Silge, données Ames, https://www.tmwr.org/ames.html
Le prix brut est asymétrique
Médiane: $160,000
3 minutes. Faire décrire l’asymétrie. Ne pas transformer automatiquement. Dire que le modèle en dollars est intuitif et que le logarithme deviendra une analyse comparative.
Le type d’une variable détermine son rôle dans le modèle
gr_liv_area
quantitative
pente par pied carré
overall_qual
ordinale
score de 1 à 10
year_built
quantitative
pente par année
garage_cars
dénombrement
pente par place
neighborhood
nominale
indicatrices et référence
Raisons défendables: connaissance du problème, preuve graphique, contrôle d’un facteur et interprétabilité.
4 minutes. Faire choisir individuellement quatre variables. Nommer l’hypothèse imposée par le score de qualité et expliquer qu’une variable nominale produit des comparaisons avec une catégorie de référence. Demander si 80 variables seraient automatiquement meilleures. Réponse: non, surtout sans objectif ni validation.
Simple et multiple ne répondent pas à la même question
Régression simple:
\[
\text{prix} = \beta_0 + \beta_1\text{surface} + \varepsilon
\]
Régression multiple:
\[
\text{prix} = \beta_0 + \beta_1\text{surface} +
\beta_2\text{qualité} + \beta_3\text{année} +
\beta_4\text{garage} + \varepsilon
\]
Le coefficient de surface devient une comparaison entre propriétés semblables sur les autres variables du modèle.
4 minutes. Demander ce qui change dans la comparaison. Dans le modèle multiple, on compare conditionnellement à qualité, année et garage identiques.
Les moindres carrés choisissent la droite qui réduit les erreurs
Pour chaque vente:
\[
\text{résidu}_i = y_i - \widehat{y}_i
\]
lm() choisit les coefficients qui minimisent:
\[
\sum_{i=1}^{n}(y_i-\widehat{y}_i)^2.
\]
Les grandes erreurs comptent davantage parce qu’elles sont élevées au carré.
4 minutes. Dessiner une observation, sa valeur ajustée et le segment vertical qui forme le résidu. Expliquer le principe sans dérivation matricielle. Préciser que minimiser l’erreur dans les données observées ne garantit pas la performance future.
[Sources]
Documentation officielle de lm(), https://stat.ethz.ch/R-manual/R-devel/library/stats/html/lm.html
OpenIntro, chapitre 7, https://www.openintro.org/go/?id=biostat0
Votre modèle commence avec 4, 10 ou 80 prédicteurs?
3 minutes. Vote à main levée. Réponse retenue: commencer avec quatre variables justifiées, puis comparer des extensions. La simplicité rend les premières erreurs visibles.
Mission 1
Ouvrir la mission 1
25 minutes, en équipes de trois ou quatre.
À remettre:
une formule de modèle;
un graphique probant;
un verdict de trois phrases.
Avant d’exécuter lm(), prédisez le signe de chaque coefficient.
25 minutes. Afficher le lien et lancer le chronomètre. À 15 minutes, rappeler qu’une seule preuve graphique suffit. À 22 minutes, demander de finaliser les trois phrases.
Débrief de la mission 1
Modèle commun retenu:
modele_prix <- lm (
sale_price ~ gr_liv_area + overall_qual +
year_built + garage_cars,
data = ames
)
Verdict attendu:
une ligne est une vente;
l’objectif initial est l’association conditionnelle;
les quatre variables sont lisibles, plausibles et imparfaites.
15 minutes. Faire présenter deux graphiques différents. Demander à chaque équipe si son objectif est surtout explicatif ou prédictif. Introduire le modèle commun sans prétendre qu’il est définitif.
Pause
10 h 10 à 10 h 20
Avant de partir, écrivez une question qui reste floue.
10 minutes. Recueillir une question par équipe. Utiliser les réponses pour ajuster le bloc 2 sans retarder la reprise.
Bloc 2
Interpréter et prédire
Lire un coefficient, puis communiquer l’incertitude
Le modèle est une moyenne conditionnelle
\[
E(Y_i \mid X_i) = \beta_0 + \beta_1 X_{i1} + \cdots + \beta_4 X_{i4}
\]
Chaque coefficient représente une différence moyenne attendue lorsque les autres variables du modèle sont maintenues constantes.
Cette phrase ne signifie pas:
que les propriétés sont identiques sur tout;
que toutes les variables importantes sont incluses;
que la relation est causale.
4 minutes. Faire reformuler « toutes choses égales par ailleurs ». Corriger vers « à valeurs identiques des autres variables incluses ».
Ajuster avec lm()
modele_prix <- lm (
sale_price ~ gr_liv_area + overall_qual +
year_built + garage_cars,
data = ames
)
tidy (modele_prix, conf.int = TRUE )
# A tibble: 5 × 7
term estimate std.error statistic p.value conf.low conf.high
<chr> <dbl> <dbl> <dbl> <dbl> <dbl> <dbl>
1 (Intercept) -820149. 60058. -13.7 3.32e- 41 -937908. -702389.
2 gr_liv_area 57.3 1.82 31.5 4.59e-188 53.7 60.8
3 overall_qual 23960. 777. 30.8 3.85e-181 22437. 25483.
4 year_built 377. 31.6 11.9 4.17e- 32 315. 439.
5 garage_cars 14723. 1275. 11.5 3.43e- 30 12223. 17223.
# A tibble: 1 × 12
r.squared adj.r.squared sigma statistic p.value df logLik AIC BIC
<dbl> <dbl> <dbl> <dbl> <dbl> <dbl> <dbl> <dbl> <dbl>
1 0.765 0.765 38761. 2379. 0 4 -35111. 70234. 70270.
# ℹ 3 more variables: deviance <dbl>, df.residual <int>, nobs <int>
tidy() lit les coefficients. glance() résume le modèle entier.
3 minutes. Montrer la formule de gauche à droite. Si la démonstration en direct est risquée, rester sur la sortie intégrée.
Quatre associations positives
Surface
$57
$54
$61
Qualité
$23,960
$22,437
$25,483
Année
$377
$315
$439
Garage
$14,723
$12,223
$17,223
R carré ajusté: 0.765
4 minutes. Faire vérifier les signes prédits avant la mission. Ne pas interpréter encore le R carré comme preuve de causalité ou de prédiction future.
Lire le coefficient de surface
Coefficient: $57.3 par pied carré.
Interprétation utile:
À qualité, année de construction et capacité du garage identiques, 100 pieds carrés supplémentaires sont associés en moyenne à environ $5,727 de plus sur le prix.
Le coefficient ne dit pas que l’ajout de 100 pieds carrés causerait ce gain.
4 minutes. Faire repérer l’unité. Demander pourquoi on multiplie par 100. Faire corriger une formulation causale proposée oralement.
Lire le coefficient de qualité
Coefficient: $23,960 par point.
À surface, année de construction et capacité du garage identiques, un point supplémentaire de qualité globale est associé en moyenne à environ $23,960 de plus.
Réserve: le codage 1 à 10 suppose le même incrément moyen entre tous les niveaux successifs.
4 minutes. Demander quelle hypothèse vient du codage numérique. Réponse: effet linéaire constant d’un point supplémentaire.
Significatif, important et utile sont trois jugements distincts
Coefficient
Quelle est la direction et la taille estimée?
Intervalle de confiance
Quelles valeurs restent compatibles avec le modèle?
Valeur p
Les données sont-elles compatibles avec un coefficient nul?
Utilité pratique
L’effet est-il substantiel dans le contexte?
Une petite valeur p ne garantit ni un effet important, ni une bonne prédiction.
3 minutes. Expliquer que les valeurs p dépendent aussi de la taille d’échantillon et des hypothèses. Insister sur le coefficient, son intervalle, les unités et la question. L’intercept hors domaine reste expliqué dans le tutoriel.
[Sources]
James et ses collègues, chapitre 3, https://www.statlearning.com/
OpenIntro, chapitre 7, https://www.openintro.org/go/?id=biostat0
Colinéarité: les prédicteurs se répètent-ils?
gr_liv_area
1.64
overall_qual
2.34
year_built
1.78
garage_cars
1.84
Ici, les VIF restent modérés. Cela ne valide pas les autres hypothèses du modèle.
3 minutes. Faire repérer la plus grande valeur. Dire qu’un seuil unique ne remplace pas l’examen du contexte et de l’incertitude.
Deux intervalles pour deux questions
Confiance
prix moyen de propriétés semblables
Prédiction
prix d’une nouvelle propriété individuelle
Le second est plus large car il combine:
l’incertitude sur la moyenne;
la variabilité individuelle autour de cette moyenne.
4 minutes. Faire voter: lequel communiquer à une personne qui veut estimer une nouvelle vente? Réponse: l’intervalle de prédiction.
Une propriété type
1 500 pieds carrés, qualité 6, construite en 2000, garage de deux places.
fit lwr upr
1 192778.7 190525.4 195031.9
fit lwr upr
1 192778.7 116744 268813.3
3 minutes. Faire comparer les centres et les largeurs. Arrondir à des milliers de dollars dans la communication orale.
Mission 2: auditer une estimation
Ouvrir la mission 2
25 minutes.
À remettre:
deux prédictions individuelles;
une décomposition de leur écart;
un message professionnel corrigé.
25 minutes. Distribuer le message contestable. À 10 minutes, vérifier que les équipes raisonnent sur les quatre différences. À 18 minutes, demander quel intervalle répond à une vente individuelle. Garder cinq minutes pour corriger le message.
Débrief de la mission 2
Maison A
$193,000
$116,000 à $269,000
Maison B
$214,000
$138,000 à $290,000
L’écart ajusté est d’environ $21,200, mais les caractéristiques poussent dans des directions opposées et l’incertitude individuelle reste large.
Appliquer un coefficient n’est pas répéter sa définition: il faut recomposer le profil, l’incertitude et la portée.
15 minutes. Faire expliquer pourquoi la qualité réduit l’avantage de la maison B, alors que surface, année et garage l’augmentent. Refuser le mot « vaudra ». Demander à une équipe de lire son message corrigé.
Bloc 3
Mettre le modèle à l’épreuve
Résidus, influence, transformation et décision
Les hypothèses ne protègent pas toutes la même conclusion
moyenne correctement structurée
résidus contre valeurs ajustées
variance à peu près constante
largeur verticale des résidus
erreurs indépendantes
plan de collecte, temps et espace
queues compatibles avec l’inférence
diagramme quantile-quantile
absence de domination individuelle
influence et sensibilité
La normalité concerne les erreurs, pas la distribution brute du prix.
4 minutes. Relier chaque hypothèse à la conclusion qu’elle soutient. Expliquer que l’indépendance ne se lit pas uniquement dans un graphique. Mentionner que la normalité est surtout importante pour l’inférence exacte, alors que forme et variance affectent aussi les prédictions.
[Sources]
James et ses collègues, chapitre 3, https://www.statlearning.com/
OpenIntro, chapitre 7, https://www.openintro.org/go/?id=biostat0
Les résidus révèlent une structure
4 minutes. Faire décrire la forme avant de poser un diagnostic. Réponses: éventail, courbure légère, extrêmes. Dire que la variance augmente avec le niveau ajusté.
Le QQ-plot examine les queues
L’écart dans les queues concerne surtout l’inférence et les intervalles, pas l’existence même d’une association.
3 minutes. Faire repérer les extrémités. Éviter le verdict binaire normal ou non normal. Parler de degré et de conséquence.
Influence: un signal à enquêter
1499
$160,000
5642
10
0.592
2181
$183,850
5095
10
0.294
2182
$184,750
4676
10
0.189
1768
$755,000
4316
10
0.134
1761
$745,000
4476
10
0.131
La vente 1499 est inhabituelle. Elle n’est pas automatiquement erronée.
3 minutes. Demander les quatre actions avant suppression: vérifier la source, comprendre le contexte, comparer avec et sans, documenter la décision.
Sensibilité: avec et sans la vente la plus influente
gr_liv_area
57.3
60.2
overall_qual
23959.6
23775.3
year_built
376.9
388.0
garage_cars
14723.3
13798.2
3 minutes. Faire comparer signes et ordres de grandeur. La surface varie davantage, mais la conclusion générale ne s’inverse pas.
Le logarithme change le diagnostic et la question
4 minutes. Faire choisir le nuage le plus régulier. Dire que l’échelle logarithmique facilite les diagnostics, mais transforme les coefficients en variations relatives.
Mission finale
Ouvrir la mission finale
20 minutes.
À remettre:
une décision adaptée au mandat reçu;
une preuve diagnostique décisive;
une fiche modèle de cinq phrases.
20 minutes. Attribuer un mandat A, B ou C à chaque équipe. À 8 minutes, demander une décision provisoire. À 15 minutes, faire commencer la fiche même si l’analyse n’est pas terminée.
Restitution éclair
Chaque équipe dispose de 45 secondes:
notre résultat principal;
le diagnostic qui a changé notre lecture;
ce que nous ne dirions pas.
Les autres équipes peuvent seulement ajouter une nuance ou poser une question.
3 minutes. Prendre trois équipes si le groupe est grand. Refuser les répétitions. Inscrire au tableau un résultat, une preuve et une limite.
Sept questions à emporter
Quelle est l’unité statistique?
Quel est l’objectif: expliquer ou prédire?
Pourquoi chaque variable est-elle dans le modèle?
Les coefficients gardent-ils leurs unités et leurs conditions?
Que montrent les résidus et l’influence?
Pour prédire, l’erreur a-t-elle été évaluée sur des données non utilisées pour ajuster?
La conclusion dépasse-t-elle les données?
À 12 h 15, votre modèle doit être défendable
Un modèle utile relie:
une question précise;
une comparaison conditionnelle;
une incertitude visible;
un diagnostic;
une limite explicite.
Demain: passer d’un prix continu à une probabilité.
1 minute. Demander le diagnostic qui a le plus changé l’avis du groupe. Annoncer la régression logistique du jour 2 et terminer à 12 h 15.