Jour 2: expliquer une probabilité
Régression logistique avec les données Titanic
Question directrice
Comment relier les caractéristiques enregistrées d’un passager à une probabilité de survie, puis évaluer ce que cette probabilité permet réellement d’affirmer?
Le jeu Titanic rend la réponse binaire et les variables faciles à comprendre. Il permet donc de concentrer la matinée sur les idées statistiques: probabilité, cote, logit, rapport de cotes, validation, seuil et calibration.
Objectifs
À la fin de la matinée, vous pourrez:
- définir une réponse binaire et son événement d’intérêt;
- expliquer pourquoi une droite ordinaire convient mal à une probabilité;
- passer de la probabilité à la cote et à la log-cote;
- ajuster une régression logistique avec
glm(); - interpréter un rapport de cotes de manière conditionnelle;
- distinguer significativité, importance pratique et qualité prédictive;
- évaluer un modèle sur un jeu test;
- lire une matrice de confusion, une courbe ROC et une courbe de calibration;
- choisir un seuil en fonction d’un mandat explicite;
- nommer les limites historiques, statistiques et causales de l’analyse.
Matériel
PrésentationLe fil théorique et participatif de toute la matinée. PDF annotableLes 43 diapositives en format paysage, une page par écran. Tutoriel completToutes les notions, le code reproductible et les lectures. MissionsTrois productions cumulatives réalisées en équipe. Cahier QMD guidéLes trois missions Titanic, toutes les questions et des zones de réponse.
La trousse complète du jour 2 contient le cahier QMD et un court mode d’emploi.
Production de la matinée
Les trois missions construisent une fiche modèle de six phrases:
- l’unité statistique et la réponse;
- la formule et la population couverte;
- une association conditionnelle exprimée par un rapport de cotes;
- une mesure de discrimination et une mesure de calibration;
- un seuil relié à un mandat;
- une limite qui interdit une interprétation trop forte.
Données et prudence
Le paquet R titanic fournit titanic_train, un échantillon individuel de 891 passagers utilisé dans un contexte d’apprentissage automatique. Il contient notamment la survie enregistrée, la classe, le sexe, l’âge, le tarif et des variables familiales (P. Hendricks, 2015).
Ces données servent ici à enseigner la modélisation. Elles ne représentent pas un manifeste complet et ne permettent pas de reconstituer toute l’histoire du naufrage. Les associations observées ne démontrent pas des effets causaux et le choix d’un seuil n’est pas présenté comme une règle de sauvetage.
Lectures suggérées
Pour reprendre les notions après la séance, consultez le chapitre 4 de An Introduction to Statistical Learning, la documentation officielle de glm(), le chapitre sur la séparation entraînement-test et la documentation du jeu Titanic.