Jour 2: expliquer une probabilité

Régression logistique avec les données Titanic

Question directrice

Comment relier les caractéristiques enregistrées d’un passager à une probabilité de survie, puis évaluer ce que cette probabilité permet réellement d’affirmer?

Le jeu Titanic rend la réponse binaire et les variables faciles à comprendre. Il permet donc de concentrer la matinée sur les idées statistiques: probabilité, cote, logit, rapport de cotes, validation, seuil et calibration.

Objectifs

À la fin de la matinée, vous pourrez:

  1. définir une réponse binaire et son événement d’intérêt;
  2. expliquer pourquoi une droite ordinaire convient mal à une probabilité;
  3. passer de la probabilité à la cote et à la log-cote;
  4. ajuster une régression logistique avec glm();
  5. interpréter un rapport de cotes de manière conditionnelle;
  6. distinguer significativité, importance pratique et qualité prédictive;
  7. évaluer un modèle sur un jeu test;
  8. lire une matrice de confusion, une courbe ROC et une courbe de calibration;
  9. choisir un seuil en fonction d’un mandat explicite;
  10. nommer les limites historiques, statistiques et causales de l’analyse.

Matériel

La trousse complète du jour 2 contient le cahier QMD et un court mode d’emploi.

Production de la matinée

Les trois missions construisent une fiche modèle de six phrases:

  1. l’unité statistique et la réponse;
  2. la formule et la population couverte;
  3. une association conditionnelle exprimée par un rapport de cotes;
  4. une mesure de discrimination et une mesure de calibration;
  5. un seuil relié à un mandat;
  6. une limite qui interdit une interprétation trop forte.

Données et prudence

Le paquet R titanic fournit titanic_train, un échantillon individuel de 891 passagers utilisé dans un contexte d’apprentissage automatique. Il contient notamment la survie enregistrée, la classe, le sexe, l’âge, le tarif et des variables familiales (P. Hendricks, 2015).

Ces données servent ici à enseigner la modélisation. Elles ne représentent pas un manifeste complet et ne permettent pas de reconstituer toute l’histoire du naufrage. Les associations observées ne démontrent pas des effets causaux et le choix d’un seuil n’est pas présenté comme une règle de sauvetage.

Lectures suggérées

Pour reprendre les notions après la séance, consultez le chapitre 4 de An Introduction to Statistical Learning, la documentation officielle de glm(), le chapitre sur la séparation entraînement-test et la documentation du jeu Titanic.

Les références

P. Hendricks. (2015). titanic: Titanic Passenger Survival Data Set. https://CRAN.R-project.org/package=titanic.