Jour 3: comparer sans se raconter d’histoire

Arbres, forêts aléatoires et validation temporelle

Question directrice

Un modèle plus flexible améliore-t-il réellement la prédiction des demandes 311 futures, et le gain éventuel justifie-t-il sa complexité?

Objectifs

À la fin de la matinée, vous pourrez:

  1. expliquer la logique d’un arbre et d’une forêt aléatoire;
  2. reconnaître le surajustement;
  3. réserver un test futur et construire des fenêtres de validation temporelle;
  4. appliquer le même prétraitement et les mêmes mesures à plusieurs modèles;
  5. comparer performance moyenne et stabilité dans le temps;
  6. interpréter prudemment une importance de variable;
  7. recommander un modèle selon un mandat explicite;
  8. définir une surveillance et une condition de retrait.

Matériel

Téléchargement direct: requetes_311_montreal_2024_eiom.csv (18 000 demandes, environ 4,3 Mo).

La trousse complète du jour 3 contient aussi le cahier QMD, le mode d’emploi et le fichier de données 311 requis.

Production de la matinée

La fiche de modèle finale doit préciser:

  1. la question, l’unité et le moment de prédiction;
  2. les variables permises et les informations futures interdites;
  3. le mandat;
  4. les périodes d’entraînement, de validation et de test;
  5. les modèles, les mesures et leur stabilité;
  6. le compromis retenu et les limites;
  7. une règle de surveillance et une condition de retrait.

Principe de comparaison

Les trois modèles utilisent la même cible, les mêmes prédicteurs disponibles à la création, les mêmes règles de prétraitement, les mêmes fenêtres et les mêmes mesures. La complexité n’obtient aucun avantage méthodologique caché.