Aller au contenu principal
Institut des Hautes Études Technologiques et Commerciales

Ressources

Comprendre l'apprentissage automatique

Un modèle apprend une règle à partir d'exemples, puis l'applique à des cas nouveaux. Tout le métier tient dans trois questions : quels exemples, quelle règle, et comment vérifier qu'elle vaut ailleurs que sur les données d'entraînement.

Apprendre une règle, la vérifier ailleurs

Un modèle de régression estime une quantité, un modèle de classification attribue une catégorie. Dans les deux cas, il ajuste ses paramètres pour reproduire au mieux les exemples fournis. La question décisive vient ensuite : cette règle vaut-elle sur des données qu'il n'a jamais vues ? La validation croisée y répond en réservant une partie des exemples à l'évaluation. Un modèle qui excelle sur son entraînement et se dégrade à l'épreuve a mémorisé plutôt qu'appris, et le protocole rend ce diagnostic immédiat.

  • Des exemples représentatifs de la situation où le modèle servira
  • Une séparation stricte entre données d'entraînement et données d'épreuve
  • Une mesure de performance choisie pour la décision visée
  • Une comparaison avec une règle simple, qui sert de référence
  • Une interprétation des variables qui pèsent, exigible sur toute décision

Les cinq décisions d'un projet de modélisation

  1. 01

    Formuler la cible

    Ce que le modèle doit estimer, dans l'unité de la décision. Une cible floue produit un modèle inutilisable.

  2. 02

    Constituer les exemples

    Une période représentative, un périmètre annoncé. C'est ici que se joue la validité de tout le reste.

  3. 03

    Établir une référence simple

    La moyenne, la dernière valeur connue, une règle métier. Le modèle doit faire mieux que cela pour se justifier.

  4. 04

    Comparer plusieurs familles

    Modèles linéaires, arbres, méthodes à noyaux : la validation croisée tranche sur un protocole identique.

  5. 05

    Expliquer avant de déployer

    Les variables qui pèsent se présentent au métier. Un modèle que l'on sait expliquer est un modèle que l'on ose utiliser.

Les cursus qui portent la modélisation

Deux cursus de niveau Bac+5, deux angles : la conception de modèles et leur industrialisation d'un côté, la statistique appliquée et l'ingénierie des données de l'autre. Les volumes encadrés se comparent directement.

ProgrammeNiveauDuréeCrédits et heuresFrais
Cursus Intelligence Artificielle — Bac+5Master2 ans120 crédits · 1200 h7 800 000 GNF par an
Cursus Data Science — Bac+5Master2 ans120 crédits · 1200 h7 200 000 GNF par an

Questions sur les modèles

Quel volume de données faut-il ?

Assez d'exemples pour couvrir les situations que le modèle rencontrera, ce qui dépend de la variété du problème bien plus que d'un seuil universel. Une règle simple bien construite sert utilement en attendant, et elle constitue la référence à battre.

Faut-il maîtriser les mathématiques pour modéliser ?

Le cursus consacre 220 heures encadrées à l'algèbre linéaire, au calcul différentiel, aux probabilités et à l'optimisation, enseignés pour l'usage qu'en fait la modélisation. C'est le bloc qui rend les suivants lisibles.

Comment expliquer une décision produite par un modèle ?

En présentant les variables qui l'ont déterminée et leur sens pour le métier. L'interprétabilité fait l'objet d'un bloc entier dans le cursus de science des données : elle conditionne l'acceptation d'un modèle bien plus que sa performance brute.

Comprendre l'apprentissage automatique — Ressources | IHETC — IHETC