Un outil, une mesure, un domaine de validité.

Fiche de référence du cours IDEC. Tous les nombres d’exemple ci-dessous sont fictifs. Une métrique décrit une tâche et un échantillon ; elle ne certifie pas une « intelligence » générale.

Avant les calculs : la fiche du capteur

  1. Décision : que fera-t-on de la sortie ? Quelle référence simple faut-il battre ?
  2. Entrées et cible : unités, capteurs, qualité des annotations, information disponible au moment de décider.
  3. Domaine : sites, dates, produits, plages de mesure, conditions d’acquisition et cas exclus.
  4. Hypothèses : stabilité, indépendance, représentativité et erreurs de mesure. Les vérifier, pas seulement les écrire.
  5. Erreurs acceptables : coût d’une omission et d’une fausse alerte, possibilité de s’abstenir, contrôle humain.
  6. Suivi : échantillon témoin, alerte de dérive, responsable et condition de réévaluation.

Trois façons d’apprendre

Supervisé : apprendre à partir d’entrées et de réponses de référence. Classification : une classe ; régression : une valeur. Non supervisé : chercher une structure sans cible fournie, par exemple des groupes ; un groupe n’est pas automatiquement une vérité physique. Renforcement : apprendre une politique d’action à partir de conséquences et de récompenses, avec un compromis exploration/exploitation.

Un réseau profond est une architecture utilisable dans plusieurs régimes. Des règles, une recherche sous contraintes ou une simulation multi-agents ne nécessitent pas toujours d’apprentissage. « Génératif », « supervisé » et « profond » ne sont donc pas des cases exclusives.

Classification : partir de quatre nombres

Positif = PET. Un lot contient 100 objets : 20 PET et 80 autres. Le modèle en prédit 24 PET, dont 16 le sont réellement. Ici les lignes sont les prédictions et les colonnes la réalité : toujours lire les axes.

Réel PETRéel autre
Prédit PET16 vrais positifs (VP)8 faux positifs (FP)
Prédit autre4 faux négatifs (FN)72 vrais négatifs (VN)

Un dénominateur nul exige une convention explicite : ici on affiche « — » quand le calcul n’est pas défini. En multiclasses, lire les résultats par classe avant les moyennes macro, micro ou pondérées. En tri, les indicateurs industriels de pureté et de récupération peuvent être calculés en masse ; le comptage d’objets ci-dessus n’en est pas une mesure directe.

Déplacer le seuil change les erreurs

Atelier distinct : 20 objets fictifs, dont 8 PET. Les scores sont fixés pour comparer les seuils sur le même lot. Un score n’est pas nécessairement une probabilité calibrée.

Le seuil se règle sur la validation, selon les conséquences des erreurs. Le test final reste indépendant. ROC représente le rappel contre le taux de faux positifs ; précision-rappel montre directement le compromis utile lorsque la classe positive est rare. Une aire sous une courbe ne remplace pas le choix du point de fonctionnement.

Piège du déséquilibre : 10 défauts sur 1 000 pièces. Annoncer toujours « conforme » donne 99 % d’exactitude, mais 0 % de rappel des défauts.

Régression : des erreurs avec des unités

Résistances mesurées : 30, 32, 34 MPa. Prédictions : 31, 30, 37 MPa. Avec la convention erreur = prédiction − mesure, les écarts sont +1, −2, +3 MPa.

La référence constante 32 MPa obtient ici une MAE de 1,33 MPa : notre modèle d’exemple ne la bat pas. Trois observations ne suffisent pas pour qualifier un outil ; regarder aussi les résidus selon la plage, le site et le temps.

Valider sans se raconter une histoire

80 % sur combien de cas ?

16 succès sur 20 donnent un intervalle de Wilson à 95 % d’environ 58–92 %. 1 600 sur 2 000 donnent environ 78–82 %. Ces intervalles supposent des essais de Bernoulli indépendants à probabilité constante ; des images corrélées du même objet ne valent pas autant d’essais indépendants. Le niveau 95 % décrit la couverture de la procédure répétée, pas une probabilité fréquentiste attribuée au paramètre fixe après observation.

Calibration, corrélation, causalité

Parmi les cas auxquels on attribue 80 % de probabilité, environ 80 % devraient être positifs si la calibration est bonne sur ce domaine. Bien classer et bien calibrer sont deux propriétés différentes. Une corrélation prédictive n’établit pas la cause ; modifier une variable peut ne pas produire l’effet attendu.

La métrique suit la décision

Sources pour aller plus loin

Définitions et conventions des métriques · Calibration · Validation croisée et séparation des données · NIST : intervalles pour une proportion.

Revenir au cours