Un outil, une mesure, un domaine de validité.
Fiche de référence du cours IDEC. Tous les nombres d’exemple ci-dessous sont fictifs. Une métrique décrit une tâche et un échantillon ; elle ne certifie pas une « intelligence » générale.
Avant les calculs : la fiche du capteur
- Décision : que fera-t-on de la sortie ? Quelle référence simple faut-il battre ?
- Entrées et cible : unités, capteurs, qualité des annotations, information disponible au moment de décider.
- Domaine : sites, dates, produits, plages de mesure, conditions d’acquisition et cas exclus.
- Hypothèses : stabilité, indépendance, représentativité et erreurs de mesure. Les vérifier, pas seulement les écrire.
- Erreurs acceptables : coût d’une omission et d’une fausse alerte, possibilité de s’abstenir, contrôle humain.
- Suivi : échantillon témoin, alerte de dérive, responsable et condition de réévaluation.
Trois façons d’apprendre
Supervisé : apprendre à partir d’entrées et de réponses de référence. Classification : une classe ; régression : une valeur. Non supervisé : chercher une structure sans cible fournie, par exemple des groupes ; un groupe n’est pas automatiquement une vérité physique. Renforcement : apprendre une politique d’action à partir de conséquences et de récompenses, avec un compromis exploration/exploitation.
Un réseau profond est une architecture utilisable dans plusieurs régimes. Des règles, une recherche sous contraintes ou une simulation multi-agents ne nécessitent pas toujours d’apprentissage. « Génératif », « supervisé » et « profond » ne sont donc pas des cases exclusives.
Classification : partir de quatre nombres
Positif = PET. Un lot contient 100 objets : 20 PET et 80 autres. Le modèle en prédit 24 PET, dont 16 le sont réellement. Ici les lignes sont les prédictions et les colonnes la réalité : toujours lire les axes.
| Réel PET | Réel autre | |
|---|---|---|
| Prédit PET | 16 vrais positifs (VP) | 8 faux positifs (FP) |
| Prédit autre | 4 faux négatifs (FN) | 72 vrais négatifs (VN) |
- Précision : parmi les positifs annoncés, combien sont vrais ?
VP / (VP + FP) = 16 / 24 = 66,7 %. - Rappel, sensibilité : parmi les vrais positifs, combien sont retrouvés ?
VP / (VP + FN) = 16 / 20 = 80 %. - Exactitude, accuracy : proportion de décisions correctes.
(VP + VN) / N = 88 %. En français, « précision » traduit ici precision, pas accuracy. - F1 : moyenne harmonique de précision et rappel.
2 VP / (2 VP + FP + FN) = 32 / 44 = 72,7 %. Ce résumé ne représente pas automatiquement les coûts du métier. - Taux de faux positifs :
FP / (FP + VN) = 8 / 80 = 10 %. Ce n’est pas1 − précision = 8 / 24 = 33,3 %. - Spécificité :
VN / (VN + FP) = 90 %.
Un dénominateur nul exige une convention explicite : ici on affiche « — » quand le calcul n’est pas défini. En multiclasses, lire les résultats par classe avant les moyennes macro, micro ou pondérées. En tri, les indicateurs industriels de pureté et de récupération peuvent être calculés en masse ; le comptage d’objets ci-dessus n’en est pas une mesure directe.
Déplacer le seuil change les erreurs
Atelier distinct : 20 objets fictifs, dont 8 PET. Les scores sont fixés pour comparer les seuils sur le même lot. Un score n’est pas nécessairement une probabilité calibrée.
Le seuil se règle sur la validation, selon les conséquences des erreurs. Le test final reste indépendant. ROC représente le rappel contre le taux de faux positifs ; précision-rappel montre directement le compromis utile lorsque la classe positive est rare. Une aire sous une courbe ne remplace pas le choix du point de fonctionnement.
Piège du déséquilibre : 10 défauts sur 1 000 pièces. Annoncer toujours « conforme » donne 99 % d’exactitude, mais 0 % de rappel des défauts.
Régression : des erreurs avec des unités
Résistances mesurées : 30, 32, 34 MPa. Prédictions : 31, 30, 37 MPa. Avec la convention erreur = prédiction − mesure, les écarts sont +1, −2, +3 MPa.
- MAE : moyenne des valeurs absolues,
(1 + 2 + 3) / 3 = 2 MPa. - RMSE : racine de la moyenne des carrés,
√[(1² + 2² + 3²) / 3] ≈ 2,16 MPa. Les grandes erreurs pèsent davantage. - Biais moyen :
(1 − 2 + 3) / 3 ≈ +0,67 MPa. Des erreurs opposées peuvent se compenser : un biais nul ne garantit pas des erreurs faibles.
La référence constante 32 MPa obtient ici une MAE de 1,33 MPa : notre modèle d’exemple ne la bat pas. Trois observations ne suffisent pas pour qualifier un outil ; regarder aussi les résidus selon la plage, le site et le temps.
Valider sans se raconter une histoire
- Entraînement : ajuster les paramètres. Validation : choisir les réglages et le seuil. Test : évaluer une fois les choix fixés.
- Séparer selon le futur usage : par objet, lot, site ou date. Deux photos du même objet réparties au hasard peuvent créer une fuite d’information.
- Ajuster normalisation, sélection de variables et autres transformations sur l’entraînement seulement. La validation croisée ne répare pas une fuite mal conçue.
- Comparer au même budget et sur les mêmes cas : règle métier, moyenne, calcul physique, solveur ou pratique actuelle.
- Un intervalle étroit ne corrige ni un échantillon biaisé ni une dérive de domaine.
80 % sur combien de cas ?
16 succès sur 20 donnent un intervalle de Wilson à 95 % d’environ 58–92 %. 1 600 sur 2 000 donnent environ 78–82 %. Ces intervalles supposent des essais de Bernoulli indépendants à probabilité constante ; des images corrélées du même objet ne valent pas autant d’essais indépendants. Le niveau 95 % décrit la couverture de la procédure répétée, pas une probabilité fréquentiste attribuée au paramètre fixe après observation.
Calibration, corrélation, causalité
Parmi les cas auxquels on attribue 80 % de probabilité, environ 80 % devraient être positifs si la calibration est bonne sur ce domaine. Bien classer et bien calibrer sont deux propriétés différentes. Une corrélation prédictive n’établit pas la cause ; modifier une variable peut ne pas produire l’effet attendu.
La métrique suit la décision
- Segmentation : IoU = intersection / union des masques ; Dice = deux fois l’intersection / somme des tailles. Compléter par les petits défauts critiques manqués.
- Groupes : stabilité, pertinence métier, sensibilité à l’échelle des variables ; un bon score interne ne prouve pas des catégories naturelles.
- Langage : exactitude factuelle, omissions, fidélité aux sources, erreurs de calcul, abstention, coût et temps de vérification.
- Robotique et renforcement : réussite réelle, contraintes violées, dommages, robustesse et coût des essais ; le retour cumulé seul peut récompenser le mauvais comportement.
- Substitution et simulation : erreur sur cas nouveaux, incertitude, respect physique et confirmation des décisions par des mesures réelles.
Sources pour aller plus loin
Définitions et conventions des métriques · Calibration · Validation croisée et séparation des données · NIST : intervalles pour une proportion.