Métriques de classification d’un modèle
Estimation
Résultat
Le calcul est effectué dans votre navigateur. Les valeurs saisies ne sont pas envoyées à un serveur distant.
À retenir : cette estimation est calculée dans votre navigateur. Les valeurs saisies ne sont pas envoyées à un serveur distant.
Pourquoi utiliser ce calculateur ?
Évaluer un modèle de classification demande plus qu’un taux de réussite global. Un système peut sembler performant tout en produisant trop de faux positifs, en manquant une partie des cas importants ou en étant favorisé par une classe beaucoup plus nombreuse que l’autre. Ce calculateur part de quatre effectifs issus d’une matrice de confusion pour calculer la précision, le rappel, le score F1 et l’exactitude globale. Les vrais positifs, faux positifs et faux négatifs sont nécessaires ; les vrais négatifs sont facultatifs, mais leur ajout permet de calculer une exactitude globale plus représentative. L’outil sert à comparer des versions d’un modèle sur le même jeu de test et à comprendre quel compromis est réellement mesuré.
Formule utilisée
La précision est vrais positifs ÷ (vrais positifs + faux positifs). Le rappel est vrais positifs ÷ (vrais positifs + faux négatifs). Le score F1 est la moyenne harmonique de la précision et du rappel : 2 × précision × rappel ÷ (précision + rappel). L’exactitude globale est (vrais positifs + vrais négatifs) ÷ (vrais positifs + faux positifs + faux négatifs + vrais négatifs). Le champ des vrais négatifs vide vaut zéro. Les résultats de taux sont affichés en pourcentage.
Comment lire le résultat
Comptez les prédictions du modèle dans la matrice de confusion, en conservant la même classe positive et le même jeu d’évaluation. Un vrai positif est un cas positif correctement détecté ; un faux positif est une alerte positive erronée ; un faux négatif est un cas positif manqué. Les vrais négatifs correspondent aux cas négatifs correctement écartés. La précision répond à la question « parmi les alertes, combien sont justes ? », tandis que le rappel répond à « parmi les cas positifs, combien ont été retrouvés ? ». Le score F1 résume ces deux dimensions lorsqu’elles doivent rester équilibrées. L’exactitude nécessite les quatre cases et peut être trompeuse si les classes sont très déséquilibrées.
Exemple
Sur un jeu de test contenant 1 000 cas, un modèle obtient 80 vrais positifs, 20 faux positifs, 10 faux négatifs et 890 vrais négatifs. La précision est de 80 %, le rappel de 88,89 %, le score F1 d’environ 84,21 % et l’exactitude globale de 97 %. L’exactitude paraît très élevée parce que les vrais négatifs sont nombreux ; le rappel et la précision donnent une lecture plus utile des alertes positives.
Hypothèses du calcul
Les quatre effectifs sont non négatifs et proviennent de la même évaluation. Les catégories positive et négative sont définies avant le comptage. Les effectifs facultatifs de vrais négatifs vides valent zéro. Les résultats sont des ratios descriptifs et non des probabilités garanties sur de nouvelles données. Les dénominateurs doivent être non nuls pour que les indicateurs aient un sens.
Limites
Ces métriques ne résument pas à elles seules la qualité d’un modèle. Elles ne tiennent pas compte du coût différent d’une erreur, du seuil de décision, de la calibration, de la distribution future des données ni de la dérive. Un score F1 peut masquer une précision insuffisante pour un usage sensible, et l’exactitude peut être trompeuse sur une classe rare. Pour une mise en production, analysez aussi les résultats par segment et définissez les conséquences opérationnelles de chaque erreur.
Erreurs fréquentes
Ne confondez pas précision et exactitude globale. Vérifiez quelle classe est considérée comme positive avant d’interpréter le rappel. Ne mélangez pas les effectifs d’entraînement avec ceux du jeu de test. Enfin, n’utilisez pas une valeur de vrais négatifs oubliée comme zéro si vous voulez comparer l’exactitude de deux modèles : les quatre cases doivent couvrir la même population.