TATECHATLAS
◎ Français
Mathématiques et modèles

Évaluer les intervalles de prédiction avec la couverture empirique et la largeur

Les intervalles de prédiction visent à contenir des observations individuelles futures, tandis que les intervalles de confiance ciblent une moyenne ou un autre paramètre, et les deux ne sont pas interchangeables. La couverture empirique est la fraction tenue de côté à l'intérieur de l'intervalle et la largeur est la distance entre les limites de quantile ; un exemple construit à cinq valeurs donne 80 pour cent de couverture et une largeur moyenne de 1,8.

Dans ce guide

Un intervalle de prédiction est une plage destinée à contenir une future observation individuelle avec une probabilité donnée, tandis qu'un intervalle de confiance est une plage pour un paramètre inconnu tel qu'une moyenne conditionnelle. Les deux ne sont pas interchangeables car ils répondent à des questions différentes et ont des largeurs différentes. La couverture empirique est la fraction des observations tenues de côté qui tombent à l'intérieur de l'intervalle prédit, et la largeur de l'intervalle est la distance entre les limites de quantile inférieur et supérieur. Un petit échantillon illustratif avec des valeurs réalisées [2,5,8,4,10] et des intervalles [(1,3),(4,6),(6,7),(3,5),(9,11)] donne quatre à l'intérieur et un à l'extérieur, donc la couverture empirique est 4/5 = 80 pour cent, et les largeurs [2,2,1,2,2] ont une moyenne de 1,8. Cet échantillon construit n'est qu'une illustration de l'arithmétique, pas une étude de calibration ni un benchmark scikit-learn. Dans scikit-learn, la régression quantile peut produire des intervalles de prédiction en ajustant des modèles séparés à des niveaux de quantile complémentaires, par exemple alpha=0,05 et alpha=0,95 pour former un intervalle à 90 pour cent. L'exemple de régression quantile de scikit-learn montre que les modèles de quantile à 5 pour cent et 95 pour cent sont utilisés pour définir un intervalle central, et l'exemple de gradient boosting quantile montre la même idée avec GradientBoostingRegressor utilisant loss='quantile' et alpha réglé à 0,05, 0,5 et 0,95. La source montre aussi que la calibration doit être vérifiée sur des données tenues de côté car la couverture d'entraînement peut être proche du niveau nominal tandis que la couverture de test peut être plus faible. Dans l'exemple de gradient boosting, la couverture d'entraînement est d'environ 0,903 tandis que la couverture de test est d'environ 0,796, et un intervalle de confiance bootstrap pour la couverture de test est rapporté comme se situant entre 73,8 pour cent et 84,4 pour cent. Cet écart illustre que la couverture nominale n'est pas une garantie individuelle et que la largeur de l'intervalle peut être trop étroite sur de nouvelles données. Les modèles quantile peuvent aussi se croiser, ce qui signifie que la prédiction de quantile inférieur peut dépasser celle du supérieur pour certaines entrées, ce qui brise l'interprétation de l'intervalle. La couverture peut aussi varier entre sous-groupes, donc un seul nombre de couverture global peut masquer des performances médiocres dans des segments importants. Lors du choix du niveau nominal, décidez si le but est un intervalle central tel que 90 pour cent ou une borne unilatérale, et rappelez que le niveau nominal se réfère à la fréquence à long terme sur de nombreuses observations futures, pas à une promesse sur un cas unique. Pour compter la couverture sur données tenues de côté, comparez chaque observation tenue de côté avec ses limites inférieure et supérieure prédites et calculez la proportion où l'observation se trouve entre elles. Pour mesurer la largeur, soustrayez la limite inférieure de la limite supérieure pour chaque cas et résumez avec la moyenne ou un percentile, tout en notant que des intervalles plus étroits ne sont meilleurs que si la couverture reste acceptable. Une comparaison pratique utile est d'examiner la largeur à un niveau de couverture réellement atteint sur des données tenues de côté, car un intervalle excessivement étroit qui manque son objectif nominal n'est pas utile même s'il semble efficace. La validation doit garder l'entraînement et l'évaluation séparés pour éviter les fuites, et l'estimation quantile pour des niveaux extrêmes peut être instable car très peu d'observations informent les queues. La principale limitation est que la couverture empirique sur un petit ensemble tenu de côté est bruyante, que le croisement des quantiles et la variation entre sous-groupes peuvent fausser l'interprétation, et que les nombres illustratifs ici sont hypothétiques et non des résultats observés d'un pipeline exécuté.

Déclarer ce que l'intervalle prédit

Un intervalle de prédiction est destiné à contenir une future observation individuelle avec une probabilité donnée, tandis qu'un intervalle de confiance est destiné à contenir un paramètre inconnu tel qu'une moyenne conditionnelle. Cette distinction importe car les deux intervalles répondent à des questions différentes et sont généralement de largeurs différentes. L'intervalle de prédiction doit tenir compte à la fois de l'incertitude sur le signal sous-jacent et de la variabilité d'une nouvelle observation autour de ce signal, alors qu'un intervalle de confiance pour une moyenne ne reflète que l'incertitude sur le centre estimé. Dans l'exemple de régression quantile de scikit-learn, les modèles de quantile à 5 pour cent et 95 pour cent sont utilisés pour former un intervalle central pour les observations, et la documentation cadre cela comme la création d'intervalles de prédiction plutôt que d'intervalles pour une moyenne. L'exemple de gradient boosting quantile fait le même point en entraînant des régresseurs quantile séparés et en utilisant les modèles à 0,05 et 0,95 pour définir un intervalle prédit à 90 pour cent. Les valeurs illustratives [2,5,8,4,10] avec les intervalles [(1,3),(4,6),(6,7),(3,5),(9,11)] sont utilisées ici seulement pour montrer l'arithmétique de vérification de l'appartenance d'une observation à une plage prédite. Elles ne sont pas une preuve concernant un modèle ajusté.

Choisir le niveau nominal

Le niveau nominal est la probabilité de couverture cible à long terme, telle que 90 pour cent pour un intervalle central formé par les quantiles 0,05 et 0,95. Le choisir dépend du problème de décision, pas seulement des données. Un intervalle central est courant quand on veut borner la plupart des observations futures, tandis qu'une borne unilatérale peut être plus appropriée quand seule une limite supérieure ou inférieure importe. L'exemple de gradient boosting quantile de scikit-learn dit explicitement que les modèles pour alpha=0,05 et alpha=0,95 produisent un intervalle à 90 pour cent de couverture car 95 pour cent moins 5 pour cent égale 90 pour cent. L'exemple de régression quantile utilise de même 0,05 et 0,95 pour définir un intervalle central à 90 pour cent et identifier les observations hors de cette région centrale. La mise en garde clé est que la couverture nominale n'est pas une garantie individuelle. Un intervalle à 90 pour cent ne signifie pas qu'une observation spécifique a 90 pour cent de chance d'être à l'intérieur de la plage calculée d'une manière qui outrepasserait les hypothèses et la calibration du modèle. L'échantillon illustratif utilise un objectif nominal qui n'est pas énoncé comme une propriété du modèle ajusté ; la couverture empirique de 80 pour cent là-bas n'est que le résultat du comptage de quatre à l'intérieur et un à l'extérieur dans un petit ensemble construit.

Compter la couverture sur données tenues de côté

La couverture sur données tenues de côté est la proportion des observations précédemment non vues qui tombent entre les limites inférieure et supérieure prédites. Pour la calculer, comparez chaque observation tenue de côté avec son intervalle correspondant et comptez les cas où l'observation est supérieure ou égale à la limite inférieure et inférieure ou égale à la limite supérieure, puis divisez par le nombre de cas tenus de côté. L'exemple de gradient boosting quantile met en œuvre cette idée directement avec une fonction coverage_fraction qui renvoie la moyenne du ET logique des deux conditions de comparaison. Dans cet exemple, la couverture d'entraînement est rapportée comme environ 0,903, tandis que la couverture de test est rapportée comme environ 0,796, et un intervalle de confiance bootstrap pour la couverture de test est rapporté comme se situant entre 73,8 pour cent et 84,4 pour cent. Ces nombres montrent que la calibration peut paraître bonne sur les données d'entraînement et rester trop optimiste sur les données tenues de côté. L'échantillon illustratif suit la même logique de comptage : quatre des cinq valeurs tombent à l'intérieur de leurs intervalles, donc la couverture empirique est 4/5, soit 80 pour cent. Ce calcul n'est qu'une démonstration de la définition, pas un résultat d'évaluation de modèle.

Mesurer la largeur de l'intervalle

La largeur de l'intervalle est généralement mesurée comme la différence entre les limites de quantile supérieur et inférieur pour chaque cas. Un résumé tel que la largeur moyenne ou un percentile élevé des largeurs peut être utilisé pour comparer des méthodes, mais la largeur doit être jugée avec la couverture plutôt que seule. Des intervalles plus étroits ne sont meilleurs que si'ils atteignent encore une couverture acceptable sur des données tenues de côté. Dans l'échantillon illustratif, les largeurs sont [2,2,1,2,2], et la largeur moyenne est 1,8. Ce nombre est calculé directement à partir des cinq paires d'intervalles et est indépendant de tout ajustement de modèle. Les exemples de scikit-learn ne rapportent pas un seul nombre de largeur de la même manière, mais ils montrent que la distance entre les prédictions à 0,05 et 0,95 définit l'intervalle prédit et que cette distance peut changer avec l'entrée, notamment sous un bruit hétéroscédastique. L'exemple de régression quantile note que avec une variance de bruit croissante, l'intervalle entre les quantiles à 5 pour cent et 95 pour cent devient plus large à mesure que x augmente. Ce comportement est une raison pour laquelle une largeur moyenne unique peut être trompeuse si la largeur de l'intervalle varie beaucoup dans l'espace des entrées.

Travailler avec cinq observations

L'échantillon illustratif contient cinq valeurs réalisées [2,5,8,4,10] et cinq intervalles correspondants [(1,3),(4,6),(6,7),(3,5),(9,11)]. Vérification de chaque cas : la première valeur 2 est à l'intérieur de (1,3) ; la deuxième valeur 5 est à l'intérieur de (4,6) ; la troisième valeur 8 est à l'extérieur de (6,7) ; la quatrième valeur 4 est à l'intérieur de (3,5) ; et la cinquième valeur 10 est à l'intérieur de (9,11). Cela donne quatre à l'intérieur et un à l'extérieur, donc la couverture empirique est 4/5 = 0,80, soit 80 pour cent. Les largeurs sont 3 moins 1 égale 2, 6 moins 4 égale 2, 7 moins 6 égale 1, 5 moins 3 égale 2, et 11 moins 9 égale 2, donc la liste des largeurs est [2,2,1,2,2] et la largeur moyenne est 1,8. Ceci est un exemple entièrement construit, donc il doit être lu comme une vérification de définition plutôt que comme une affirmation sur un modèle ou un jeu de données réel. Il montre aussi pourquoi un seul nombre de couverture peut masquer des détails : un échec sur cinq observations change le résultat de 20 points de pourcentage, ce qui est une grande oscillation pour un tel petit échantillon.

Comparer la largeur à une couverture utile

Une comparaison pratique demande si un intervalle est assez étroit pour être utile tout en atteignant encore une couverture réellement observée sur des données tenues de côté. Un intervalle trop étroit peut paraître efficace mais échouer à son objectif de couverture, tandis qu'un intervalle très large peut atteindre la couverture facilement mais fournir peu de guidance. L'exemple de gradient boosting quantile illustre ce compromis en montrant que les modèles ajustés améliorent la forme de l'intervalle mais produisent encore une couverture de test inférieure au nominal de 90 pour cent, avec un intervalle bootstrap pour la couverture de test entre 73,8 pour cent et 84,4 pour cent. Cela signifie que l'intervalle n'atteint pas de manière fiable son objectif nominal sur les données tenues de côté, même si la couverture d'entraînement est proche de 90 pour cent. Quand on compare des méthodes, il est donc plus informatif de rapporter à la fois la couverture et la largeur sur le même ensemble tenu de côté, et de vérifier si la couverture atteinte est acceptable pour l'usage prévu. L'échantillon illustratif est trop petit pour soutenir une comparaison significative largeur-contre-couverture, mais il montre l'idée de base : la largeur moyenne est 1,8 et la couverture empirique est 80 pour cent, donc toute affirmation que les intervalles sont bons doit être jugée par rapport à un objectif nominal et un ensemble tenu de côté plus grand.

Vérifier la validation et les fuites

La couverture et la largeur doivent être évaluées sur des données qui n'ont pas été utilisées pour ajuster les modèles quantile, car l'utilisation de l'ensemble d'entraînement peut faire paraître la calibration meilleure qu'elle ne l'est réellement. Une fuite peut survenir si les mêmes observations influencent à la fois les courbes quantile ajustées et l'évaluation, ou si l'évaluation utilise une information qui ne serait pas disponible au moment de la prédiction. L'exemple de gradient boosting quantile sépare les données d'entraînement et de test et rapporte des valeurs de couverture différentes pour chacune, ce qui est la bonne structure pour vérifier la calibration. Il utilise aussi un réglage validé par cross-validation pour le modèle de quantile à 0,05 et rapporte que les modèles réglés améliorent l'intervalle à 90 pour cent, mais il trouve encore que la couverture de test est inférieure au niveau nominal. L'exemple de régression quantile évalue de même la performance hors échantillon avec cross-validation lors de la comparaison de QuantileRegressor et LinearRegression. Le point de prudence est que les estimations quantile pour des niveaux extrêmes peuvent être instables car elles dépendent d'observations relativement peu nombreuses, et cette instabilité peut être amplifiée si l'évaluation n'est pas correctement séparée de l'entraînement. L'échantillon illustratif n'implique ni ajustement ni fuite, mais il montre encore pourquoi un petit ensemble tenu de côté peut produire des estimations de couverture volatiles.

Expliquer les limites de la calibration

La calibration ici signifie que la fraction des observations tenues de côté à l'intérieur de l'intervalle prédit est proche du niveau nominal en moyenne. Une bonne calibration sur un jeu de données ne garantit pas une bonne calibration sur un autre, et une calibration moyenne peut masquer des variations entre sous-groupes ou entre régions de l'espace des entrées. L'exemple de gradient boosting quantile rapporte une couverture d'entraînement proche de 0,903 et une couverture de test proche de 0,796, et il dit explicitement que l'intervalle estimé est trop étroit pour couvrir 90 pour cent des points de test. Il rapporte aussi un intervalle de confiance bootstrap pour la couverture de test entre 73,8 pour cent et 84,4 pour cent, ce qui quantifie l'incertitude de l'estimation tenue de côté. Deux autres limites méritent d'être énoncées. Premièrement, les prédictions quantile peuvent se croiser, donc la prédiction inférieure peut dépasser la supérieure pour certaines entrées, ce qui brise l'interprétation de l'intervalle. Deuxièmement, la couverture peut varier entre sous-groupes, donc un seul nombre de couverture global peut ne pas refléter les performances là où cela importe le plus. L'échantillon illustratif ne présente ni croisement ni analyse de sous-groupes, mais il montre que la couverture empirique n'est qu'une proportion issue d'un ensemble fini et ne doit pas être traitée comme une garantie précise à long terme.

Points à vérifier

  • Confirmer si l'intervalle est destiné à une observation future ou à un paramètre moyen avant d'interpréter la couverture.
  • Vérifier que les prédictions de quantile inférieur et supérieur sont calculées à partir de modèles séparés ou d'une méthode qui préserve l'ordre.
  • Vérifier que la couverture est calculée sur des données tenues de côté, pas sur l'ensemble d'entraînement utilisé pour ajuster les modèles quantile.
  • Inspecter si les prédictions quantile se croisent pour certaines entrées, ce qui invaliderait la sémantique de l'intervalle.
  • Examiner si la couverture est stable entre des sous-groupes significatifs plutôt que de se fier uniquement à une fraction globale unique.
  • Traiter l'exemple à cinq valeurs comme une illustration arithmétique seulement, pas comme une preuve de la qualité du modèle ou des performances de scikit-learn.

L'exemple à cinq valeurs est construit pour l'illustration et ne constitue pas une étude de calibration ni un résultat de benchmark. La couverture empirique et la largeur calculées à partir d'un petit ensemble tenu de côté sont bruyantes et peuvent induire en erreur si présentées comme des estimations précises. La couverture nominale décrit la fréquence à long terme sur de nombreuses observations futures, pas une garantie pour une observation unique. Les modèles quantile peuvent se croiser, et la couverture peut varier entre sous-groupes, donc un seul nombre global peut masquer des performances médiocres dans des segments spécifiques. Les extraits de scikit-learn décrivent des méthodes et montrent des nombres de couverture exemple, mais les valeurs concrètes de couverture de test là-bas proviennent de la configuration synthétique et des choix de modélisation de cet exemple, pas d'une propriété universelle de la régression quantile. Les quantiles extrêmes sont estimés à partir d'observations relativement peu nombreuses et peuvent être instables. Cette réponse utilise uniquement les sources primaires fournies et les nombres illustratifs spécifiés ; elle n'ajoute pas de tests exécutés ni de résultats de récupération observés.

Sources

  1. scikit-learn: prediction intervals ↗
  2. scikit-learn: quantile regression ↗
Retour en haut ↑