Vorhersageintervalle mit empirischer Abdeckung und Breite evaluieren
Vorhersageintervalle sollen zukünftige Einzelbeobachtungen enthalten, während Konfidenzintervalle einen Mittelwert oder anderen Parameter treffen, und die beiden sind nicht austauschbar. Empirische Abdeckung ist der gehaltene Anteil innerhalb des Intervalls und Breite ist der Abstand zwischen Quantilgrenzen; ein konstruiertes Fünf-Werte-Beispiel ergibt 80 Prozent Abdeckung und mittlere Breite 1.8.
Auf dieser Seite
Die kurze Antwort
Ein Vorhersageintervall ist ein Bereich, der eine zukünftige Einzelbeobachtung mit einer angegebenen Wahrscheinlichkeit enthalten soll, während ein Konfidenzintervall ein Bereich für einen unbekannten Parameter wie einen bedingten Mittelwert ist. Die beiden sind nicht austauschbar, weil sie unterschiedliche Fragen beantworten und unterschiedliche Breiten haben. Die empirische Abdeckung ist der Anteil der gehaltenen Beobachtungen, die innerhalb des vorhergesagten Intervalls liegen, und die Intervallbreite ist der Abstand zwischen den unteren und oberen Quantilgrenzen. Eine kleine illustrative Stichprobe mit Realisierten Werten [2,5,8,4,10] und Intervallen [(1,3),(4,6),(6,7),(3,5),(9,11)] ergibt vier innerhalb und einen außerhalb, also ist die empirische Abdeckung 4/5 = 80 Prozent, und die Breiten [2,2,1,2,2] betragen im Durchschnitt 1,8. Diese konstruierte Stichprobe ist nur eine Illustration der Arithmetik, keine Kalibrierungsstudie und kein scikit-learn-Benchmark. In scikit-learn kann Quantilregression Vorhersageintervalle erzeugen, indem separate Modelle bei komplementären Quantilniveaus angepasst werden, zum Beispiel alpha=0.05 und alpha=0.95 zur Bildung eines 90-prozentigen Intervalls. Das scikit-learn-Quantilregression-Beispiel zeigt, dass die 5- und 95-Prozent-Quantilmodelle verwendet werden, um ein zentrales Intervall zu definieren, und das Gradient-Boosting-Quantil-Beispiel zeigt dieselbe Idee mit GradientBoostingRegressor unter Verwendung von loss='quantile' und alpha auf 0.05, 0.5 und 0.95. Die Quelle zeigt auch, dass die Kalibrierung auf gehaltenen Daten überprüft werden muss, weil die Trainingsabdeckung nahe dem nominalen Niveau liegen kann, während die Testabdeckung niedriger sein kann. Im Gradient-Boosting-Beispiel beträgt die Trainingsabdeckung etwa 0.903, während die Testabdeckung etwa 0.796 beträgt, und ein Bootstrap-Konfidenzintervall für die Testabdeckung wird als zwischen 73.8 Prozent und 84.4 Prozent liegend gemeldet. Diese Lücke zeigt, dass die nominale Abdeckung keine individuelle Garantie ist und die Intervallbreite auf neuen Daten zu schmal sein kann. Quantilmodelle können sich auch kreuzen, was bedeutet, dass die untere Quantilvorhersage für einige Eingaben die obere überschreiten kann, was die Intervallinterpretation bricht. Die Abdeckung kann auch über Teilgruppen variieren, sodass eine einzige Gesamtabdeckungszahl eine schlechte Leistung in wichtigen Segmenten verbergen kann. Beim Wählen des nominalen Niveaus entscheiden Sie, ob das Ziel ein zentrales Intervall wie 90 Prozent oder eine einseitige Schranke ist, und bedenken Sie, dass das nominale Niveau sich auf die Langzeitfrequenz über viele zukünftige Beobachtungen bezieht, nicht auf ein Versprechen über einen einzelnen Fall. Um die gehaltene Abdeckung zu zählen, vergleichen Sie jede gehaltene Beobachtung mit ihren vorhergesagten unteren und oberen Grenzen und berechnen Sie den Anteil, bei dem die Beobachtung dazwischen liegt. Um die Breite zu messen, subtrahieren Sie die untere Grenze von der oberen Grenze für jeden Fall und fassen Sie mit dem Mittelwert oder einem Perzentil zusammen, wobei zu beachten ist, dass schmalere Intervalle nur besser sind, wenn die Abdeckung akzeptabel bleibt. Ein nützlicher praktischer Vergleich besteht darin, die Breite auf einem Abdeckungsniveau zu betrachten, das tatsächlich auf gehaltenen Daten erreicht wird, weil ein zu schmales Intervall, das sein nominales Ziel verfehlt, nicht nützlich ist, auch wenn es effizient aussieht. Die Validierung muss Training und Evaluation getrennt halten, um Leckage zu vermeiden, und die Quantilschätzung für extreme Niveaus kann instabil sein, weil sehr wenige Beobachtungen die Schwänze informieren. Die Hauptbegrenzung ist, dass die empirische Abdeckung auf einer kleinen gehaltenen Menge verrauscht ist, dass Quantilkreuzung und Teilgruppenvariation die Interpretation verzerren können und dass die illustrativen Zahlen hier hypothetisch sind und nicht von einer ausgeführten Pipeline beobachtete Ergebnisse.
Festlegen, was das Intervall vorhersagt
Ein Vorhersageintervall soll eine zukünftige Einzelbeobachtung mit einer angegebenen Wahrscheinlichkeit enthalten, während ein Konfidenzintervall einen unbekannten Parameter wie einen bedingten Mittelwert enthalten soll. Diese Unterscheidung ist wichtig, weil die beiden Intervalle unterschiedliche Fragen beantworten und üblicherweise unterschiedliche Breiten haben. Das Vorhersageintervall muss sowohl die Unsicherheit über das zugrundeliegende Signal als auch die Variabilität einer neuen Beobachtung um dieses Signal berücksichtigen, während ein Konfidenzintervall für einen Mittelwert nur die Unsicherheit über das geschätzte Zentrum widerspiegelt. Im scikit-learn-Quantilregression-Beispiel werden die 5- und 95-Prozent-Quantilmodelle verwendet, um ein zentrales Intervall für Beobachtungen zu bilden, und die Dokumentation stellt dies als Erstellung von Vorhersageintervallen dar, nicht als Intervalle für einen Mittelwert. Das Gradient-Boosting-Quantil-Beispiel macht denselben Punkt, indem es separate Quantilregressoren trainiert und die 0.05- und 0.95-Modelle verwendet, um ein vorhergesagtes 90-prozentiges Intervall zu definieren. Die illustrativen Werte [2,5,8,4,10] mit Intervallen [(1,3),(4,6),(6,7),(3,5),(9,11)] werden hier nur verwendet, um die Arithmetik der Überprüfung zu zeigen, ob eine Beobachtung in einem vorhergesagten Bereich liegt. Sie sind kein Beweis über ein angepasstes Modell.
Das nominale Niveau wählen
Das nominale Niveau ist die Ziel-Langzeit-Abdeckungswahrscheinlichkeit, wie zum Beispiel 90 Prozent für ein zentrales Intervall, das durch die 0.05- und 0.95-Quantile gebildet wird. Die Wahl hängt vom Entscheidungsproblem ab, nicht nur von den Daten. Ein zentrales Intervall ist üblich, wenn Sie die meisten zukünftigen Beobachtungen einschließen wollen, während eine einseitige Schranke angemessener sein kann, wenn nur eine obere oder untere Grenze wichtig ist. Das scikit-learn-Gradient-Boosting-Quantil-Beispiel sagt ausdrücklich, dass die Modelle für alpha=0.05 und alpha=0.95 ein 90-prozentiges Abdeckungsintervall erzeugen, weil 95 Prozent minus 5 Prozent gleich 90 Prozent ergibt. Das Quantilregression-Beispiel verwendet ebenfalls 0.05 und 0.95, um ein zentrales 90-prozentiges Intervall zu definieren und Beobachtungen außerhalb dieses zentralen Bereichs zu identifizieren. Der wichtige Hinweis ist, dass die nominale Abdeckung keine individuelle Garantie ist. Ein 90-prozentiges Intervall bedeutet nicht, dass eine spezifische Beobachtung eine 90-prozentige Chance hat, innerhalb des berechneten Bereichs zu liegen, auf eine Weise, die die Annahmen und Kalibrierung des Modells überschreibt. Die illustrative Stichprobe verwendet ein nominales Ziel, das nicht als Eigenschaft eines angepassten Modells angegeben ist; die 80-prozentige empirische Abdeckung dort ist nur das Ergebnis des Zählens von vier innerhalb und einem außerhalb in einer winzigen konstruierten Menge.
Gehaltene Abdeckung zählen
Die gehaltene Abdeckung ist der Anteil zuvor ungesehener Beobachtungen, die zwischen den vorhergesagten unteren und oberen Grenzen liegen. Um sie zu berechnen, vergleichen Sie jede gehaltene Beobachtung mit ihrem entsprechenden Intervall und zählen Sie die Fälle, in denen die Beobachtung größer oder gleich der unteren Grenze und kleiner oder gleich der oberen Grenze ist, und teilen Sie dann durch die Anzahl der gehaltenen Fälle. Das Gradient-Boosting-Quantil-Beispiel implementiert diese Idee direkt mit einer coverage_fraction-Funktion, die den Mittelwert der logischen UND der beiden Vergleichsbedingungen zurückgibt. In diesem Beispiel wird die Trainingsabdeckung mit etwa 0.903 gemeldet, während die Testabdeckung mit etwa 0.796 gemeldet wird, und ein Bootstrap-Konfidenzintervall für die Testabdeckung wird als zwischen 73.8 Prozent und 84.4 Prozent liegend gemeldet. Diese Zahlen zeigen, dass die Kalibrierung auf Trainingsdaten gut aussehen kann und dennoch auf gehaltenen Daten zu optimistisch ist. Die illustrative Stichprobe folgt derselben Zähllogik: vier der fünf Werte liegen innerhalb ihrer Intervalle, also ist die empirische Abdeckung 4/5, oder 80 Prozent. Diese Berechnung ist nur eine Demonstration der Definition, kein Modellbewertungsergebnis.
Intervallbreite messen
Die Intervallbreite wird üblicherweise als der Unterschied zwischen den oberen und unteren Quantilgrenzen für jeden Fall gemessen. Eine Zusammenfassung wie die mittlere Breite oder ein hohes Perzentil der Breiten kann verwendet werden, um Methoden zu vergleichen, aber die Breite sollte zusammen mit der Abdeckung beurteilt werden, nicht allein. Schmalere Intervalle sind nur besser, wenn sie auf gehaltenen Daten weiterhin eine akzeptable Abdeckung erreichen. In der illustrativen Stichprobe sind die Breiten [2,2,1,2,2], und die mittlere Breite ist 1.8. Diese Zahl wird direkt aus den fünf Intervallpaaren berechnet und ist unabhängig von einer Modellanpassung. Die scikit-learn-Beispiele melden keine einzelne Breitenzahl auf dieselbe Weise, aber sie zeigen, dass der Abstand zwischen den 0.05- und 0.95-Vorhersagen das vorhergesagte Intervall definiert und dass dieser Abstand mit der Eingabe variieren kann, besonders unter heteroskedastischem Rauschen. Das Quantilregression-Beispiel merkt an, dass bei zunehmender Rauschvarianz das Intervall zwischen den 5- und 95-Quantilen mit zunehmendem x breiter wird. Dieses Verhalten ist ein Grund, warum eine einzige mittlere Breite irreführend sein kann, wenn die Intervallbreite über den Eingaberaum stark variiert.
Fünf Beobachtungen durchrechnen
Die illustrative Stichprobe enthält fünf Realisierte Werte [2,5,8,4,10] und fünf entsprechende Intervalle [(1,3),(4,6),(6,7),(3,5),(9,11)]. Überprüfung jedes Falls: der erste Wert 2 liegt innerhalb (1,3); der zweite Wert 5 liegt innerhalb (4,6); der dritte Wert 8 liegt außerhalb (6,7); der vierte Wert 4 liegt innerhalb (3,5); und der fünfte Wert 10 liegt innerhalb (9,11). Das ergibt vier innerhalb und einen außerhalb, also ist die empirische Abdeckung 4/5 = 0.80, oder 80 Prozent. Die Breiten sind 3 minus 1 gleich 2, 6 minus 4 gleich 2, 7 minus 6 gleich 1, 5 minus 3 gleich 2, und 11 minus 9 gleich 2, also ist die Breitenliste [2,2,1,2,2] und die mittlere Breite ist 1.8. Dies ist ein vollständig konstruiertes Beispiel, also sollte es als Definitionsüberprüfung gelesen werden, nicht als Behauptung über ein echtes Modell oder Datensatz. Es zeigt auch, warum eine einzige Abdeckungszahl Details verbergen kann: ein Fehlschlag in fünf Beobachtungen verändert das Ergebnis um 20 Prozentpunkte, was für so eine kleine Stichprobe ein großer Schwank ist.
Breite bei nützlicher Abdeckung vergleichen
Ein praktischer Vergleich fragt, ob ein Intervall schmal genug ist, um nützlich zu sein, während es weiterhin eine Abdeckung erreicht, die tatsächlich auf gehaltenen Daten beobachtet wird. Ein zu schmales Intervall kann effizient aussehen, aber sein Abdeckungsziel verfehlen, während ein sehr breites Intervall die Abdeckung leicht erreichen kann, aber wenig Anleitung bietet. Das Gradient-Boosting-Quantil-Beispiel illustriert diesen Trade-off, indem es zeigt, dass die abgestimmten Modelle die Intervallform verbessern, aber weiterhin eine Testabdeckung unter dem nominalen 90 Prozent erzeugen, mit einem Bootstrap-Intervall für die Testabdeckung zwischen 73.8 Prozent und 84.4 Prozent. Das bedeutet, dass das Intervall auf gehaltenen Daten sein nominales Ziel nicht zuverlässig erreicht, obwohl die Trainingsabdeckung nahe 90 Prozent liegt. Beim Vergleichen von Methoden ist es daher informativer, sowohl Abdeckung als auch Breite auf demselben gehaltenen Satz zu melden und zu prüfen, ob die erreichte Abdeckung für die beabsichtigte Verwendung akzeptabel ist. Die illustrative Stichprobe ist zu klein, um einen sinnvollen Breite-gegen-Abdeckung-Vergleich zu unterstützen, aber sie zeigt die grundlegende Idee: die mittlere Breite ist 1.8 und die empirische Abdeckung ist 80 Prozent, also sollte jede Behauptung, dass die Intervalle gut sind, gegen ein nominales Ziel und einen größeren gehaltenen Satz beurteilt werden.
Validierung und Leckage überprüfen
Abdeckung und Breite müssen auf Daten evaluiert werden, die nicht zur Anpassung der Quantilmodelle verwendet wurden, weil die Verwendung des Trainingssatzes die Kalibrierung besser aussehen lassen kann als sie wirklich ist. Leckage kann auftreten, wenn dieselben Beobachtungen sowohl die angepassten Quantilkurven als auch die Evaluation beeinflussen, oder wenn die Evaluation Informationen verwendet, die zur Vorhersagezeit nicht verfügbar wären. Das Gradient-Boosting-Quantil-Beispiel trennt Trainings- und Testdaten und meldet unterschiedliche Abdeckungswerte für jeden, was die richtige Struktur zur Überprüfung der Kalibrierung ist. Es verwendet auch cross-validated Abstimmung für das 0.05-Quantilmodell und meldet, dass die abgestimmten Modelle das 90-prozentige Intervall verbessern, aber es findet weiterhin, dass die Testabdeckung unter dem nominalen Niveau liegt. Das Quantilregression-Beispiel evaluiert ebenfalls die Out-of-Sample-Performance mit Cross-Validation beim Vergleichen von QuantileRegressor und LinearRegression. Der Warnhinweis ist, dass Quantilschätzungen für extreme Niveaus instabil sein können, weil sie von relativ wenigen Beobachtungen abhängen, und diese Instabilität kann verstärkt werden, wenn die Evaluation nicht ordnungsgemäß vom Training getrennt ist. Die illustrative Stichprobe beinhaltet keine Anpassung oder Leckage, aber sie zeigt weiterhin, warum eine kleine gehaltene Menge volatile Abdeckungsschätzungen erzeugen kann.
Kalibrierungslimits erklären
Kalibrierung bedeutet hier, dass der Anteil gehaltener Beobachtungen innerhalb des vorhergesagten Intervalls im Durchschnitt nahe dem nominalen Niveau liegt. Gute Kalibrierung auf einem Datensatz garantiert keine gute Kalibrierung auf einem anderen, und durchschnittliche Kalibrierung kann Variation über Teilgruppen oder über Regionen des Eingaberaums verbergen. Das Gradient-Boosting-Quantil-Beispiel meldet eine Trainingsabdeckung nahe 0.903 und eine Testabdeckung nahe 0.796, und es sagt ausdrücklich, dass das geschätzte Intervall zu schmal ist, um 90 Prozent der Testpunkte abzudecken. Es meldet auch ein Bootstrap-Konfidenzintervall für die Testabdeckung zwischen 73.8 Prozent und 84.4 Prozent, das die Unsicherheit in der gehaltenen Schätzung quantifiziert. Zwei weitere Limits sind wert, zu nennen. Erstens können Quantilvorhersagen sich kreuzen, sodass die untere Vorhersage die obere für einige Eingaben überschreiten kann, was die Intervallinterpretation bricht. Zweitens kann die Abdeckung über Teilgruppen variieren, sodass eine einzige Gesamtabdeckungszahl die Leistung dort nicht widerspiegeln kann, wo sie am wichtigsten ist. Die illustrative Stichprobe zeigt weder Kreuzung noch Teilgruppenanalyse, aber sie zeigt, dass die empirische Abdeckung nur ein Anteil aus einer endlichen Menge ist und nicht als präzise Langzeitgarantie behandelt werden sollte.
Was Sie prüfen sollten
- Stellen Sie fest, ob das Intervall für eine zukünftige Beobachtung oder für einen Mittelwertparameter bestimmt ist, bevor Sie die Abdeckung interpretieren.
- Verifizieren Sie, dass untere und obere Quantilvorhersagen aus separaten Modellen oder einer Methode berechnet werden, die die Reihenfolge bewahrt.
- Prüfen Sie, ob die Abdeckung auf gehaltenen Daten berechnet wird, nicht auf dem Trainingssatz, der zur Anpassung der Quantilmodelle verwendet wurde.
- Untersuchen Sie, ob Quantilvorhersagen für irgendeine Eingabe kreuzen, was die Intervallsemantik ungültig machen würde.
- Überprüfen Sie, ob die Abdeckung über sinnvolle Teilgruppen stabil ist, anstatt nur auf einen einzigen Gesamtanteil zu vertrauen.
- Behandeln Sie das Fünf-Werte-Beispiel nur als arithmetische Illustration, nicht als Beweis für Modellqualität oder scikit-learn-Performance.
Geltungsbereich
Das Fünf-Werte-Beispiel ist zur Illustration konstruiert und stellt keine Kalibrierungsstudie oder ein Benchmark-Ergebnis dar. Empirische Abdeckung und Breite, die aus einer kleinen gehaltenen Menge berechnet werden, sind verrauscht und können irreführen, wenn sie als präzise Schätzungen dargestellt werden. Die nominale Abdeckung beschreibt die Langzeitfrequenz über viele zukünftige Beobachtungen, nicht eine Garantie für eine einzelne Beobachtung. Quantilmodelle können sich kreuzen, und die Abdeckung kann über Teilgruppen variieren, sodass eine einzige Gesamtzahl eine schlechte Leistung in spezifischen Segmenten verbergen kann. Die scikit-learn-Auszüge beschreiben Methoden und zeigen Beispielabdeckungszahlen, aber die konkreten Testset-Abdeckungswerte dort stammen aus dem synthetischen Setup und den Modellierungswahlen dieses Beispiels, nicht aus einer universellen Eigenschaft der Quantilregression. Extreme Quantilniveaus werden aus relativ wenigen Beobachtungen geschätzt und können instabil sein. Diese Antwort verwendet nur die bereitgestellten primären Quellen und die angegebenen illustrativen Zahlen; sie fügt keine ausgeführten Tests oder beobachteten Retrieval-Ergebnisse hinzu.