Оценка интервалов предсказания с эмпирическим покрытием и шириной
Интервалы предсказания предназначены для содержания будущих отдельных наблюдений, тогда как доверительные интервалы нацелены на среднее или другой параметр, и они не взаимозаменяемы. Эмпирическое покрытие - это доля вынесенных наблюдений внутри интервала, а ширина - расстояние между квантильными пределами; построенный пример из пяти значений дает 80 процентов покрытия и среднюю ширину 1.8.
В этом материале
Короткий ответ
Интервальное предсказание - это диапазон, предназначенный для содержания будущего отдельного наблюдения с заявленной вероятностью, тогда как доверительный интервал - это диапазон для неизвестного параметра, такого как условное среднее. Эти два понятия не взаимозаменяемы, потому что они отвечают на разные вопросы и имеют разную ширину. Эмпирическое покрытие - это доля вынесенных наблюдений, попадающих внутрь предсказанного интервала, а ширина интервала - это расстояние между нижним и верхним квантильными пределами. Небольшой иллюстративный пример со значениями [2,5,8,4,10] и интервалами [(1,3),(4,6),(6,7),(3,5),(9,11)] дает четыре попадания внутрь и одно снаружи, поэтому эмпирическое покрытие составляет 4/5 = 80 процентов, а ширины [2,2,1,2,2] в среднем 1.8. Этот построенный пример - лишь иллюстрация арифметики, а не исследование калибровки и не бенчмарк scikit-learn. В scikit-learn квантильная регрессия может порождать интервалы предсказания, подбирая отдельные модели на комплементарных уровнях квантилей, например alpha=0.05 и alpha=0.95 для формирования интервала 90 процентов. Пример квантильной регрессии в scikit-learn показывает, что модели квантилей 5 и 95 процентов используются для определения центрального интервала, а пример градиентного бустинга показывает ту же идею с GradientBoostingRegressor, loss='quantile' и alpha, установленным в 0.05, 0.5 и 0.95. Источник также показывает, что калибровку нужно проверять на вынесенных данных, потому что покрытие на обучающей выборке может быть близко к номинальному уровню, тогда как покрытие на тесте может быть ниже. В примере градиентного бустинга покрытие на обучении около 0.903, а на тесте около 0.796, и бутстреп-доверительный интервал для тестового покрытия сообщается как лежащий между 73.8 и 84.4 процентами. Этот разрыв иллюстрирует, что номинальное покрытие - не гарантия для отдельного наблюдения, и что ширина интервала может быть слишком узкой на новых данных. Квантильные модели также могут пересекаться, то есть предсказание нижнего квантиля может превышать верхний для некоторых входов, что нарушает интерпретацию интервала. Покрытие также может варьироваться по подгруппам, поэтому одно общее число покрытия может скрывать плохую производительность в важных сегментах. При выборе номинального уровня решите, является ли целью центральный интервал, например 90 процентов, или односторонняя граница, и помните, что номинальный уровень относится к частотности в долгосрочной перспективе по многим будущим наблюдениям, а не к обещанию для какого-либо отдельного случая. Чтобы подсчитать покрытие на вынесенных данных, сравните каждое вынесенное наблюдение с его предсказанными нижним и верхним пределами и вычислите долю случаев, где наблюдение лежит между ними. Чтобы измерить ширину, вычтите нижний предел из верхнего для каждого случая и обобщите средним или процентилем, при этом отметим, что более узкие интервалы лучше только если покрытие остается приемлемым. Полезное практическое сравнение - смотреть на ширину при уровне покрытия, который фактически достигается на вынесенных данных, потому что чрезмерно узкий интервал, не достигающий номинальной цели, не полезен, даже если он выглядит эффективным. Валидация должна отделять обучение и оценку, чтобы избежать утечки, а оценка квантилей для экстремальных уровней может быть нестабильной, потому что очень мало наблюдений информирует хвосты. Основное ограничение - что эмпирическое покрытие на малой вынесенной выборке шумно, что пересечение квантилей и вариация по подгруппам могут искажать интерпретацию, и что иллюстративные числа здесь гипотетические и не являются результатами выполненного конвейера.
Укажите, что предсказывает интервал
Интервал предсказания предназначен для содержания будущего отдельного наблюдения с заявленной вероятностью, тогда как доверительный интервал предназначен для содержания неизвестного параметра, такого как условное среднее. Это различие важно, потому что два интервала отвечают на разные вопросы и обычно имеют разную ширину. Интервал предсказания должен учитывать как неопределенность сигнала, так и изменчивость нового наблюдения вокруг этого сигнала, тогда как доверительный интервал для среднего отражает лишь неопределенность об оцененном центре. В примере квантильной регрессии в scikit-learn модели квантилей 5 и 95 процентов используются для формирования центрального интервала для наблюдений, и документация формулирует это как создание интервалов предсказания, а не интервалов для среднего. Пример градиентного бустинга делает ту же точку, обучая отдельные квантильные регрессоры и используя модели 0.05 и 0.95 для определения предсказанного интервала 90 процентов. Иллюстративные значения [2,5,8,4,10] с интервалами [(1,3),(4,6),(6,7),(3,5),(9,11)] используются здесь только чтобы показать арифметику проверки, попадает ли наблюдение внутрь предсказанного диапазона. Они не являются доказательством относительно какой-либо подогнанной модели.
Выберите номинальный уровень
Номинальный уровень - это целевая вероятность покрытия в долгосрочной перспективе, например 90 процентов для центрального интервала, формируемого квантилями 0.05 и 0.95. Его выбор зависит от задачи принятия решений, а не только от данных. Центральный интервал распространен, когда нужно ограничить большинство будущих наблюдений, тогда как односторонняя граница может быть уместнее, когда важна только верхняя или нижняя граница. Пример градиентного бустинга в scikit-learn явно говорит, что модели для alpha=0.05 и alpha=0.95 порождают интервал покрытия 90 процентов, потому что 95 процентов минус 5 процентов равно 90 процентов. Пример квантильной регрессии аналогично использует 0.05 и 0.95 для определения центрального интервала 90 процентов и для выявления наблюдений вне этого центрального региона. Ключевое предостережение в том, что номинальное покрытие - не индивидуальная гарантия. Интервал 90 процентов не означает, что конкретное наблюдение имеет 90 процентов шансов оказаться внутри вычисленного диапазона таким образом, что это переопределяет предположения и калибровку модели. В иллюстративной выборке номинальная цель не сформулирована как свойство подогнанной модели; эмпирическое покрытие 80 процентов там - лишь результат подсчета четырех попаданий и одного промаха в крошечном построенном наборе.
Подсчитайте покрытие на вынесенных данных
Покрытие на вынесенных данных - это доля ранее невидимых наблюдений, попадающих между предсказанными нижним и верхним пределами. Чтобы вычислить его, сравните каждое вынесенное наблюдение с соответствующим интервалом и посчитайте случаи, где наблюдение больше или равно нижнему пределу и меньше или равно верхнему пределу, затем разделите на число вынесенных случаев. Пример градиентного бустинга реализует эту идею напрямую с помощью функции coverage_fraction, которая возвращает среднее от логического И двух условий сравнения. В этом примере покрытие на обучении сообщается как около 0.903, тогда как покрытие на тесте сообщается как около 0.796, и бутстреп-доверительный интервал для тестового покрытия сообщается как лежащий между 73.8 и 84.4 процентами. Эти числа показывают, что калибровка может выглядеть хорошо на обучающих данных и все же быть слишком оптимистичной на вынесенных данных. Иллюстративная выборка следует той же логике подсчета: четыре из пяти значений попадают внутрь своих интервалов, поэтому эмпирическое покрытие 4/5, или 80 процентов. Это вычисление - лишь демонстрация определения, а не результат оценки модели.
Измерьте ширину интервала
Ширина интервала обычно измеряется как разность между верхним и нижним квантильными пределами для каждого случая. Сводка, такая как средняя ширина или высокий процентиль ширин, может использоваться для сравнения методов, но ширину следует оценивать вместе с покрытием, а не отдельно. Более узкие интервалы лучше только если они все еще достигают приемлемого покрытия на вынесенных данных. В иллюстративной выборке ширины равны [2,2,1,2,2], а средняя ширина 1.8. Это число вычисляется напрямую из пяти пар интервалов и не зависит от подгонки любой модели. Примеры scikit-learn не сообщают одно число ширины таким же образом, но они показывают, что расстояние между предсказаниями 0.05 и 0.95 определяет предсказанный интервал и что это расстояние может меняться с входом, особенно при гетероскедастичном шум. Пример квантильной регрессии отмечает, что при увеличении дисперсии шума интервал между квантилями 5 и 95 процентов становится шире по мере роста x. Это поведение - одна из причин, почему одно среднее значение ширины может вводить в заблуждение, если ширина интервала сильно варьируется по пространству входов.
Разберите пять наблюдений
Иллюстративная выборка содержит пять реализованных значений [2,5,8,4,10] и пять соответствующих интервалов [(1,3),(4,6),(6,7),(3,5),(9,11)]. Проверка каждого случая: первое значение 2 попадает внутрь (1,3); второе значение 5 попадает внутрь (4,6); третье значение 8 снаружи (6,7); четвертое значение 4 попадает внутрь (3,5); и пятое значение 10 попадает внутрь (9,11). Это дает четыре попадания внутрь и один снаружи, поэтому эмпирическое покрытие 4/5 = 0.80, или 80 процентов. Ширины равны 3 минус 1 равно 2, 6 минус 4 равно 2, 7 минус 6 равно 1, 5 минус 3 равно 2, и 11 минус 9 равно 2, поэтому список ширин [2,2,1,2,2], а средняя ширина 1.8. Это полностью построенный пример, поэтому его следует читать как проверку определения, а не как утверждение о реальной модели или наборе данных. Он также показывает, почему одно число покрытия может скрывать детали: один промах из пяти наблюдений меняет результат на 20 процентных пунктов, что является большим колебанием для такого малого образца.
Сравните ширину при полезном покрытии
Практическое сравнение спрашивает, достаточно ли узок интервал, чтобы быть полезным, при этом достигая покрытия, которое фактически наблюдается на вынесенных данных. Интервал, слишком узкий, может выглядеть эффективным, но не достигнуть цели покрытия, тогда как очень широкий интервал может легко достичь покрытия, но дать мало руководства. Пример градиентного бустинга иллюстрирует эту компромиссную ситуацию, показывая, что подогнанные модели улучшают форму интервала, но все же дают тестовое покрытие ниже номинальных 90 процентов, с бутстреп-интервалом для тестового покрытия между 73.8 и 84.4 процентами. Это означает, что интервал не надежно достигает своей номинальной цели на вынесенных данных, хотя покрытие на обучении близко к 90 процентам. При сравнении методов поэтому информативнее сообщать и покрытие, и ширину на одном и том же вынесенном наборе, и проверять, приемлемо ли достигнутое покрытие для предполагаемого использования. Иллюстративная выборка слишком мала, чтобы поддержать осмысленное сравнение ширина-против-покрытия, но она показывает базовую идею: средняя ширина 1.8, а эмпирическое покрытие 80 процентов, поэтому любое утверждение, что интервалы хороши, следует оценивать против номинальной цели и большего вынесенного набора.
Проверьте валидацию и утечку
Покрытие и ширина должны оцениваться на данных, которые не использовались для подбора квантильных моделей, потому что использование обучающей выборки может сделать калибровку лучше, чем она есть на самом деле. Утечка может произойти, если одни и те же наблюдения влияют и на подогнанные квантильные кривые, и на оценку, или если оценка использует информацию, которая не была бы доступна во время предсказания. Пример градиентного бустинга разделяет обучающие и тестовые данные и сообщает разные значения покрытия для каждого, что является правильной структурой для проверки калибровки. Он также использует кросс-валидационную настройку для модели квантиля 0.05 и сообщает, что подогнанные модели улучшают интервал 90 процентов, но все же находит, что тестовое покрытие ниже номинального уровня. Пример квантильной регрессии аналогично оценивает вне-выборочную производительность с кросс-валидацией при сравнении QuantileRegressor и LinearRegression. Предостерегающий момент в том, что оценки квантилей для экстремальных уровней могут быть нестабильными, потому что они зависят от относительно немногих наблюдений, и эта нестабильность может усилиться, если оценка не надлежащим образом отделена от обучения. Иллюстративная выборка не включает подгонку или утечку, но все же показывает, почему малая вынесенная выборка может давать волатильные оценки покрытия.
Объясните ограничения калибровки
Калибровка здесь означает, что доля вынесенных наблюдений внутри предсказанного интервала в среднем близка к номинальному уровню. Хорошая калибровка на одном наборе данных не гарантирует хорошую калибровку на другом, и средняя калибровка может скрывать вариацию по подгруппам или по регионам пространства входов. Пример градиентного бустинга сообщает покрытие на обучении около 0.903 и покрытие на тесте около 0.796, и он явно говорит, что оцененный интервал слишком узок, чтобы покрыть 90 процентов тестовых точек. Он также сообщает бутстреп-доверительный интервал для тестового покрытия между 73.8 и 84.4 процентами, что количественно оценивает неопределенность в оценке на вынесенных данных. Два дальнейших ограничения стоит сформулировать. Во-первых, квантильные предсказания могут пересекаться, поэтому нижнее предсказание может превышать верхнее для некоторых входов, что нарушает интерпретацию интервала. Во-вторых, покрытие может варьироваться по подгруппам, поэтому одно общее число покрытия может не отражать производительность там, где она важнее всего. Иллюстративная выборка не демонстрирует пересечение или анализ подгрупп, но она показывает, что эмпирическое покрытие - просто доля из конечного набора и не должно рассматриваться как точная гарантия долгосрочной перспективы.
Что проверить
- Подтвердите, предназначен ли интервал для будущего наблюдения или для параметра среднего, прежде чем интерпретировать покрытие.
- Убедитесь, что предсказания нижнего и верхнего квантилей вычислены отдельными моделями или методом, сохраняющим порядок.
- Проверьте, что покрытие вычислено на вынесенных данных, а не на обучающей выборке, использованной для подбора квантильных моделей.
- Осмотрите, пересекаются ли квантильные предсказания для каких-либо входов, что сделало бы семантику интервала недействительной.
- Проверьте, стабильно ли покрытие по значимым подгруппам, а не полагайтесь только на одно общее число.
- Считайте пример с пятью значениями лишь арифметической иллюстрацией, а не доказательством качества модели или производительности scikit-learn.
Границы применения
Пример с пятью значениями построен для иллюстрации и не составляет исследование калибровки или результат бенчмарка. Эмпирическое покрытие и ширина, вычисленные на малой вынесенной выборке, шумны и могут вводить в заблуждение, если представлять их как точные оценки. Номинальное покрытие описывает частотность в долгосрочной перспективе по многим будущим наблюдениям, а не гарантию для какого-либо отдельного наблюдения. Квантильные модели могут пересекаться, и покрытие может варьироваться по подгруппам, поэтому одно общее число может скрывать плохую производительность в конкретных сегментах. Выдержки из scikit-learn описывают методы и показывают примерные числа покрытия, но конкретные значения тестового покрытия там взяты из синтетической установки и выбора моделирования того примера, а не из универсального свойства квантильной регрессии. Экстремальные квантили оцениваются из относительно немногих наблюдений и могут быть нестабильными. Этот ответ использует только предоставленные первичные источники и указанные иллюстративные числа; он не добавляет выполненные тесты или наблюдаемые результаты извлечения.