TATECHATLAS
◎ हिन्दी
गणित और मॉडल

एक मौसमी रेखांकन के साथ एक समय-श्रृंखला पूर्वानुमान की तुलना

एक पिछले मौसम का संदर्भ बनाएं, बाद के अवलोकनों पर इसका मूल्यांकन करें और कैलेंडर संरेखण को रिसाव और गायब डेटा से अलग करें।

इस पृष्ठ पर

एक मौसमी पूर्वानुमान एक अवलोकन को उसी earlier season से आने वाले मान का उपयोग करके predicts करता है। नियमित रूप से अंतराल वाले मासिक अवलोकनों के लिए जिसमें वार्षिक मौसमीकरण है, संदर्भ बारह अवलोकन पहले है। अपने मॉडल और baseline को एक ही बाद की तारीखों पर उसी जानकारी के साथ तुलना करें। एक कम प्रशिक्षण त्रुटि अकेले यह स्थापित नहीं करती कि एक मॉडल इस सरल संदर्भ को बेहतर बनाता है।

कार्य के अनुरूप एक संदर्भ चुनें

एक समग्र माध्य एक चक्र के भीतर एक मान की स्थिति को नजरअंदाज करता है। जब मांग विश्वसनीय रूप से महीनों के बीच भिन्न होती है, तो पिछले वर्ष के corresponding month एक अधिक सूचनात्मक संदर्भ हो सकता है। यह एक परिकल्पना है जिसे मूल्यांकन किया जाना है, यह प्रमाण नहीं कि हर श्रृंखला मौसमी है।

अवधि अवलोकन शेड्यूल और वास्तविक प्रक्रिया से चुनें। बारह पंक्तियां केवल एक पूर्ण मासिक श्रृंखला के लिए एक वर्ष का अर्थ रखती हैं। दैनिक डेटा में बारह पंक्तियां या मिसिंग महीनों वाली तालिका एक अलग अंतराल का वर्णन करती है। एक baseline को सुविधाजनक ऐरे लंबाई के बजाय forecast target से मिलान करना चाहिए।

समय सूचकांक को नियमित और स्पष्ट रखें

अवलोकनों को कालानुक्रमिक रूप से क्रमबद्ध करें और डुप्लिकेट टाइमस्टैम्प, अंतराल और इकाइयों की जांच करें। pandas में, अवधि द्वारा मानों को स्थानांतरित करना index के साथ आवृत्ति के स्थानांतरण से अलग है। एक lagged reference के लिए, मानों को उन्हें predict करने वाले भविष्य की तारीखों के साथ संरेखित किया जाना चाहिए।

गैप्स को बाद के मानों का उपयोग करके चुपचाप भरना नहीं चाहिए, क्योंकि इससे उस जानकारी का खुलासा हो सकता है जिसे forecast origin पर उपलब्ध नहीं कराया गया है। यदि श्रृंखला अनियमित है, तो मिलान कैलेंडर अवधियों का स्पष्ट रूप से संरेखण करें या अन्य संदर्भ चुनें। गायब अवलोकनों के बारे में निर्णय मॉडल और baseline दोनों पर समान रूप से लागू किए जाने चाहिए।

एक छोटा मासिक उदाहरण

यह उदाहरण Python की मानक लाइब्रेरी का उपयोग करता है और बीस-four人工 रूप से बनाया गया, समान रूप से spaced monthly observations। पहली बारह मान एक वर्ष Represent करते हैं, और अगले बारह दो इकाइयों अधिक होते हैं। ये illustrative data हैं, माप या असली forecasting performance के प्रमाण नहीं।

दूसरे वर्ष के लिए, बारह-मान की lag pिछले वर्ष के मान predicts। इस डेटासेट में पहली बारह स्थितियां earlier season नहीं रखतीं, इसलिए उन्हें इस baseline द्वारा scored नहीं जा सकता। कभी भी उन अनुपलब्ध संदर्भों को future observations से प्रतिस्थापित न करें।

# Illustrative monthly observations, January through December twice.
values = [10, 12, 15, 18, 20, 22, 21, 19, 17, 14, 12, 11]
values += [value + 2 for value in values]
period = 12
actual = values[period:]
predicted = values[:-period]
mae = sum(abs(a - p) for a, p in zip(actual, predicted)) / len(actual)
print(predicted[:3])
print(mae)
# Expected illustrative output:
# [10, 12, 15]
# 2.0

मूल इकाइयों में त्रुटि का अर्थ निकालें

यहां प्रत्येक forecast दो इकाइयों से चूकता है, इसलिए illustrative mean absolute error 2.0 है। यह गणित केवल आपूर्ति की गई खिलौना डेटा का वर्णन करता है। यह किसी अविनाशी real series के बारे में कुछ भी नहीं कहता है या दो इकाइयां एप्लिकेशन के लिए स्वीकार्य हैं या नहीं।

इन same target dates और same units पर अपने मॉडल का मूल्यांकन करें। मौसम के अनुसार त्रुटियों का मूल्यांकन करें साथ ही overall: एक average दोहराए गए विफलताओं को छिपा सकता है एक critical month के दौरान। उन अवलोकनों को दस्तावेज करें जिसे valid target या lagged reference unavailable होने के कारण बाहर रखा गया।

अतीत को भविष्य से अलग करना

एक यादृच्छिक प्रशिक्षण/परीक्षण विभाजन भविष्य के अवलोकनों को प्रशिक्षण में डाल सकता है जबकि wcześner तारीखें मूल्यांकन में दिखाई देती हैं। पूर्वानुमान के लिए कालानुक्रमिक मूल्यांकन का उपयोग करें। प्रत्येक आरंभिक बिंदु पर, सुविधाओं का निर्माण करें और केवल उसी जानकारी का उपयोग करके कोई भी पूर्व-प्रसंस्करण फिट करें।

TimeSeriesSplit successive समय-क्रमबद्ध प्रशिक्षण और परीक्षण विंडो प्रदान करता है जिसमें डिफ़ॉल्ट रूप से बढ़ते प्रशिक्षण सेट होते हैं। इसकी तुलनीय अवधि व्याख्या समान रूप से स्पेस किए गए अवलोकनों की धारणा पर आधारित है। test_size और कोई भी अंतर चुनें ताकि कार्य से मेल खाए; पुस्तकालय आपके व्यवसाय पूर्वानुमान क्षितिज को निर्धारित नहीं करती है।

एक-चरण और बहु-चरण पूर्वानुमानों के बीच अंतर करना

रोलिंग मूल्यांकन में, एक मान जिसे एक आरंभिक बिंदु पर जाना गया था, अगले आरंभिक बिंदु से पहले ज्ञात हो सकता है। कई भविष्य के महीनों के लिए एक साथ जारी किया गया एक पूर्वानुमान अलग सूचना सेट रखता है। बहु-चरण पूर्वानुमान को इस प्रकार मूल्यांकन न करें जैसे कि प्रत्येक मध्यवर्ती वास्तविक मान पहले ही आ गया हो।

एक मौसमी विलंब केवल तभी उपयोगी होता है जब संदर्भित अवलोकन प्रासंगिक आरंभिक बिंदु पर ज्ञात हो। एक मौसमी अवधि से लंबे क्षितिज के लिए, कुछ सीधे विलंब संदर्भ पूर्वानुमान अंतराल में इंगित करते हैं और एक परिभाषित रणनीति की आवश्यकता होती है। त्रुटियों की तुलना करने से पहले उस रणनीति को घोषित करें rather than उसे लक्ष्यों को देखने के बाद चुनना।

जांचें कि बेसलाइन क्यों सफल होती है या विफल होती है

स्तर में परिवर्तन, प्रवृत्ति, एक स्थानांतरित अवकाश या एक बदला गया व्यावसायिक प्रक्रिया पिछले मौसम को खराब भविष्यवक्ता बना सकते हैं। तारीख वाले अवशेषों और ज्ञात घटनाओं की जांच करें। एक असामान्य विंडो के दौरान बेसलाइन को हराना कई प्रतिनिधि बाद के विंडो में सुधार करने की तुलना में कमज़ोर प्रमाण है।

जब मौसमी संदर्भ ख़राब प्रदर्शन करता है तो last-observation या अन्य सरल बेसलाइन के साथ तुलना करें। मूल्यांकन तिथियाँ समान रखें। एक अंतिम आयोजित अवधि के विरुद्ध कई मॉडल को ट्यूनिंग करने से बचें जब तक कि यह प्रभावी रूप से एक प्रशिक्षण सेट न बन जाए।

यह निर्धारित करें कि जोड़ा गया मॉडल उपयोगी है या नहीं

एक अधिक जटिल मॉडल तभी उपयोगी होता है जब यह प्रासंगिक त्रुटि माप पर बाद के डेटा पर पर्याप्त सुधार करता है ताकि इसकी रखरखाव और संचालन लागत उचित ठहराई जा सके। जो मायने रखता है उसे निर्दिष्ट करें: typical absolute error, large misses, particular seasons, या overprediction versus underprediction की लागत।

डिप्लॉयमेंट के बाद बेसलाइन को एक संदर्भ के रूप में बनाए रखें। डेटा प्रक्रिया में परिवर्तन एक Earlier advantage को गायब कर सकते हैं। तुलनीय त्रुटियों की निगरानी एक ठोस निर्णय का समर्थन करती है कि मॉडल को बनाए रखें, संशोधित करें या सरल करें बिना प्रदर्शन गारंटी का आविष्कार किए।

क्या जाँचें

  • नियमित समय सूचकांक और giustified seasonal period की पुष्टि करें।
  • केवल प्रत्येक forecast origin पर ज्ञात अवलोकनों का उपयोग करें।
  • एक ही बाद की लक्ष्यों पर मॉडल और baseline का स्कोर करें।
  • भविष्यवाणी क्षितिज और missing-data policy का विवरण दें।

एक मौसमी baseline को earlier matching observations और पर्याप्त रूप से स्थिर दोहराव की आवश्यकता होती है। यह कारण संबंध स्थापित नहीं करता, सटीकता की गारंटी नहीं देता या संरचनात्मक टूटने, अनियमित टाइमस्टैम्प या multi-step क्षितिज को स्वचालित रूप से संभालता नहीं है।

स्रोत

  1. pandas: time series ↗
  2. scikit-learn: TimeSeriesSplit ↗
ऊपर जाएँ ↑