TATECHATLAS
◎ हिन्दी
कृत्रिम बुद्धिमत्ता

कोसाइन, डॉट प्रोडक्ट और दूरी: उस मेट्रिक का चयन करें जो आपका एम्बेडिंग मॉडल अपेक्षित करता है

छोटे वेक्टरों पर तीन समानता गणनाओं की तुलना करें और देखें कि सामान्यीकरण रैंकिंग को कब बदलता है।

इस पृष्ठ पर

एम्बेडिंग मॉडल के लिए अनुशंसित समानता मेट्रिक और प्रीप्रोसेसिंग का उपयोग करें। कोसाइन दिशा की तुलना करता है, डॉट प्रोडक्ट वेक्टर के परिमाण को भी प्रतिबिंबित करता है, और यूक्लिडियन दूरी पृथक्करण को मापता है। इकाई वेक्टर के लिए, कोसाइन और डॉट प्रोडक्ट समान होते हैं और वर्ग यूक्लिडियन दूरी 2 घटा 2 गुणा कोसाइन के बराबर होती है। यह समानता सामान्यीकरण को आवश्यक मानती है; यह मनमाने सर्विस स्कोर को आपस में बदलने योग्य नहीं बनाती। किसी इंडेक्स को बदलने से पहले दोनों दस्तावेज़ और क्वेरी वेक्टर की जाँच करें।

एम्बेडिंग अनुबंध के साथ शुरू करें

मॉडल पहचानकर्ता, संशोधन, वेक्टर आयाम और अनुशंसित समानता माप को रिकॉर्ड करें। क्वेरी और दस्तावेज़ एम्बेडिंग्स को अनुकूल प्रतिनिधित्वों से संबंधित होना चाहिए; समान आयाम अकेले अनुकूलता सिद्ध नहीं करते। कुछ पुनर्प्राप्ति मॉडल अलग-अलग क्वेरी और दस्तावेज़ निर्देशों का उपयोग करते हैं, इसलिए अनुकूलता का अर्थ आवश्यक रूप से समान इनपुट प्रारूप नहीं है। दस्तावेज़ीकरण किए गए प्रीप्रोसेसिंग को लगातार लागू करें और इसे इंडेक्स कॉन्फ़िगरेशन के साथ संरक्षित करें।

दिशा और परिमाण को अलग करें

शून्येतर वेक्टर q और x के लिए, कोसाइन उनके डॉट प्रोडक्ट को उनकी लंबाइयों के गुणनफल से विभाजित करने पर प्राप्त होता है। किसी भी वेक्टर का धनात्मक पुनर्स्केलन कोसाइन को अपरिवर्तित छोड़ता है। डॉट प्रोडक्ट में ऐसी अपरिवर्तनीयता नहीं है: किसी वेक्टर को लंबा करने से उसका स्कोर बढ़ सकता है भले ही उसकी दिशा वही रहे। यह निर्णय लें कि क्या इस विशिष्ट मॉडल में लंबाई उपयोगी जानकारी रखती है, न कि सामान्यीकरण को सार्वभौमिक रूप से हानिरहित सफ़ाई के रूप में मानें।

तीन रैंकिंगें हाथ से गणना करें

रचना किए गए वेक्टर q=(1,0), a=(2,0) और b=(1,1) पर विचार करें। q के साथ उनके डॉट प्रोडक्ट 2 और 1 हैं, इसलिए डॉट प्रोडक्ट a को पहले स्थान पर रैंक करता है। कोसाइन 1 और लगभग 0.707 हैं, जो भी a को पहले स्थान पर रैंक करते हैं। कच्ची यूक्लिडियन दूरियाँ दोनों 1 हैं, जिससे टाई उत्पन्न होती है। यह अंकगणित उदाहरण विभिन्न मेट्रिक व्यवहार को प्रदर्शित करता है; यह कोई मापी गई पुनर्प्राप्ति परिणाम नहीं है और न ही यह साक्ष्य है कि कोई मेट्रिक अधिक सटीक है।

इकाई-वेक्टर समानता को समझें

सामान्यीकरण के बाद, a बन जाता है (1,0), b बन जाता है लगभग (0.707,0.707), और q (1,0) रहता है। q से उनकी दूरियाँ 0 और लगभग 0.765 हो जाती हैं। दो इकाई वेक्टर के लिए, वर्ग दूरी का विस्तार 1+1-2 गुणा उनका डॉट प्रोडक्ट देता है। इस प्रकार, इन धारणाओं के तहत सटीक अंकगणित में दूरी को न्यूनतम करना और कोसाइन को अधिकतम करना समान क्रम पैदा करते हैं। सन्निकट इंडेक्स और टाई प्रबंधन अभी भी अलग-अलग लौटाए गए उम्मीदवार सेट उत्पन्न कर सकते हैं।

अमान्य वेक्टर को इंडेक्सिंग से पहले अस्वीकार करें

शून्य वेक्टर को विभाजन द्वारा इकाई लंबाई में सामान्यीकृत नहीं किया जा सकता, और कोसाइन अपरिभाषित होता है जब किसी भी लंबाई शून्य होती है। गैर-सीमित मान और असंगत आयामों को भी डेटा या पाइपलाइन समस्याओं के रूप में इलाज किया जाना चाहिए। यह परिभाषित करें कि ऐसे रिकॉर्ड को अस्वीकार कर दिया जाता है, क्वारेंटाइन किया जाता है या पुनः प्रयास किया जाता है। हर अमान्य वेक्टर को चुपचाप शून्य से बदलने से एक नया प्रतिनिधित्व बनता है बिना यह स्थापित किए कि एम्बेडिंग मॉडल या खोज सेवा इसका समर्थन करती है।

सेवा द्वारा लौटाए गए स्कोर की व्याख्या करें

एक API दूरी या समानता को अपनी रैंकिंग स्कोर में बदल सकता है। उदाहरण के लिए, Azure AI Search कच्चे कोसाइन को अपनी खोज स्कोर के रूप में लौटाने के बजाय एक रूपांतरित कोसाइन स्कोर का दस्तावेजीकरण करता है। इसलिए, किसी अन्य सेवा से या हाथ की गणना से कॉपी किया गया थ्रेसहोल्ड गलत हो सकता है। वास्तविक क्वेरी मोड के लिए स्कोर परिभाषा को पढ़ें, जिसमें यह शामिल है कि क्या संकर पुनर्प्राप्ति कई रैंकिंग को संयोजित करती है।

अर्थपूर्ण क्वेरीज पर बदलाव का मूल्यांकन करें

एक उत्पादन मेट्रिक को स्विच करने से पहले, स्पष्ट प्रासंगिकता निर्णयों के साथ प्रतिनिधि क्वेरीज के एक छोटे सेट की तुलना करें। मेट्रिक बदलाव को अलग करने के लिए डॉक्यूमेंट, मॉडल और प्रीप्रोसेसिंग को स्थिर रखें। यदि अनुमानित इंडेक्स का उपयोग कर रहे हैं, तो एक कैंडिडेट-रिकॉल समस्या को स्कोरिंग समस्या से अलग करें। एक दृश्य रूप से बड़े स्कोर को गुणवत्ता सुधार के रूप में व्याख्या करने के बजाय लापता प्रासंगिक दस्तावेज़ और अप्रत्याशित उच्च-रैंक किए गए परिणामों को रिकॉर्ड करें।

सामान्यीकरण को इंडेक्स के साथ वर्जन किया हुआ रखें

सामान्यीकरण बदलने से संग्रहीत वेक्टर बदल जाते हैं और इंडेक्स को पुनर्निर्माण करने की आवश्यकता हो सकती है। केवल क्वेरीज को सामान्यीकृत करना जबकि एक असंगत दस्तावेज़ प्रतिनिधित्व को अपरिवर्तित छोड़ना एक सामान्य माइग्रेशन रणनीति नहीं है। मॉडल संशोधन, मेट्रिक और सामान्यीकरण सेटिंग्स को एक साथ सहेजें ताकि एक बाद का तैनाती प्रतिनिधित्व को पुनः उत्पन्न कर सके। वास्तव में चुने गए मॉडल के लिए मॉडल कार्ड की जांच करें; एक सामान्यीकृत एम्बेडिंग मॉडल के लिए एक सिफारिश सभी मॉडलों के लिए एक नियम स्थापित नहीं करती।

क्या जाँचें

  • अनुकूल क्वेरी और दस्तावेज़ प्रतिनिधित्व का उपयोग करें।
  • मॉडल-विशिष्ट मेट्रिक अनुशंसा की पुष्टि करें।
  • दस्तावेज़ीकरण नीति के तहत शून्य और गैर-सीमित वेक्टर को अस्वीकार करें।
  • वास्तविक सर्विस स्कोर परिभाषा को पढ़ें।
  • छोटे वेक्टर मानों को चित्रण अंकगणित के रूप में मानें।

यह समानता सटीक अंकगणित में शून्येतर इकाई वेक्टर पर लागू होती है। सन्निकट इंडेक्सिंग, क्वांटाइज़ेशन, संकर रैंकिंग और सर्विस स्कोर रूपांतरण लौटाए गए परिणामों को प्रभावित कर सकते हैं। यह गाइड किसी विशिष्ट संग्रह के लिए पुनर्प्राप्ति सटीकता स्थापित नहीं करती।

स्रोत

  1. Azure AI Search: vector ranking and similarity ↗
  2. Hugging Face: normalized sentence embeddings model card ↗
ऊपर जाएँ ↑