डेटा झील क्या है?
स्क्रेपलेस वेब अनलॉकर सार्वजनिक वेब सामग्री को पुनः प्राप्त करता है जिसे डेटा टीमें सत्यापित, संरक्षित कर सकती हैं, और डेटा झील में प्रशासित स्रोत डेटा के रूप में उतार सकती हैं।
टीएल;डीआर
- डेटा झील विविध डेटा को सीमित प्रारंभिक परिवर्तन के साथ स्टोर करती है। कच्चे, अर्ध-संरचित, संरचित, और बाइनरी ऑब्जेक्ट्स एक सीधे प्रशासित स्टोरेज वातावरण को साझा कर सकते हैं।
- केवल भंडारण एक झील नहीं बनाता। कैटलॉग, स्वामित्व, पहुँच नीति, गुणवत्ता जांच, और जीवनचक्र नियम सामग्रियों को उपयोगी बनाते हैं।
- स्कीमा अक्सर तब लागू होती है जब डेटा पढ़ा जाता है। उपभोक्ता खोज, मशीन लर्निंग, या डाउनस्ट्रीम क्यूरेशन के लिए समान स्रोत को आकार दे सकते हैं।
- ओपन फाइल फॉर्मेट अंतर-संचालनीयता में सुधार करते हैं। कॉलम और टेबल फॉर्मेट कई इंजनों को साझा डेटा पर काम करने देते हैं बिना एक विशेष डेटाबेस सीमा के।
- एक झील क्यूरेटेड सिस्टम को पूरा करती है। विश्वसनीय गोदाम तालिकाएँ और डेटा उत्पाद प्रशासित झील क्षेत्रों से बनाए जा सकते हैं बजाय हर विश्लेषणात्मक स्टोर को प्रतिस्थापित करने के।
डेटा झील की परिभाषा
डेटा झील एक भंडार और प्रबंधन पैटर्न है जो बड़े मात्रा में डेटा को उनके स्रोत प्रतिनिधित्व के करीबी रूपों में बनाए रखता है। यह सामान्यतः स्थायी वस्तु या फ़ाइल भंडारण का उपयोग करता है और संरचित तालिकाओं, JSON, लॉग, दस्तावेज़ों, मीडिया, और विश्लेषणात्मक फ़ाइल फॉर्मेट को स्वीकार करता है इससे पहले कि हर डाउनस्ट्रीम उपयोग का निर्णय लिया गया हो।
झील कई कंप्यूट इंजनों से भंडारण को अलग करती है। एक क्वेरी इंजन, नोटबुक, परिवर्तन कार्य, या मशीन-लर्निंग वर्कफ़्लो अनुमोदित ऑब्जेक्ट्स को कैटलॉग के माध्यम से पढ़ सकता है और उस कार्य के लिए आवश्यक स्कीमा लागू कर सकता है। यह लचकता तब ही उपयोगी होती है जब डेटा की पहचान और नीति अभिषेक के बाद भी जीवित रहती है। यहाँ उपयोग की जाने वाली मुख्य शब्दावली का पालन करता है Microsoft डेटा झील आर्किटेक्चर मार्गदर्शन, जो इस अवधारणा को एक ठोस तकनीकी सीमा प्रदान करती है बजाय इसे एक विपणन लेबल के रूप में मानने के।
एक उपयोगी परिभाषा यह भी बताती है कि यह अवधारणा क्या नहीं करती है। एक डेटा झील अनलेबल्ड बकेट, सभी डेटाबेस का प्रतिस्थापन, या प्रत्येक एकत्रित वस्तु को अनिश्चितकाल तक बनाए रखने का अनुमति नहीं है। यह भी बिना क्यूरेशन, अनुक्रमण, तालिका मेटाडेटा, और कार्यभार-विशिष्ट कंप्यूट के साथ कम विलंबता वाले व्यवसाय रिपोर्टिंग की गारंटी नहीं देती। उस सीमा को स्पष्ट रखना आर्किटेक्चर आरेख को किसी घटक को दूसरे परत से संबंधित करने की गारंटी देने से रोकता है।
डेटा झील के माध्यम से डेटा कैसे बढ़ता है
एक उपयोगी झील डिज़ाइन इंटरगेशन को स्रोत प्रमाण से खोज योग्य संपत्तियों में नियंत्रित संक्रमण के रूप में मानती है। प्रत्येक चरण मूल संदर्भ को मिटाए बिना मेटाडेटा या गुणवत्ता जोड़ता है जो बाद की पुनः प्रोसेसिंग के लिए आवश्यक है।
- उत्पादक एक अपरिवर्तनीय स्रोत ऑब्जेक्ट लिखता है जिसमें उत्पत्ति, संग्रह समय, स्वामी, और वर्गीकरण मेटाडेटा होता है।
- मान्यता जांच प्रारूप, अपेक्षित फ़ील्ड, पहुँच दायरा, और यह कि ऑब्जेक्ट इच्छित स्रोत का प्रतिनिधित्व करता है या नहीं को सत्यापित करती है।
- एक कैटलॉग स्थान, स्कीमा अवलोकन, विभाजन, वंशावली, गुणवत्ता स्थिति, और डेटा के लिए जिम्मेदार लोगों को रिकॉर्ड करता है।
- परिवर्तन कार्य मानकीकृत या क्यूरेटेड डेटा सेट बनाते हैं जबकि स्रोत ऑब्जेक्ट से वापस लिंक को संरक्षित करते हैं।
- उपभोक्ता खोज, रिपोर्टिंग, मॉडल, या निर्यात के लिए अनुकूलित इंजनों और अनुमतियों के माध्यम से अनुमोदित क्षेत्रों को क्वेरी करते हैं।
वस्तु भंडारण बाइट्स को रखता है, फ़ाइल फॉर्मेट रिकार्ड को व्यवस्थित करते हैं, तालिका मेटाडेटा तार्किक डेटा सेट को ट्रैक करता है, कैटलॉग संपत्तियों को खोजने योग्य बनाते हैं, और कंप्यूट इंजन कार्य करते हैं। इन भूमिकाओं को अलग रखना टीमों को हर स्रोत ऑब्जेक्ट को फिर से लिखे बिना एक क्वेरी इंजिन बदलने की अनुमति देता है। इस व्यवहार को अधिक पूर्ण रूप से दस्तावेजीकृत किया गया है Apache Parquet दस्तावेजीकरण। स्रोत उपयोगी है क्योंकि यह वास्तविक निष्पादन या डेटा मॉडल का वर्णन करता है बजाय कि एक ढीली उपमा पर निर्भर रहने के।
कोर डेटा झील लेयर्स
| परत | प्राथमिक कार्य | रखने के लिए साक्ष्य |
|---|---|---|
| स्रोत क्षेत्र | प्राप्त डेटा को संरक्षित करना | उत्पत्ति, समय, चेकसम, संग्रह संदर्भ |
| मान्य क्षेत्र | गलत या अप्रत्याशित इनपुट को अस्वीकार करना | मान्यता परिणाम और स्कीमा अवलोकन |
| मानकीकृत क्षेत्र | नाम, प्रकार, और विभाजनों को सामान्यीकृत करना | परिवर्तन संस्करण और वंशावली |
| क्यूरेटेड क्षेत्र | एक निश्चित व्यवसाय या मॉडल उपयोग को सेवा प्रदान करना | स्वामी, अनुबंध, गुणवत्ता उद्देश्य |
| आर्काइव या हटाना | रखरखाव और कानूनी नीति लागू करें | निपटान कारण और प्राधिकरण |
क्षेत्र नाम भिन्न होते हैं, लेकिन राज्य संक्रमण को स्पष्ट होना चाहिए। बिना गुणवत्ता या स्वामित्व परिवर्तन के नए उपसर्ग में फ़ाइल कॉपी करने से दृश्य संगठन बनता है न कि शासन। प्रत्येक क्षेत्र को उपभोक्ता को यह बताना चाहिए कि कौन से अनुमान सुरक्षित हैं।
सामान्य डेटा झील कार्यभार
अन्वेषणात्मक विश्लेषण
विश्लेषकों को स्थिर गोदाम मॉडल या उत्पाद अनुबंध में प्रतिबद्ध होने से पहले नए स्रोतों का निरीक्षण कर सकते हैं।
यांत्रिक तैयारी
टीम उच्च-आयामी, अर्ध-संरचित और बाइनरी इनपुट को पुनरुत्पादक परिवर्तन वंश के साथ बनाए रख सकती हैं।
दीर्घकालिक स्रोत रखरखाव
अपरिवर्तनीय सबूत बाद में पुनर्प्रसंस्करण का समर्थन करते हैं जब अंतिम, स्कीमा, या व्यापार प्रश्न बदलते हैं।
बहु-इंजन विश्लेषिकी
SQL इंजन, नोटबुक, बैच जॉब और स्ट्रीम प्रोसेसर साझा शासन किए गए फ़ॉर्मेट पर काम कर सकते हैं।
ये उपयोग के मामले एक चयन नियम साझा करते हैं: एक डेटा झील चुनें क्योंकि इसका निष्पादन और स्वामित्व मॉडल कार्यभार से मेल खाता है, न कि क्योंकि नाम अधिक उन्नत लगता है। एक झील कम आकर्षक होती है जब कार्यभार छोटा, अत्यधिक लेनदेनात्मक, या पूर्व निर्धारित डैशबोर्ड से भरा होता है जो पहले से ही एक व्यवस्थित विश्लेषणात्मक डेटाबेस में फिट होता है। आर्किटेक्चर लचीलापन का एक संचालन लागत होती है।
क्षेत्र, कैटलॉग और शासन
गवर्नेंस प्रविष्टि पर शुरू होती है। उत्पादक को स्रोत, उद्देश्य, मालिक, संवेदनशीलता, रखरखाव, अपेक्षित स्कीमा और गुणवत्ता जांचों की पहचान करनी चाहिए, इससे पहले कि पहली बड़ी बैच आए।
- अपरिवर्तनीय स्रोत वस्तुओं को प्राथमिकता दें। नए संस्करण सबूतों को बनाए रखते हैं और बिना चुपचाप इतिहास को बदलते हुए परिवर्तन को पुनरुत्पादक बनाते हैं।
- खुले, टाइप किए गए स्वरूपों का उपयोग करें। पोर्टेबल कॉलम फ़ाइलें स्कैन कार्य को कम करती हैं और विश्लेषणात्मक इंजनों के बीच इंटरऑपरेबिलिटी में सुधार करती हैं।
- हर नियंत्रित संपत्ति का कैटलॉग करें। खोज, वंश, स्वामित्व और पहुँच नीति जनजातीय ज्ञान या पथ नामों पर निर्भर नहीं होनी चाहिए।
- क्षेत्र के अनुसार अनुमतियों को अलग करें। कच्ची संवेदनशील इनपुट और व्यवस्थित उपभोक्ता तालिकाएँ शायद ही कभी एक ही दर्शक की आवश्यकता होती हैं।
- छोटी फ़ाइल नियंत्रण के लिए बजट निर्धारित करें। संकुचन और विभाजन नीति मेटाडेटा ओवरहेड को क्वेरी कार्य पर हावी होने से रोकती है।
तालिका स्वरूप में स्नैपशॉट, स्कीमा विकास, विभाजन मेटाडेटा और ऑब्जेक्ट स्टोरेज पर लेन-देन समन्वय जोड़ सकते हैं। वे स्रोत अनुबंध या पहुँच शासन की आवश्यकता को समाप्त नहीं करते; वे कुछ स्टोरेज-स्तरीय परिवर्तनों को सुरक्षित और क्वेरी करना आसान बनाते हैं। एक संबंधित प्राथमिक संदर्भ है एपाचे आइसबर्ग दस्तावेज़ीकरण, जो उस विकल्प के पीछे भंडारण, निष्पादन, या इंटरऑपरेबिलिटी परिभाषाओं को स्पष्ट करता है।
डेटा झीलें डेटा दलदल कैसे बनती हैं
एक डेटा दलदल तब बनता है जब भंडारण समझने की तुलना में तेजी से बढ़ता है। चेतावनी संकेत हैं गायब स्वामित्व, दोहराए गए स्रोत, अस्पष्ट स्कीमा, व्यापक अनुमतियाँ, अनियंत्रित रखरखाव, और उपभोक्ता समान क्लीनअप लॉजिक को फिर से बनाना।
- पथ-केवल संगठन। फोल्डर ऐसे कैटलॉग का प्रतिस्थापन नहीं कर सकते जो अर्थ, वंश, और स्वामित्व को रिकॉर्ड करता है।
- स्कीमा-मुक्त सोच। हर उपभोक्ता अनुमानों को लागू करता है; अप्रलेखित अनुमान केवल स्कीमा कार्य को नीचे की ओर ले जाते हैं।
- पहचान के बिना कॉपी करना। स्रोत कुंजी या संस्करण नियम के बिना डुप्लिकेट फ़ाइलें असंगत विश्लेषणात्मक परिणाम उत्पन्न करती हैं।
- एक अनुमति सीमा। सभी उपभोक्ताओं को कच्चे और व्यवस्थित क्षेत्रों तक पहुँच देने से जोखिम बढ़ता है और उद्देश्य सीमित करने की क्षमता कमजोर होती है।
- डिफ़ॉल्ट द्वारा रखने वाला। बिना जीवनचक्र नियम वाले डेटा लागत, कानूनी जोखिम और खोज बोझ को बढ़ाते हैं।
एक विफलता को सबसे छोटे जिम्मेदार परत पर ट्रेस किया जाना चाहिए। जब कोई क्वेरी गलत होती है, तो उपभोक्ता गणना को बदलने से पहले प्रमाणित संपत्ति को उसके परिवर्तन, कैटलॉग प्रविष्टि, प्रमाणीकरण परिणाम, और अपरिवर्तनीय स्रोत वस्तु पर ट्रेस करें। यह अभ्यास एक उपयोगी सुधारात्मक कार्रवाई उत्पन्न करता है न कि अधिक क्षमता जोड़ने के लिए एक अस्पष्ट निर्देश।
एक झील में सार्वजनिक-जाल डेटा उतारना
सार्वजनिक-जाल डेटा अक्सर HTML, टेक्स्ट, JSON, स्क्रीनशॉट, या निकाले गए फ़ील्ड के रूप में आता है। एक झील अधिग्रहित प्रतिनिधित्व को बनाए रख सकती है और बाद में विश्लेषण के लिए सामान्यीकृत पार्केट या शासन तालिकाएं बना सकती है, बशर्ते कि पाइपलाइन स्रोत पहचान और संग्रह संदर्भ को बनाए रखे।
सार्वजनिक-जाल इनपुट के लिए, अधिग्रहण स्तर को अनुरोधित URL, अंतिम URL, संग्रहण समय, प्रतिक्रिया मोड, और नीचे की प्रक्रिया शुरू होने से पहले एक सामग्री जांच को रिकॉर्ड करना चाहिए। अनुरोधित और अंतिम URL, सामग्री प्रकार, checksum, संग्रहण समय, और प्रमाणीकरण परिणाम को वस्तु के बगल में या लिंक किए गए मैनिफेस्ट में संग्रहीत करें। वह हस्तांतरण विश्लेषकों को एक पुनरुत्पादक स्रोत रिकॉर्ड देता है और संग्रहण व्यवहार को व्याख्या से अलग रखता है।
स्क्रेपलेस खोली हुई वाक्य में वर्णित प्रबंधित वेब-संग्रहण चरण को संभालता है। एप्लिकेशन अभी भी स्रोत अनुमोदन, फ़ील्ड परिभाषाएँ, कार्यभार सीमाएँ, रखरखाव, पहुँच नियंत्रण और प्रमाणीकरण का मालिक है। स्क्रेपलेस अनुरोधित पुनर्प्राप्ति करता है, जबकि डेटा प्लेटफ़ॉर्म अनुमोदित स्रोतों, वस्तु नामकरण, विभाजनों, कैटलॉग पंजीकरण, अनुमतियों, रखरखाव, और नीचे के अनुबंधों का निर्णय करता है। उन स्तरों के बीच एक स्पष्ट अनुबंध बाद की परिवर्तनों को परीक्षण में आसान बनाता है।
पाइपलाइन को कच्चे सबूत और व्यवस्थित आउटपुट दोनों को बनाए रखना चाहिए जब उपयोग केस को ऑडिट करने की आवश्यकता होती है। कच्चा सामग्री एक पार्सर या स्कीमा के बाद पुनर्प्रसंस्करण का समर्थन करता है; व्यवस्थित तालिकाएँ स्थिर विश्लेषण का समर्थन करती हैं। कच्चे सबूत को केवल तब संरक्षित करें जब उद्देश्य और रखरखाव नीति इसे सही ठहराती है, फिर दस्तावेज़ित फ़ील्ड और गुणवत्ता की अपेक्षाओं के साथ व्यवस्थित उत्पादों को प्रकाशित करें। दोनों प्रतिनिधित्व विभिन्न संचालन संबंधी प्रश्नों का उत्तर देते हैं और इन्हें डुप्लिकेट के लिए गलती नहीं होनी चाहिए।
डेटा झील आर्किटेक्चर चेकलिस्ट
डिज़ाइन समीक्षा के दौरान निम्नलिखित प्रश्नों का उपयोग करें। एक लिखित उत्तर अनुमानित डिफ़ॉल्ट की तुलना में अधिक मूल्यवान होता है क्योंकि यह यह उजागर करता है कि टीमें डेटा झील के बारे में असहमत हैं।
- कौन-से स्रोत प्रतिनिधित्व अपरिवर्तनीय बने रहना चाहिए?
- कौन-सी मेटाडेटा प्रत्येक वस्तु को खोजने योग्य और पुनरुत्पादनीय बनाती है?
- कौन-से प्रारूप और तालिका मानक कई इंजनों द्वारा साझा किए जाने चाहिए?
- स्कीमा ड्रिफ्ट और असंगत परिवर्तनों का पता कैसे लगाया जाता है?
- हर शोधन किए गए डेटासेट का मालिक कौन है और इसके उपभोक्ताओं को मंजूरी देता है?
- कच्चे और शोधन किए गए अनुमतियों में क्या अंतर है?
- फाइल लेआउट को नियंत्रित करने वाले कौन-से संकुचन और विभाजन नियम हैं?
- डेटा कब संग्रहित या हटाया जाता है, और वह निर्णय कहाँ दर्ज किया जाता है?
एक झील तब तैयार होती है जब एक नया उपभोक्ता एक संपत्ति खोज सकता है, इसके अनुबंध को समझ सकता है, इसकी वंशावली की सत्यता की पुष्टि कर सकता है, उचित पहुँच का अनुरोध कर सकता है, और संरक्षित साक्ष्य से परिवर्तन को पुनरुत्पादित कर सकता है। कार्यभार के आकार, डेटा मात्रा, सेवा सीमाओं, या उपभोक्ता अपेक्षाओं में बदलाव के बाद उत्तरों पर दोबारा गौर करें। एक ऐसा आर्किटेक्चर जो एक खोजात्मक बैच के लिए समझदारी भरा था, निरंतर उत्पादन पथ के लिए खराब फिट हो सकता है।
निष्कर्ष
एक डेटा झील लचीले भंडारण को सूचीकरण, शासन, और स्वतंत्र कंप्यूट के साथ जोड़ती है। इसका मूल्य विविध स्रोत डेटा को संरक्षित करने से आता है जबकि अभी भी स्वामित्व, गुणवत्ता, वंशावली, अनुमतियों और जीवन चक्र को स्पष्ट बनाता है। खुले प्रारूप और तालिका मेटाडेटा पारस्परिकता में सुधार करते हैं, लेकिन वे अपने आप में विश्वास नहीं पैदा करते। झील तब उपयोगी होती है जब प्रत्येक संपत्ति साक्ष्य से उपभोक्ता-तैयार डेटा उत्पाद के लिए एक दस्तावेजित पथ के माध्यम से जा सकती है।
क्या आप एक शासित वेब डेटा झील बनाने के लिए तैयार हैं?
स्वीकृत सार्वजनिक-वेब साक्ष्य एकत्र करें, उत्पत्ति को संरक्षित करें, और सत्यापित वस्तुओं को अपनी झील की आयात पाइपलाइन में सौंपें।
आज ही साइन अप करें और प्राप्त करें $5 फ्री क्रेडिट — कोई क्रेडिट कार्ड आवश्यक नहीं है.
अपने $5 क्रेडिट का दावा करें →अधिकांश
एक डेटा झील का मुख्य उद्देश्य क्या है?
एक डेटा झील विविध डेटा को कई भविष्य के उपयोगों के लिए संरक्षित करती है बिना हर स्रोत को आयात पर एक ही गोदाम स्कीमा में मजबूर किए। यह अन्वेषण, मशीन-शिक्षण तैयारी, दीर्घकालिक साक्ष्य, और बहु-इंजन विश्लेषण का समर्थन करता है। यह लचीलापन एक सूचीकरण, स्वामित्व, पहुँच नियंत्रण, गुणवत्ता जांच, और धारण नीति पर निर्भर करता है।
क्या डेटा झील हमेशा क्लाउड में संग्रहित होती है?
नहीं। एक डेटा झील क्लाउड ऑब्जेक्ट स्टोरेज, वितरित फ़ाइल प्रणालियों, या अन्य टिकाऊ भंडारण वातावरण का उपयोग कर सकती है। क्लाउड ऑब्जेक्ट स्टोर सामान्य हैं क्योंकि वे संग्रहण को कंप्यूटर से अलग करते हैं और परिचालन रूप से स्केल करते हैं, लेकिन परिभाषित विशेषताएँ लचीले संरक्षित डेटा के साथ-साथ शासन और विश्लेषणात्मक पहुँच हैं, एक ही तैनाती स्थान नहीं।
रीड पर स्कीमा का क्या अर्थ है?
रीड पर स्कीमा का मतलब है कि एक उपभोक्ता जब डेटा को क्वेरी करता है तो संरचना लागू या व्याख्या करता है, जबकि स्रोत को संग्रहीत करने से पहले एक अंतिम विश्लेषणात्मक स्कीमा की आवश्यकता नहीं होती है। स्रोत का अभी भी एक भौतिक प्रारूप और अवलोकित फ़ील्ड हैं। अच्छे झील प्लेटफ़ॉर्म उन तथ्यों को रिकॉर्ड करते हैं और उन्हें मान्य करते हैं बजाय इसके कि स्कीमा मौजूद नहीं है।
एक डेटा झील डेटा कीचड़ कैसे बन जाती है?
जब उपयोगकर्ता इसकी सामग्री को खोज, विश्वास, समझ या सुरक्षित रूप से पहुँच नहीं सकते, तो एक झील कीचड़ में बदल जाती है। मालिकाना अधिकार की कमी, कमजोर वंशावली, डुप्लिकेट स्रोत, बिना दस्तावेज़ वाले स्कीमा, विस्तृत अनुमतियाँ, और अनिश्चित धारण आम कारण हैं। अधिक भंडारण या एक नई क्वेरी इंजन उन शासन के अंतरालों की मरम्मत नहीं करता।
क्या सार्वजनिक-वेब डेटा एक डेटा झील में जा सकता है?
हाँ, जब संगठन के पास एक स्वीकृत उद्देश्य हो और लागू पहुँच, गोपनीयता, कॉपीराइट, संविदात्मक, और धारण आवश्यकताओं का पालन किया जाए। आयात विवरणिका को स्रोत URL, संग्रहण संदर्भ, सत्यापन स्थिति, और स्वामित्व को संरक्षित करना चाहिए। शोधन किए गए आउटपुट को शासित स्रोत वस्तु की वंशावली बनाए रखनी चाहिए।