कॉमन क्रॉल क्या है? डेटा स्वरूप, अनुक्रमणिकाएँ, और उपयोग

कॉमन क्रॉल क्या है?

स्क्रेपलेस यूनिवर्सल स्क्रैपिंग एपीआई वर्तमान सार्वजनिक वेब पृष्ठों को पुनः प्राप्त करता है जो अनुसंधान और डेटा पाइपलाइनों में संग्रहित वेब डेटासेट को पूरक कर सकते हैं।

TL;DR

  • कॉमन क्रॉल एक वेब क्रॉल डेटा का खुला भंडार है। गैर-लाभकारी कॉमन क्रॉल फाउंडेशन बड़े कैप्चर प्रकाशित करता है जिनका शोधकर्ताओं और डेवलपर्स द्वारा बिना एक वेब-स्केल क्रॉलर बनाए उपयोग किया जा सकता है।
  • कॉर्पस में कई प्रतिनिधित्व होते हैं। WARC कच्चे क्रॉल रिकॉर्ड रखता है, WAT व्युत्पन्न मेटाडेटा को शामिल करता है, और WET निकाले गए प्लेनटेक्स्ट को शामिल करता है।
  • एक अनुक्रमणिका को बड़े डाउनलोड से पहले आना चाहिए। CDXJ और स्तंभ URL अनुक्रमणिकाएँ उपयोगकर्ताओं को अभिलेखों को खोजने और फ़ाइलों को पढ़ने से पहले अनुमान लगाने में मदद करती हैं।
  • एक क्रॉल एक नमूना है, वेब की पूर्ण प्रतिलिपि नहीं। खोज नीति, रोबोट नियम, क्रॉल समय, विफलताएँ, डुप्लिकेट, और भाषा पहचान यह निर्धारित करते हैं कि क्या दिखाई देता है।
  • खुली पहुँच नीचे की ओर दायित्वों को नहीं हटाती। उपयोगकर्ताओं को फिर भी गोपनीयता, कॉपीराइट, संवेदनशील सामग्री, और योजनाबद्ध उपयोग के लिए उपयुक्तता का आकलन करने की आवश्यकता होती है।

कॉमन क्रॉल परिभाषित

कॉमन क्रॉल एक गैर-लाभकारी परियोजना है जो सार्वजनिक रूप से पहुंच योग्य वेब पृष्ठों को क्रॉल करती है और परिणामी अभिलेखागार और व्युत्पन्न डेटासेट प्रकाशित करती है। कॉमन क्रॉल फाउंडेशन अवलोकन संगठन, इसके संग्रहण इतिहास, और यह जो स्वरूप प्रदान करता है, उसे वर्णित करता है। कॉर्पस का उपयोग वेब अनुसंधान, भाषा विश्लेषण, खोज प्रयोगों, अभिलेखीय अध्ययन, और मशीन-लर्निंग डेटा पाइपलाइनों में किया जाता है।

यह परियोजना एक महंगा अवरोध कम करती है: एक व्यापक वेब नमूना एकत्र करना। एक उपयोगकर्ता अनुक्रमणिकाओं का क्वेरी कर सकता है, अभिलेखों का चयन कर सकता है, और बिना मूल क्रॉल बेड़े का संचालन किए संग्रहित प्रतिक्रियाओं को संसाधित कर सकता है। कॉमन क्रॉल उन अभिलेखों को कार्य-तैयार डेटासेट में परिवर्तित नहीं करता। सफाई, डुप्लिकेशन हटाना, भाषा पहचान, गुणवत्ता फ़िल्टरिंग, सुरक्षा समीक्षा, और कानूनी विश्लेषण डाउनस्ट्रीम कार्य रहते हैं।

प्रत्येक नामित क्रॉल एक समय-सीमा वाला कैप्चर है जिसकी अपनी कवरेज है। एक पृष्ठ अनुपस्थित हो सकता है क्योंकि क्रॉलर ने इसे खोजा नहीं, रोबोट नियमों ने पहुँच को अवरुद्ध किया, होस्ट अनुपलब्ध था, अनुरोध विफल हो गया, URL की प्राथमिकता कम हो गई, या सामग्री क्रॉल के बाद प्रकट हुई। उपस्थित भी सीमित है: एक संग्रहित प्रतिक्रिया एक रीडायरेक्ट, त्रुटि पृष्ठ, सहमति स्क्रीन, या आंशिक रेंडर हो सकती है, बजाय इसके कि किसी व्यक्ति ने जो सामग्री अपेक्षित की थी।

इसलिए कॉमन क्रॉल को संग्रह अवसंरचना और एक ऐतिहासिक कॉर्पस के रूप में सबसे अच्छा समझा जाता है। यह कच्चे और व्युत्पन्न सामग्री के साथ-साथ अनुक्रमणिकाएं प्रदान करता है। यह सटीकता, प्रतिनिधित्व, अधिकार, या किसी विशेष मॉडल या विश्लेषण के लिए उपयुक्तता की प्रमाणित नहीं करता। ये प्रश्न उपयोगकर्ता के होते हैं जो डेटा का चयन और परिवर्तन करता है।

कॉमन क्रॉल डेटा कैसे व्यवस्थित है

क्रॉल प्रक्रिया URL खोजती है, प्रतिक्रियाएँ प्राप्त करती है, और अभिलेखों को संग्रह फ़ाइलों में लिखती है। कॉमन क्रॉल अपने क्रॉलर को CCBot के रूप में पहचानता है और इसके व्यवहार के बारे में जानकारी प्रकाशित करता है। साइटें क्रॉल नियमों को robots.txt के माध्यम से व्यक्त कर सकती हैं, जिसका मानक व्याकरण रोबोट्स बहिष्करण प्रोटोकॉलद्वारा परिभाषित किया गया है। एक नियम क्रॉलर की पहुँच को प्रभावित करता है; यह शेष वेब को अदृश्य नहीं बनाता या डाउनस्ट्रीम उपयोग के लिए एक लाइसेंस Grant नहीं करता।

WARC फ़ाइलें कच्चे क्रॉल रिकॉर्ड को संरक्षित करती हैं। वे HTTP अनुरोध, प्रतिक्रियाएँ, और क्रॉल मेटाडेटा को शामिल कर सकती हैं। यह परत उस वस्तु के सबसे निकट है जो क्रॉलर ने प्राप्त की थी और तब उपयोगी होती है जब हेडर, स्थिति, पे लोड बाइट्स, या सामग्री प्रकार महत्वपूर्ण होते हैं। फ़ाइलें संकुचित और विभाजित होती हैं, इसलिए बिना दायरे को संकीर्ण किए संपूर्ण क्रॉल पढ़ना अधिक महंगा और अधिकांश परियोजनाओं के लिए अनावश्यक है।

WAT फ़ाइलों में कच्चे अभिलेखों से व्युत्पन्न मेटाडेटा होते हैं, जिसमें हेडर और खोजे गए लिंक जैसी जानकारी शामिल होती है। WET फ़ाइलें निकाले गए प्लेनटेक्स्ट को शामिल करती हैं, जो भाषा और पाठ विश्लेषण के लिए सुविधाजनक होती है लेकिन मूल संरचना का अधिकांश भाग छोड़ देती है। कॉमन क्रॉल डेटा गाइड इन स्वरूपों और कच्चे डेटा, मेटाडेटा, और निकाले गए पाठ के बीच के अंतर को स्पष्ट करता है।

अनुक्रमणिकाएँ URLs और क्रॉल अभिलेखों को संग्रह में स्थानों से मानचित्रित करती हैं। एक लक्षित कार्यप्रवाह एक अनुक्रमणिका का क्वेरी करता है, संग्रह फ़ाइल नाम, बाइट ऑफसेट, और रिकॉर्ड लंबाई जैसे फ़ील्ड प्राप्त करता है, फिर केवल आवश्यक रेंज का अनुरोध करता है। यह हर WARC को डाउनलोड करने से तेज और सस्ता है। विश्लेषणात्मक परियोजनाएँ भी डोमेन, स्थिति कोड, मीडिया प्रकार, या क्रॉल विभाजन के बीच बड़े फ़िल्टरिंग के लिए स्तंभ URL अनुक्रमणिका का उपयोग कर सकती हैं।

WARC, WAT, WET, और अनुक्रमणिका डेटा

आवश्यक साक्ष्य को बनाए रखते हुए सबसे हल्की प्रतिनिधित्व चुनने से कॉमन क्रॉल कार्य को समझने योग्य और लागत-सचेत बनाए रखता है।

आव_dimensionप्राथमिक अर्थकॉमन गलती
WARCकच्चा अनुरोध, प्रतिक्रिया, और क्रॉल रिकॉर्ड।URLs को पहले संकीर्ण किए बिना हर पाठ-केवल कार्य के लिए इसका उपयोग करना।
WATव्युत्पन्न मेटाडेटा जैसे हेडर और लिंक जानकारी।मान लेना कि मेटाडेटा में पूरा पृष्ठ शरीर शामिल है।
WETपाठ प्रसंस्करण के लिए निकाला गया प्लेनटेक्स्ट।निकाली गई सामग्री को लेआउट, तालिकाएँ, या स्क्रिप्ट की एक सही प्रति के रूप में मानना।
CDXJ अनुक्रमणिकाव्यक्तिगत अभिलेखों के लिए URL लुकअप और संग्रह स्थान।अर्थ मास्टर हिट को इस बात के प्रमाण के साथ भ्रमित करना कि संग्रहित प्रतिक्रिया उपयोगी है।
स्तंभ URL अनुक्रमणिकाएक कॉलम फ़ॉर्मेट में बैक विश्लेषणात्मक फ़िल्टरिंग।प्रश्न की आवश्यकता से अधिक विभाजन और कॉलम स्कैन करना।

सामान्य क्रॉल का उपयोग किस लिए किया जाता है।

कोरपस उन परियोजनाओं का समर्थन करता है जो व्यापक वेब कवर से लाभान्वित होते हैं, बशर्ते नमूनाकरण और रूपांतरण विकल्प स्पष्ट रहें।

वेब और भाषा अनुसंधान।

शोधकर्ता बड़े नमूनों में लिंक, डोमेन, भाषाओं, टेम्पलेट और सामग्री परिवर्तन को मापते हैं।

खोज और जानकारी पुनर्प्राप्ति।

टीमें चुने गए रिकॉर्ड से अनुक्रमणिका, रैंकिंग प्रयोग, दस्तावेज़ संग्रह और पुनर्प्राप्ति बेंचमार्क बनाती हैं।

मशीन-लर्निंग कोर्पोरा।

फ़िल्टर की गई पाठ या बहु-आधार सेट प्री-ट्रेनिंग और मूल्यांकन का समर्थन कर सकते हैं, जिसके बाद अधिकार, गुणवत्ता, सुरक्षा और डुप्लिकेशन समीक्षा होती है।

ऐतिहासिक तुलना।

एक डोमेन, विषय, या वेब प्रौद्योगिकी में परिवर्तन दिखाने के लिए क्रमिक क्रॉल कर सकते हैं, हालांकि क्रॉल कवरेज को नियंत्रित किया जाना चाहिए।

एक व्यावहारिक सामान्य क्रॉल वर्कफ़्लो।

क्रॉल चुनने से पहले अनुसंधान प्रश्न लिखें। एक वर्तमान-भाषा अध्ययन को नवीनतम उपलब्ध विभाजन की आवश्यकता हो सकती है। एक ऐतिहासिक विश्लेषण को तुलनीय समय विंडो की आवश्यकता होती है। एक डोमेन ऑडिट केवल एक छोटी सूची URL उपसर्ग की आवश्यकता हो सकती है। प्रश्न निर्धारित करता है कि कौन से क्रॉल आईडी, अनुक्रमणिका, फ़ाइल प्रकार और क्षेत्र क्षेत्र में हैं।

अनुक्रमणिका को क्वेरी करें और क्वेरी पैरामीटर सहेजें। क्रॉल संग्रह, URL पैटर्न, मिलान मोड, स्थिति फ़िल्टर, मीडिया प्रकार, और अनुक्रमणिका पंक्तियों पर लागू किसी भी डुप्लिकेशन को रिकॉर्ड करें। एक बाम कार्य शुरू करने से पहले हिट के एक नमूने की समीक्षा करें। एक अनुक्रमणिका लॉगिन पृष्ठों, रीडायरेक्ट, त्रुटि प्रतिक्रियाएँ, या संबंधित उपडोमेन को इंगित कर सकती है जो नाम साझा करती हैं।

जब कच्चा सबूत मायने रखता है, तो चयनित WARC रिकॉर्ड के लिए बाइट रेंज फ़ेच करें। पार्स करने से पहले WARC लक्ष्य URI, प्रतिक्रिया स्थिति, सामग्री प्रकार, कैप्चर समय, और पेलोड सत्यापित करें। केवल पाठ विश्लेषण के लिए, WET आउटपुट के एक नमूने की तुलना उसके संबंधित कच्चे रिकॉर्ड से करें ताकि यह समझा जा सके कि निष्कर्षण चरण ने क्या हटाया या बदल दिया।

एक व्युत्पन्न-डेटासेट मैनिफेस्ट बनाएं। इनपुट क्रॉल आईडी, कोड संस्करण, फ़िल्टर, ब्लॉक सूचियाँ, भाषा मॉडल, गुणवत्ता थ्रेसहोल्ड, डुप्लिकेशन विधि, और आउटपुट स्कीमा सूचीबद्ध करें। जब नीति की अनुमति हो, तो WARC स्थानों की ओर रिकॉर्ड-स्तर के संकेतों को बनाए रखें। वह वंश किसी अन्य समीक्षक को यह पुनर्निर्माण करने की अनुमति देता है कि कोई दस्तावेज़ अंतिम सेट में क्यों प्रवेश किया या निकला।

कवरेज और डेटा-गुणवत्ता सीमाएँ।

सामान्य क्रॉल पूरे वेब को कैप्चर नहीं कर सकता है। सार्वजनिक वेब निरंतर बदलता है, URL खोज असमान है, और होस्ट विभिन्न एक्सेस नीतियाँ लागू करते हैं। बड़े वेबसाइटें कैलेंडर्स, माप, मिरर, या उत्पन्न पृष्ठों के माध्यम से एक नमूने में दबदबा बना सकती हैं। छोटे साइटों में inbound लिंक कम हो सकते हैं और उन्हें कम कवरेज मिल सकता है। पृष्ठ गिनती सीधे प्रतिनिधि सामग्री में तब्दील नहीं होती।

रेंडरिंग एक और सीमा है। एक क्रॉलर प्रतिक्रिया में प्रारंभिक HTML समाहित हो सकता है बजाय अंतिम पृष्ठ के जो एक ब्राउज़र JavaScript चलाने के बाद बनाता है। इसलिए, WET निष्कर्षण क्लाइंट-रेंडर की गई इंटरफेस के लिए खाली या अधूरा हो सकता है। एक वर्तमान ब्राउज़र या रेंडरिंग सेवा एक तुलना प्रदान कर सकती है, लेकिन नए कैप्चर को संग्रहित सबूत के साथ चुपचाप प्रतिस्थापित नहीं किया जाना चाहिए।

पाठ पाइपलाइनों से शोर बढ़ सकता है। नेविगेशन, कुकी नोटिस, स्क्रैप की गई प्रतियां, मशीन-जनित पृष्ठ, स्पैम, और दोहराए गए टेम्पलेट निष्कर्षण के बाद जीवित रह सकते हैं। भाषा पहचानकर्ताओं को छोटे या मिश्रित-भाषा रिकॉर्ड को गलत वर्गीकृत कर सकते हैं। गुणवत्ता फ़िल्टर औसत में सुधार कर सकते हैं जबकि बोलियों, कोड-स्विचिंग, या कम-संसाधन भाषाओं को हटा सकते हैं। स्लाइस-स्तरीय आँकड़े और नमूने प्रकाशित करें।

खुली उपलब्धता एक सार्वभौमिक अनुमति कथन नहीं है। एक डाउनस्ट्रीम उपयोगकर्ता को व्यक्तिगत डेटा, कॉपीराइटेड कार्य, संवेदनशील सामग्री, संविदात्मक प्रतिबंध, और प्रसंस्करण के उद्देश्य का मूल्यांकन करना चाहिए। अप्वर्तन और हटाने के अनुरोधों को किसी भी व्युत्पन्न डेटा सेट में एक प्रलेखित मार्ग की भी आवश्यकता होती है। सामान्य क्रॉल की संग्रह नीति उपयोगकर्ता के अपने कानूनी और नैतिक समीक्षा को प्रतिस्थापित नहीं करती।

एक सामान्य क्रॉल डेटासेट को मान्य कैसे करें।

डोमेन, भाषा, समय, प्रतिक्रिया स्थिति, मीडिया प्रकार, और स्रोत सांद्रता द्वारा कवरेज की रिपोर्ट करें। अनुक्रमणिका क्वेरी और क्रॉल पहचानकर्ता शामिल करें ताकि नमूना पुन: प्रस्तुत किया जा सके। यदि विश्लेषण क्रॉल की तुलना करता है, तो सामग्री के आंदोलन को वेब में परिवर्तन के रूप में व्याख्या करने से पहले खोज और कैप्चर मात्रा में परिवर्तनों के लिए सामान्यीकृत करें।

कई स्तरों पर डुप्लिकेट मापें: सटीक पेलोड, सामान्यीकृत पाठ, टेम्पलेट, और निकट-डुप्लिकेट दस्तावेज़। परिणाम के बगल में नियम और थ्रेशोल्ड रखें। कई मिरर किए गए URLs वाला एक डोमेन अन्यथा गिनती में दबदबा बना सकता है। साथ ही, दोहराया हुआ कानूनी पाठ या नेविगेशन को समग्र पृष्ठ को त्यागने की तुलना में खंड स्तर पर बेहतर हटाया जा सकता है।

जुड़े हुए रिकॉर्ड के साथ निष्कर्षण गुणवत्ता का ऑडिट करें। चुने गए WARC पेलोड के खिलाफ WET पाठ की तुलना करें, शीर्षकों, मुख्य पाठ, तालिकाओं, कोडिंग और बॉयलरप्लेट की जाँच करें। JavaScript-हेवी पृष्ठों के लिए, दस्तावेज़ करें कि संग्रह केवल प्राप्त प्रतिक्रिया शामिल करता है। गायब रेंडर पाठ को अनुमानों से भरें नहीं।

हर रूपांतरण के माध्यम से उत्पत्ति ट्रैक करें। एक अंतिम पंक्ति को क्रॉल आईडी, WARC फ़ाइल नाम, ऑफ़सेट, लक्ष्य URI, कैप्चर समय, और परिवर्तन संस्करण से पता लगाया जाना चाहिए जहां संभव हो। जब किसी रिकॉर्ड को हटा दिया जाता है, तो प्रभावित नियम और व्युत्पन्न रिलीज को रिकॉर्ड करें। इससे डेटा सेट बनाए रखने योग्य बनता है बजाय कि एक बार का निर्यात।

निष्कर्ष।

सामान्य क्रॉल संग्रहित वेब डेटा के साथ काम करने के लिए एक खुली संरचना है। यह बड़े क्रॉल संग्रह, कच्चे WARC रिकॉर्ड, व्युत्पन्न WAT और WET फ़ाइलों, और अनुक्रमणिकाओं को प्रकाशित करता है जो लक्षित पहुंच को संभव बनाते हैं। यह प्रोजेक्ट उपयोगकर्ताओं को वेब-स्केल क्रॉलर संचालित करने से बचाता है, लेकिन यह एक पूरा अनुसंधान या प्रशिक्षण डेटा सेट प्रदान नहीं करता।

उपयोगी कार्य एक संकीर्ण प्रश्न, एक अनुक्रमणिका क्वेरी, और एक पुनरुत्पादनीय मैनिफेस्ट के साथ शुरू होता है। कवरेज, रेंडरिंग, डुप्लिकेशन, अधिकार, और निष्कर्षण गुणवत्ता को अनुमानित करने के बजाय मापना चाहिए। जब वर्तमान पृष्ठों को तुलना के लिए जोड़ा जाता है, तो उनके अधिग्रहण की विधि और समय को संग्रह से अलग रखें।

क्या आप अभिलेखित और वर्तमान वेब डेटा की तुलना के लिए तैयार हैं?

अनुमति प्राप्त वर्तमान पृष्ठ अधिग्रहण के लिए Scrapeless Universal Scraping API का उपयोग करें जबकि समान सबूत मॉडल में सामान्य क्रॉल रिकॉर्ड पॉइंटर्स और टाइमस्टैम्प को बनाए रखते हुए।

आज ही साइन अप करें और प्राप्त करें $5 मुफ्त क्रेडिटकोई क्रेडिट कार्ड की जरूरत नहीं.

अपने $5 क्रेडिट का दावा करें →

सूची

क्या कॉमन क्रॉल एक सर्च इंजन है?

नहीं। कॉमन क्रॉल वेब क्रॉल अभिलेखों और अनुक्रमणिकाओं को प्रकाशित करता है। उपयोगकर्ता अपने स्वयं के क्वेरी, विश्लेषण, खोज अनुक्रमणिकाओं, या उन सामग्रियों से व्युत्पन्न डेटा सेट बनाते हैं।

WARC और WET के बीच अंतर क्या है?

WARC कच्चे क्रॉल रिकॉर्ड और HTTP पेलोड को संरक्षित करता है। WET में निकाली गई प्लेनटेक्स्ट होती है, जो पाठ प्रसंस्करण के लिए आसान होती है लेकिन पृष्ठ संरचना और अन्य प्रतिक्रिया विवरण खो देती है।

क्या हर वेबसाइट कॉमन क्रॉल में शामिल है?

नहीं। प्रत्येक क्रॉल एक नमूना है जिसे खोज, प्राथमिकता, रोबोट नियम, समय, होस्ट की उपलब्धता, और अनुरोध परिणामों द्वारा आकार दिया गया है।

क्या कॉमन क्रॉल डेटा AI प्रशिक्षण के लिए उपयोग किया जा सकता है?

यह प्रशिक्षण डेटा पाइपलाइन के लिए एक इनपुट हो सकता है, लेकिन उपयोगकर्ताओं को गुणवत्ता और सुरक्षा को फ़िल्टर करना होगा, डुप्लिकेशन और कवरेज को मापना होगा, और अधिकार, गोपनीयता और अनुमति का मूल्यांकन करना होगा।

कॉमन क्रॉल अनुक्रमणिका को सबसे पहले खोजने का कारण क्या है?

अनुक्रमणिका उन रिकॉर्ड्स की पहचान करती है जो लक्षित मेल खाते हैं और वे संग्रह फ़ाइलों में कहाँ रहते हैं, जिससे लक्षित रेंज अनुरोधों की अनुमति मिलती है, बड़े संग्रहों को अंधाधुंध डाउनलोड करने के बजाय।

संदर्भ