माइक्रोडाटा क्या है? HTML संरचित डेटा व्याख्या

माइक्रोडाटा क्या है?

स्क्रेपलेस यूनिवर्सल स्क्रेपिंग API संरचित डेटा निष्कर्षण कार्यप्रवाह के लिए वेब पेज प्राप्त करता है, जिसमें वे पृष्ठ शामिल हैं जिनका दृश्य सामग्री JavaScript के साथ प्रस्तुत किया गया है।

TL;DR

  • माइक्रोडाटा मौजूदा HTML को मशीन-पढ़ने योग्य अर्थ के साथ एनोटेट करता है। यह सामान्य तत्वों में गुण जोड़ता है बजाय इसके कि संरचित डेटा को एक अलग दस्तावेज़ में रखा जाए।
  • एक माइक्रोडाटा आइटम का एक प्रकार और नामित गुण होते हैं। मुख्य गुण दायरा, शब्दावली, पहचान, संपत्ति नाम और गैर-वंशानुगामी तत्वों के संदर्भ परिभाषित करते हैं।
  • Schema.org और माइक्रोडाटा अलग परतें हैं। Schema.org एक शब्दावली प्रदान करता है; माइक्रोडाटा उस शब्दावली को HTML से संलग्न करने के लिए एक वाक्यविन्यास प्रदान करता है।
  • माइक्रोडाटा उपयोगी है लेकिन पृष्ठ मार्कअप से मजबूती से जुड़ा हुआ है। टेम्पलेट में परिवर्तन एनोटेशन या निष्कर्षण नियमों को तोड़ सकते हैं भले ही दृश्य पृष्ठ अभी भी सही दिखता हो।
  • JSON-LD अक्सर खोज मार्कअप के लिए बनाए रखना आसान होता है। जब अर्थ दृश्य तत्वों से जुड़े रहना चाहिए तो माइक्रोडाटा मान्य रहता है और बेहतर फिट हो सकता है।

माइक्रोडाटा एक संरचित डेटा वाक्यविन्यास है जो HTML में निर्मित है। यह एक प्रकाशक को एक ऐसी चीज़ की पहचान करने देता है जो एक पृष्ठ पर वर्णित है—जैसे उत्पाद, घटना, व्यक्ति, नुस्खा या लेख—और उन चीज़ों से संबंधित गुणों को लेबल करने देता है। एक ब्राउज़र अभी भी वही शीर्षक, लिंक, छवियाँ और पाठ प्रस्तुत करता है। अतिरिक्त गुण पार्सर्स, क्रॉवलर्स, खोज प्रणालियों, एक्सेसिबिलिटी उपकरणों और डेटा निष्कर्षण सॉफ़्टवेयर के लिए वैकल्पिक मशीन-पठनीय परत बनाते हैं।

वह WHATWG माइक्रोडाटा अनुभाग HTML मानक का प्रक्रिया मॉडल को परिभाषित करता है। वह मानक संदर्भ मायने रखता है क्योंकि माइक्रोडाटा एक दृश्य विजेट या एक खोज-इंजन प्लगइन नहीं है। यह दस्तावेज़ का एक भाग है, और इसका अर्थ आइटम दायरे, संपत्ति मूल्यों, URL और Nested आइटम के बारे में नियमों का पालन करता है।

माइक्रोडाटा एक संस्थान को कैसे दर्शाता है

माइक्रोडाटा एक संस्थान को एक आइटम के रूप में दर्शाता है जिसमें शून्य या अधिक गुण होते हैं। एक आइटम एक HTML तत्व पर प्रारंभ होता है जो itemscope गुण अन्य चीजें जोड़ता है। वैकल्पिक itemtype गुण एक या अधिक शब्दावली URLs प्रदान करता है जो परिभाषित करता है कि आइटम किस प्रकार की संस्था को दर्शाता है। वंशानुगामी तत्व जो itemprop जोड़ी गई नामित मानों में योगदान करते हैं।

मान हमेशा दृश्य पाठ से नहीं आता। एक लिंक अपने URL का योगदान करता है, एक छवि अपने स्रोत URL का योगदान करती है, एक समय तत्व एक मशीन-पढ़ने योग्य दिनांक और समय मान का योगदान कर सकता है, और एक मेटा तत्व एक मान को ले जा सकता है जिसे सामान्य गद्य के रूप में प्रकट होने की आवश्यकता नहीं है। इस प्रकार, एक पार्सर माइक्रोडाटा के मान नियमों का पालन करता है बजाय इसके कि टैग को हटा दिया जाए और जो भी पाठ रहता है उसे पढ़ा जाए।

दो अतिरिक्त गुण संबंधों को कवर करते हैं जिन्हें साधारण नेस्टिंग व्यक्त नहीं कर सकती। itemid जब शब्दावली इसका समर्थन करती है तब एक टाइप किए गए आइटम को एक वैश्विक पहचान प्रदान करता है। itemref ऐसे तत्वों की ओर संकेत करता है जो समान दस्तावेज़ में हैं जिनकी संपत्तियों को आइटम में शामिल किया जाना चाहिए। ये सुविधाएँ वास्तविक टेम्पलेट में मदद करती हैं, लेकिन इसका अर्थ यह भी है कि एक्सट्रैक्टर को संपूर्ण मॉडल का कार्यान्वयन करना चाहिए बजाय इसके कि अलग-थलग itemprop स्ट्रिंग्स।

माइक्रोडाटा विशेषताएँ एक नज़र में

गुणभूमिकासामान्य गलती
itemscopeएक नया आइटम बनाता है।बिना स्पष्ट स्वामित्व वाले आइटम के गुण जोड़ना।
itemtypeआइटम को एक शब्दावली प्रकार से जोड़ता है।जहाँ एक स्पष्ट शब्दावली URL की आवश्यकता है वहां लेबल का उपयोग करना।
itempropवर्तमान आइटम के एक गुण का नाम।यह मान लेना कि दृश्य पाठ हमेशा निकाले गए मूल्य है।
itemidअनुमति मिलने पर एक टाइप किए गए आइटम की वैश्विक पहचान करता है।इसे एक विवेचना डेटाबेस कुंजी के रूप में मान लेना।
itemrefसंदर्भित तत्वों से गुण शामिल करता है।निष्कर्षण के दौरान संदर्भित नोड को अनदेखा करना।

Schema.org कहाँ फिट होता है

Schema.org एक साझा शब्दावली है, जबकि Microdata एक अनुक्रमण सिंटैक्स है। Schema.org शुरू करने का सामग्री उत्पाद और घटना जैसी दस्तावेज़ प्रकार और नाम, छवि, और startDate जैसी गुणों को। एक प्रकाशक माइक्रोडाटा, RDFa, या JSON-LD के साथ उन सभी समान शर्तों को व्यक्त कर सकता है। सिंटैक्स बदलने से शब्दावली या इच्छित इकाई मॉडल स्वतः ही नहीं बदलते।

यह भेद एक सामान्य योजना त्रुटि को रोकता है। एक टीम कह सकती है कि यह “Schema का उपयोग करती है” जबकि वास्तविक प्रश्न अलग हैं: कौन सी शब्दावली प्रकार व्यवसाय इकाई का सही वर्णन करता है? कौन सा प्रारूप प्रदर्शन स्टैक में फिट बैठता है? कौन से उपभोक्ता चुने हुए संयोजन का समर्थन करते हैं? कौन सी सत्यापन नियम किसी विशेष खोज सुविधा पर लागू होते हैं? उन प्रश्नों का स्वतंत्र रूप से उत्तर देना साफ मार्कअप और अधिक विश्वसनीय निकासी उत्पन्न करता है।

कैसे पार्सर्स माइक्रोडाटा निकालते हैं

एक conforming extractor शीर्ष-स्तरीय वस्तुओं के साथ शुरू होता है, प्रत्येक वस्तु के प्रकार और पहचानकर्ता का निर्धारण करता है, फिर descendents और किसी संदर्भित नोड से गुण मान हल करता है। नेस्टेड आइटम संरचित मान बने रहते हैं बजाय असंबंधित पाठ में समतल होने के। URL-मूल्य वाले गुण दस्तावेज़ आधार URL के खिलाफ हल होते हैं, इसलिए अंतिम मूल्य स्रोत HTML में पाए गए शाब्दिक गुण से भिन्न हो सकता है।

उत्पादन निकासी एक और प्रश्न जोड़ती है: कौन सा दस्तावेज़ पार्स किया जाना चाहिए? सर्वर HTML पहले से ही माइक्रोडाटा शामिल कर सकता है, या एक क्लाइंट एप्लिकेशन JavaScript चलाने के बाद गुण जोड़ सकता है। एक कच्चा HTTP प्रतिक्रिया और एक रेंडर किया गया DOM इसलिए विभिन्न संरचित डेटा को उजागर कर सकते हैं। अधिग्रहण चरण को आउटपुट के साथ रिकॉर्ड किया जाना चाहिए ताकि डाउनस्ट्रीम उपयोगकर्ता जान सकें कि क्या डेटासेट स्रोत HTML या ब्राउज़र-रेंडर की गई स्थिति को दर्शाता है।

माइक्रोडाटा, JSON-LD, और RDFa

माइक्रोडाटा गुणों को HTML तत्वों पर सीधे रखता है। JSON-LD आमतौर पर एक स्क्रिप्ट ब्लॉक में एक JSON ऑब्जेक्ट रखता है, जो दृश्यमान सामग्री से अलग होता है। RDFa भी मार्कअप को एनोटेट करता है, लेकिन यह RDF डेटा मॉडल से आता है और सामान्य Schema.org प्रकाशन कार्यप्रवाह से परे लिंक किए गए डेटा पैटर्न का समर्थन करता है। सभी तीन संरचित डेटा को व्यक्त कर सकते हैं, फिर भी वे अलग-अलग रखरखाव और निकासी व्यापार-बंद बनाते हैं।

Google Search Central के संरचित डेटा मार्गदर्शन सुझाव करता है कि यदि साइट का सेटअप इसका समर्थन करता है तो JSON-LD का उपयोग किया जाए क्योंकि प्रस्तुति से अलगाव नेस्टेड डेटा को रखरखाव के लिए आसान बनाता है। वह सिफारिश माइक्रोडाटा को अमान्य नहीं करती है। माइक्रोडाटा समझदारी से हो सकता है जब टेम्पलेट पहले से ही प्रत्येक सामयिक गुण को एक दृश्यमान तत्व से बांधते हैं और संगठन चाहता है कि एनोटेशन उस तत्व के साथ आगे बढ़े।

प्रश्नमाइक्रोडाटाJSON-LDRDFa
जहां मान निवास करते हैंHTML तत्वों परएक JSON-LD ब्लॉक मेंHTML तत्वों पर
प्रस्तुति युग्मनउच्चनिम्नउच्च
साधारण ताकतदृश्यमान-समग्री संरेखणटेम्पलेट रखरखावलिंक किए गए डेटा का एक्सप्रेशन
निकासी की आवश्यकताHTML-अवगत आइटम पार्सिंगJSON पार्सिंग और ग्राफ हैंडलिंगRDFa-अवगत पार्सिंग

सामान्य माइक्रोडाटा विफलता मोड्स

टूटे हुए दायरे सबसे बुनियादी विफलता हैं। एक गुण को उस तत्व के बाहर रखा जा सकता है जो संबंधित आइटम का मालिक है, जिससे एक पार्सर इसे कहीं और संलग्न करने या नज़रअंदाज़ करने का कारण बनता है। नेस्टेड इकाइयां भी गलत तरीके से मॉडल की जा सकती हैं: एक पता अक्सर उस आइटम के साथ होना चाहिए जिसमें अपनी ही गुण होते हैं, न कि उस पाठ सेassembled एक स्ट्रिंग जो पास के ही होता है।

शब्दावली बहाव एक सूक्ष्म दोष उत्पन्न करता है। एक गुण नाम एक प्रकार के लिए मान्य हो सकता है लेकिन दूसरे के लिए नहीं, या एक खोज सुविधा ऐसे क्षेत्रों की आवश्यकता कर सकती है जिन्हें सामान्य शब्दावली वैकल्पिक मानती है। इसलिए सत्यापन को दो स्तरों पर होना चाहिए: व्याकरण और डेटा-मॉडल सहीता, इसके बाद उपभोक्ता-विशिष्ट पात्रता जांच। एक परीक्षण पास करने से समृद्ध परिणाम या किसी विशेष प्रस्तुति की गारंटी नहीं होती है।

डुप्लिकेट सत्यता एक और जोखिम है। एक साइट माइक्रोडाटा को JSON-LD के बगल में ले जा सकती है और हर एक में विभिन्न कीमतें, तिथियां, या मूल URLs प्रस्तुत कर सकती है। एक्सट्रैक्टर्स को प्रलेखन को बनाए रखना चाहिए और या तो एक प्राधिकृत प्रतिनिधित्व का चयन करना चाहिए या संघर्ष की रिपोर्ट करना चाहिए। प्रकाशकों को एक डेटा स्रोत से सभी संरचित प्रारूप उत्पन्न करने चाहिए न कि उन्हें स्वतंत्र रूप से संपादित करना चाहिए।

खोज उपस्थिति के परे व्यावहारिक उपयोग

इकाई निकासी

एक क्रॉलर उत्पाद, घटना, संगठन, या लेख गुणों को प्रकारित रिकॉर्ड में मैप कर सकता है बिना हर क्षेत्र को चारों ओर की गद्य से अनुमान लगाए।

गुणवत्ता आश्वासन

एक निगरानी कार्य दृश्य मानों की तुलना मशीन-पठनीय मानों से कर सकता है और पुराने दाम, गायब पहचानकर्ता, या अमान्य नेस्टिंग को चिह्नित कर सकता है।

सामग्री प्रवासन

एक प्रवास पाइपलाइन इकाई मेटाडेटा को संरक्षित कर सकती है जबकि सामग्री प्रणालियों के बीच पृष्ठों को स्थानांतरित कर सकती है, बशर्ते शब्दावली मैपिंग की समीक्षा की जाए।

डेटासेट संवर्धन

माइक्रोडाटा स्पष्ट नाम, तिथियां, और संबंध प्रदान कर सकता है जो पाठ निकासी को पूरा करते हैं, हालांकि मानों की अभी भी सत्यापन की आवश्यकता होती है।

माइक्रोडाटा का चयन और रखरखाव कैसे करें

जब सेमांटिक एनोटेशन स्थिर, सर्वर-Render किए गए तत्वों के लिए स्वाभाविक रूप से संबंधित होते हैं और विकास टीम मार्कअप का परीक्षण टेम्प्लेट का हिस्सा होने में सहज होती है, तो माइक्रोडाटा चुनें। जब एंटिटी ग्राफ जटिल होता है, कई दृश्य तत्व एक रिकॉर्ड में योगदान करते हैं, या सामग्री और प्रस्तुति विभिन्न कार्यक्रमों पर बदलते हैं, तो JSON-LD को प्राथमिकता दें। जब लिंक किए गए डेटा की आवश्यकताएँ इसके ग्राफ मॉडल को बेहतर फिट बनाती हैं, तो RDFa को प्राथमिकता दें।

रखरखाव में टेम्प्लेट-स्तरीय परीक्षण, प्रतिनिधिक Render की गई पृष्ठ, शब्दावली मान्यता, और उपभोक्ता-विशिष्ट जांच शामिल होनी चाहिए। पृष्ठ URL का ट्रैक रखें, कैप्चर विधि, निष्कर्षण समय पद, आइटम प्रकार, कच्ची संपत्ति मूल्य, सामान्यीकृत मूल्य, और मान्यता परिणाम। ये फ़ील्ड्स परिवर्तनों को स्पष्ट बनाने में मदद करते हैं जब एक डिज़ाइन एक विशेषता को स्थानांतरित करता है या एक क्लाइंट स्क्रिप्ट उसके डालने में देरी करता है।

वेब-स्केल संग्रह के लिए, अधिग्रहण और पार्सिंग अलग रहनी चाहिए। Scrapeless यूनिवर्सल स्क्रैपिंग API निष्कर्षण चरण के लिए पृष्ठ सामग्री प्रदान कर सकता है, जबकि पार्सर माइक्रोडाटा नियमों को लागू करता है और परिणाम को एक स्थिर डाउनस्ट्रीम स्कीमा में मानचित्रित करता है। समीक्षा करें Scrapeless मूल्य निर्धारण योजना की गई पृष्ठ मात्रा के लिए अधिग्रहण लागत का अनुमान लगाने के समय।

निष्कर्ष

माइक्रोडाटा HTML-स्थानिक संरचित डेटा है: आइटम संस्थाओं को परिभाषित करते हैं, संपत्तियाँ मानों को परिभाषित करती हैं, और एक शब्दावली साझा अर्थ प्रदान करती है। यह तब अच्छी तरह से काम करता है जब सेमांटिक एनोटेशन स्थिर दृश्य तत्वों के साथ संरेखित रहते हैं। विश्वसनीय उपयोग पूरे आइटम मॉडल को पार्सिंग, सही पृष्ठ प्रस्तुति को कैप्चर करने, शब्दावली नियमों को मान्यता देने, और जब कई संरचित प्रारूप सह-अस्तित्व में होते हैं तो प्रचलन को ट्रैक करने पर निर्भर करता है।

क्या आप एक संरचित-डेटा वर्कफ़्लो बनाने के लिए तैयार हैं?

पार Public वेब पृष्ठों को प्राप्त करने के लिए Scrapeless का उपयोग करें, फिर माइक्रोडाटा को रिकॉर्ड में मान्य और मैप करें जिन पर आपकी पाइपलाइन विश्वास कर सके।

फ्री शुरू करें →

FAQ

क्या माइक्रोडाटा वही है जो Schema.org है?

नहीं। माइक्रोडाटा एक HTML सिंटैक्स है जो आइटम और संपत्तियों को व्यक्त करता है, जबकि Schema.org एक शब्दावली है जो कई आमतौर पर प्रयुक्त प्रकारों और संपत्ति नामों को परिभाषित करती है। Schema.org के शब्द भी JSON-LD या RDFa के साथ व्यक्त किए जा सकते हैं।

क्या माइक्रोडाटा सर्च रैंकिंग में सुधार करता है?

माइक्रोडाटा समर्थित उपभोक्ताओं को योग्य संरचित जानकारी को समझने में मदद करता है, लेकिन इसे जोड़ना रैंकिंग वृद्धि या किसी विशेष खोज सुविधा की गारंटी नहीं देता। दृश्य पृष्ठ, सामग्री की गुणवत्ता, तकनीकी पात्रता, और उपभोक्ता नीतियाँ अभी भी लागू होती हैं।

क्या एक पृष्ठ माइक्रोडाटा और JSON-LD दोनों का उपयोग कर सकता है?

हां, एक पृष्ठ दोनों प्रारूपों को शामिल कर सकता है, लेकिन पुनरावृत संस्थाओं को सहमत होना चाहिए। विरोधाभासी मूल्य, तारीखें, पहचान या कैनोनिकल URLs दोनों वेलिडेटर्स और निष्कर्षण पाइपलाइनों के लिए अस्पष्टता उत्पन्न करते हैं।

क्या एक एक्सट्रैक्टर स्रोत HTML या Rendered DOM पढ़ना चाहिए?

एक्सट्रैक्टर को उस प्रतिनिधित्व को पढ़ना चाहिए जिसमें अधिकारिक मार्कअप हो। माइक्रोडाटा सर्वर-Render किए जाने पर स्रोत HTML तेज होता है; जब JavaScript विशेषताओं को जोड़ता या बदलता है तो एक Rendered DOM आवश्यक होता है।

एक माइक्रोडाटा डेटा सेट को क्या संरक्षित करना चाहिए?

एक उपयोगी डेटा सेट को पृष्ठ URL, कैप्चर विधि, आइटम प्रकार, आइटम पहचानकर्ता जब उपस्थित हो, कच्ची संपत्ति मान, सामान्यीकृत मान, और मान्यता परिणामों को संरक्षित करना चाहिए। प्रचलन बाद में सुधारों और ऑडिटों को संभव बनाता है।

संदर्भ