सॉफ्ट 404 क्या है?
स्क्रेपलेस यूनिवर्सल स्क्रेपिंग एपीआई डेटा वर्कफ्लोज़ के लिए रेंडर्ड सार्वजनिक पृष्ठों को पुनः प्राप्त करता है जिन्हें HTTP स्थिति के साथ दृश्य सामग्री की तुलना करने और सॉफ्ट 404 को पहचानने की आवश्यकता होती है।
TL;DR
- सॉफ्ट 404 का एक सटीक तकनीकी सीमा है। शब्द 'सोफ्ट' का अर्थ है कि एरर सामग्री से अनुमित किया गया है, न कि HTTP प्रतिक्रिया में घोषित किया गया है। कोई 'सोफ्ट 404' प्रोटोकॉल कोड नहीं है। असली मिसिंग पृष्ठ को आमतौर पर 404 नॉट फाउंड लौटाना चाहिए, जबकि जानबूझकर हटाई गई सामग्री बिना प्रतिस्थापन के 410 गोन वापस कर सकती है। एक प्रासंगिक प्रतिस्थापन स्थायी रीडायरेक्ट का उपयोग कर सकता है।
- कस्टम एरर टेम्पलेट 200 लौटाना एक सामान्य कारण है। एप्लिकेशन एक मित्रवत मिसिंग-पृष्ठ घटक रेंडर करता है लेकिन कभी भी HTTP प्रतिक्रिया स्थिति सेट नहीं करता। उपयोगकर्ता एक एरर देखते हैं जबकि क्रॉलर प्रोटोकॉल सफलता देखते हैं।
- क्रॉलर के दृष्टिकोण से सुरक्षित अगले कदम में बदलाव आता है। जब सर्वर वास्तविक 404 स्थिति लौटाता है तो कस्टम 404 पृष्ठ एक सॉफ्ट 404 नहीं होता; ब्रांडेड डिज़ाइन और सहायक नेविगेशन सही HTTP सेमांटिक्स के साथ संगत हैं।
- जब कोई प्रतिस्थापन नहीं होता तब 404 या 410 लौटाएं। कस्टम एरर पृष्ठ को उपयोगी रखें, लेकिन एक ईमानदार स्थिति भेजें।
- डेटा पाइपलाइनों में सॉफ्ट 404 को पहचानने के लिए स्पष्ट वर्गीकरण की आवश्यकता होती है। सर्च इंडेक्स, पुनर्प्राप्ति कॉर्पोरा, और एनालिटिक्स डेटा सेट से सॉफ्ट-एरर पृष्ठों को बाहर रखें। एक साफ पाइपलाइन अनुपस्थिति को स्पष्टता से रिपोर्ट करती है बजाय नेविगेशन क्रोम और 'नॉट फाउंड' संदेश को स्रोत सामग्री के रूप में शामिल करने के।
एक सॉफ्ट 404 सामग्री और स्थिति के बीच असंगति है।
जब एक URL सफलता की तरह प्रतिक्रिया देता है लेकिन इसकी रेंडर्ड सामग्री बताती है कि संसाधन गायब, खाली, या अन्यथा अनुपलब्ध है तो सॉफ्ट 404 होता है। सबसे परिचित मामला एक स्टाइलिश 'नॉट फाउंड' पृष्ठ है जो HTTP 200 OK के साथ लौटाया गया है। सर्वर सफलता का दावा करता है जबकि पृष्ठ विफलता का संचार करता है।
खोज इंजन सामग्री संकेतों का उपयोग इस असंगति का पता लगाने के लिए करते हैं क्योंकि एरर टेम्पलेट को वास्तविक पृष्ठ के रूप में अनुक्रमित करना परिणामों को प्रदूषित करेगा। Google सर्च कंसोल प्रभावित URLs को सॉफ्ट 404 के रूप में रिपोर्ट करता है और सामान्यतः उन्हें सर्च से बाहर करता है। लेबल क्रॉलर की व्याख्या द्वारा उत्पन्न होता है, न कि एक अलग HTTP स्थिति कोड द्वारा।
सॉफ्ट 404 पहचान एसईओ के बाहर भी महत्वपूर्ण है। डेटा पाइपलाइनों में एक नेविगेशन शेल, चुनौती पृष्ठ, खाली क्लाइंट-रेंडर्ड रूट, या खाली खोज परिणाम को मान्य सामग्री के रूप में ग्रहण किया जा सकता है यदि वे केवल 200 के लिए जांच करते हैं। विश्वसनीय पुनर्प्राप्ति स्थिति, अंतिम URL, शीर्षक, शरीर संकेतों, और अपेक्षित पृष्ठ संरचना को एक साथ मान्य करती है।
सॉफ्ट 404 की प्रत्यक्ष परिभाषा
एक सॉफ्ट 404 वह URL है जिसकी प्रतिक्रिया सफलता को इंगित करती है या एक स्पष्ट सफल पृष्ठ की ओर पुनर्निर्देशित करती है जबकि रेंडर्ड सामग्री गायब-संसाधन एरर की तरह बर्ताव करती है। Google सर्च सेंट्रल परंपरागत मामले का वर्णन करता है जो एक पृष्ठ का कहना है कि यह मौजूद नहीं है जबकि 200 लौटाता है।
शब्द 'सोफ्ट' का अर्थ है कि एरर सामग्री से अनुमित किया गया है, न कि HTTP प्रतिक्रिया में घोषित किया गया है। कोई 'सोफ्ट 404' प्रोटोकॉल कोड नहीं है। असली मिसिंग पृष्ठ को आमतौर पर 404 नॉट फाउंड लौटाना चाहिए, जबकि जानबूझकर हटाई गई सामग्री बिना प्रतिस्थापन के 410 गोन वापस कर सकती है। एक प्रासंगिक प्रतिस्थापन स्थायी रीडायरेक्ट का उपयोग कर सकता है।
खोज प्रणाली एरर-जैसे सामग्री को कैसे पहचानती हैं
एक क्रॉलर URL को प्राप्त करता है, रीडायरेक्ट का पालन करता है, अंतिम स्थिति को रिकॉर्ड करता है, महत्वपूर्ण संसाधनों को रेंडर करता है, और दृश्य सामग्री का मूल्यांकन करता है। एक 200 प्रतिक्रिया जिसमें एक प्रमुख मिसिंग-पृष्ठ संदेश है, मुख्य सामग्री नहीं है, या एक टेम्पलेट जो ज्ञात एरर पृष्ठों के समान है, उसे सॉफ्ट 404 के रूप में वर्गीकृत किया जा सकता है।
क्लाइंट-साइड रेंडरिंग प्रक्रिया को कठिन बनाती है। प्रारंभिक HTML एक मान्य एप्लिकेशन शेल हो सकता है, जबकि बाद में JavaScript एक मिसिंग-संसाधन स्थिति को प्रदर्शित करता है। यदि स्क्रिप्ट क्रॉलर के लिए विफल हो जाती हैं, तो रेंडर्ड पृष्ठ भी खाली या लगभग खाली हो सकता है। निदान को इसलिए कच्ची प्रतिक्रिया, रेंडर्ड आउटपुट, और संसाधन-लोडिंग विफलताओं की तुलना करनी चाहिए।
रीडायरेक्ट समान परिणाम पैदा कर सकते हैं। हर अज्ञात URL को होमपेज पर भेजना एक सफल पृष्ठ लौटाता है, लेकिन वह पृष्ठ मूल इरादे को संतुष्ट नहीं करता। खोज प्रणाली गंतव्य को एक एरर-जैसे विकल्प के रूप में मान सकती हैं बजाय एक अर्थपूर्ण प्रतिस्थापन के।
| आयाम | संकेत ए | संकेत बी |
|---|---|---|
| गायब URL | 404 या 410 | 200 के साथ 'नॉट फाउंड' सामग्री |
| प्रासंगिक प्रतिस्थापन | 301 समान सामग्री में | असंबंधित होमपेज पर रीडायरेक्ट |
| मौजूदा पृष्ठ | 200 के साथ संवेदी मुख्य सामग्री | 200 के साथ खाली या टूटे रेंडर |
| कस्टम एरर डिज़ाइन | सहायक पृष्ठ और वास्तविक 404 | सहायक पृष्ठ और झूठी सफलता |
सोफ्ट 404 बनाने वाले पैटर्न
सोफ्ट 404 आमतौर पर CMS डिफॉल्ट, व्यापक रीडायरेक्ट नियम, रेंडरिंग विफलताओं, पतले जनरेटेड रूट्स, या एरर हैंडलिंग से आता है जो केवल बॉडी को बदलता है।
कस्टम एरर टेम्पलेट 200 लौटाता है
एप्लिकेशन एक मित्रवत मिसिंग-पृष्ठ घटक रेंडर करता है लेकिन कभी भी HTTP प्रतिक्रिया स्थिति सेट नहीं करता। उपयोगकर्ता एक एरर देखते हैं जबकि क्रॉलर प्रोटोकॉल सफलता देखते हैं।
अज्ञात यूआरएल को होमपेज पर पुनर्निर्देशित किया जाता है
एक कैच-ऑल नियम हर खोई हुई पथ को एक सफल लक्ष्य पर भेजता है। लक्ष्य अनुरोधित संसाधन के समकक्ष नहीं है, इसलिए पुनर्निर्देशित करना खोई हुई-पृष्ठ स्थिति को हल नहीं करता है।
खाली आंतरिक खोज परिणाम
जनरेट किए गए खोज यूआरएल पूर्ण टेम्पलेट के साथ कोई अर्थपूर्ण परिणाम सामग्री नहीं दे सकते हैं। खाली क्वेरी के बड़े संयोजन कई अनुक्रमित, कम-मूल्य वाले पृष्ठों का निर्माण करते हैं।
क्लाइंट रेंडरिंग विफल हो जाती है
ब्लॉक किए गए स्क्रिप्ट, टूटी बंडल, एपीआई विफलता, या हाइड्रेशन त्रुटियाँ एक खोल या खाली मुख्य क्षेत्र छोड़ देती हैं हालांकि सर्वर ने 200 लौटाया।
डेटाबेस या शामिल विफलता छिपाई जाती है
पृष्ठ हैंडलर एक खोई हुई रिकॉर्ड या टेम्पलेट शामिल त्रुटि को पकड़ता है और सफल प्रतिक्रिया कोड को बदले बिना एक सामान्य शरीर प्रस्तुत करता है।
पतले जनरेट किए गए पृष्ठ अनुपस्थिति के समान होते हैं
फैसिटेड, टैग, प्रोफ़ाइल, या स्थान रूट शायद तकनीकी रूप से मौजूद हो लेकिन इनमें इतनी थोड़ी अनोखी मुख्य सामग्री होती है कि एक क्रॉलर उन्हें त्रुटि-जैसा मानता है।
प्रतिक्रिया और रेंडर्ड पृष्ठ को एक साथ ऑडिट करें
एक सॉफ्ट 404 ऑडिट को उस चीज़ को पुन: उत्पन्न करना चाहिए जो क्रॉलर प्राप्त करता है, केवल वह नहीं जो एक साइन-इन ब्राउज़र कैश किए गए संसाधनों को लोड करने के बाद प्रदर्शित करता है।
- रिपोर्ट किए गए यूआरएल के साथ शुरू करें। अंतिम यूआरएल, स्थिति, स्क्रीनशॉट, और रेंडर्ड HTML पकड़ने के लिए URL निरीक्षण या एक समकक्ष को हासिल करें।
- कच्चे और रेंडर्ड सामग्री की तुलना करें। यह निर्धारित करें कि सर्वर सीधे एक त्रुटि शरीर भेजता है या JavaScript एक सफल खोल को खोई हुई स्थिति में बदलता है।
- महत्वपूर्ण संसाधनों की जांच करें। खोए हुए स्क्रिप्ट, ब्लॉक किए गए एपीआई कॉल, और सर्वर त्रुटियाँ मुख्य सामग्री को मिटा सकती हैं जबकि नेविगेशन अभी भी रेंडर करता है।
- टेम्पलेट समानता की जांच करें। साइट के ज्ञात 404 टेम्पलेट और होमपेज के साथ शीर्षक, शीर्षकों, शरीर वाक्यांशों, और लेआउट की तुलना करें।
- उद्देश्यीय संसाधन स्थिति को वर्गीकृत करें। निर्धारण करें कि सामग्री चली गई है, प्रासंगिक प्रतिस्थापन पर स्थानांतरित हुई है, या अभी भी मौजूद है लेकिन रेंडर होने में विफल हो गई है।
- यूआरएल परिवारों का परीक्षण करें। साझा CMS या रूटिंग नियम खोजने के लिए भाई उत्पाद, खोज, टैग, स्थान, और फैसेटेड रूट का नमूना लें बजाय एक समय में एक यूआरएल ठीक करने के।
- रिलीज के बाद मान्य करें। सजीव स्थिति, रेंडर्ड सामग्री, आंतरिक लिंक, साइटमैप सदस्यता, और खोज कंसोल स्थिति को हिट करने के बाद पुष्टि करें।
सॉफ्ट-एरर परिभाषा में गूगल सर्च सॉफ्ट 404 मार्गदर्शन, 404 सेमांटिक्स में MDN का 404 संदर्भ, और व्यापक स्थिति संदर्भ में HTTP सेमांटिक्स स्थापित करते हैं कि क्यों दोनों प्रोटोकॉल और सामग्री की जांच की आवश्यकता होती है।
संशोधन चुनें जो संसाधन स्थिति से मेल खाता है
संशोधन इस पर निर्भर करता है कि सामग्री चली गई है, स्थानांतरित हुई है, या अभी भी मौजूद होने की उम्मीद है।
- जब कोई प्रतिस्थापन नहीं होता है तो 404 या 410 लौटाएँ। कस्टम त्रुटि पृष्ठ को उपयोगी रखें, लेकिन ईमानदार स्थिति भेजें।
- प्रासंगिक स्थायी प्रतिस्थापन के लिए 301 का उपयोग करें। पुराने यूआरएल को व्यक्तिगत रूप से मानचित्रित करें बजाय सभी खोई हुई पथ को होमपेज पर भेजने के।
- वैध पृष्ठों के लिए महत्वपूर्ण सामग्री को पुनर्स्थापित करें। रुके हुए संसाधनों, डेटा लोडिंग, टेम्पलेट, और सर्वर रेंडरिंग को ठीक करें ताकि मुख्य सामग्री मौजूद हो।
- खाली जनरेट किए गए पृष्ठों को नियंत्रित करें। अनंत खोज और फेसेट संयोजनों को अनुक्रमित, आंतरिक रूप से लिंक किए गए यूआरएल सूची में बदलने से रोकें।
टेम्पलेट में सॉफ्ट-404 रोकथाम का निर्माण करें
सही स्थिति हैंडलिंग साझा रूटिंग और रेंडरिंग घटकों में होना चाहिए ताकि प्रत्येक सामग्री प्रकार लगातार व्यवहार करे।
खोई हुई रिकॉर्ड हैंडलिंग को कस्टम त्रुटि टेम्पलेट को रेंडर करने से पहले स्थिति सेट करने दें। सर्वर-रेंडर्ड अनुप्रयोगों में, यह रूट या ढाँचा प्रतिक्रिया में होना चाहिए। क्लाइंट-रेंडर्ड सिस्टम में, एक सर्वर या किनारे की प्रतिक्रिया प्रदान करें जो अनुपस्थिति को प्रतिनिधित्व कर सके।
प्रतिनिधि खोई हुई यूआरएल के लिए स्वचालित जांच बनाएँ। अंतिम स्थिति, शीर्षक, वैध लक्ष्य, मुख्य सामग्री की उपस्थिति, और अनुक्रमणीय सफलता मेटाडेटा की अनुपस्थिति की पुष्टि करें। स्थानीय, पृष्ठांकन, उत्पाद, प्रोफ़ाइल, और क्वेरी रूट को शामिल करें क्योंकि सॉफ्ट त्रुटियाँ अक्सर द्वितीयक टेम्पलेट में छिपी होती हैं।
साइटमैप और आंतरिक लिंक साफ रखें। हटाए गए URL से भरा एक साइटमैप बार-बार क्रॉल करने के लिए आमंत्रित करता है, जबकि कैच-ऑल रीडायरेक्ट्स के लिए आंतरिक लिंक संकेत करते हैं कि साइट का अपना कैननिकल ग्राफ पुराना है। स्रोत संदर्भों को सुधारें, केवल गंतव्य प्रतिक्रिया नहीं।
सॉफ्ट 404 बनाम असली 404 बनाम रीडायरेक्ट
सही परिणाम इस पर निर्भर करता है कि क्या संसाधन मौजूद है और क्या एक समान प्रतिस्थापन उपलब्ध है।
| केस | अर्थ | सिफारिश की प्रतिक्रिया |
|---|---|---|
| सॉफ्ट 404 | सफलता जैसी स्थिति के साथ त्रुटि जैसी सामग्री | स्थिति, सामग्री या रेंडरिंग सुधारें |
| असली 404 | संसाधन नहीं मिला और प्रतिक्रिया 404 कहती है | यदि कोई प्रतिस्थापन नहीं है तो रखें |
| 410 बिलकुल चला गया | संसाधन जानबूझकर हटा दिया गया था | जब स्थायी हटाने को स्पष्ट किया जाए तब उपयोग करें |
| 301 रीडायरेक्ट | समान सामग्री स्थायी रूप से स्थानांतरित की गई | सौजन्य से प्रासंगिक प्रतिस्थापन पर सीधे पॉइंट करें |
डेटा पाइपलाइनों में सॉफ्ट 404 का पता लगाना
यह स्क्रेपलेस यूनिवर्सल स्क्रैपिंग एपीआई रेंडर्ड सार्वजनिक पृष्ठ की सामग्री लौटा सकता है, जिससे एक संग्रह कार्यप्रवाह यह आकलन कर सके कि उपयोगकर्ता वास्तव में क्या देखते हैं। उस रेंडर्ड दृश्य की स्थिति और अंतिम URL के साथ जांच की जानी चाहिए, सफल लक्ष्य पृष्ठ के प्रमाण के रूप में नहीं माना जाना चाहिए।
एक आवश्यक उत्पाद शीर्षक, लेख की सामग्री, परिणाम गणना या स्थिर स्कीमा फील्ड जैसे होस्ट-विशिष्ट अपेक्षाओं का उपयोग करें। गायब-पृष्ठ वाक्यांशों, खाली मुख्य कंटेनरों, चुनौती इंटरस्टीशियल, लॉगिन डिटॉर्स, और लगभग-नकली त्रुटि टेम्पलेट के लिए सामान्य संकेत जोड़ें। वर्गीकरण साक्ष्य को संग्रहीत करें ताकि झूठे सकारात्मक की समीक्षा की जा सके।
सॉफ्ट-त्रुटि पृष्ठों को खोज अनुक्रमणिका, पुनर्प्राप्ति कॉर्पोरा, और एनालिटिक्स डेटासेट्स से बाहर रखें। एक साफ पाइपलाइन अनुपस्थिति को स्पष्ट रूप से रिपोर्ट करती है न कि नेविगेशन क्रोम और एक “नहीं मिला” संदेश को स्रोत सामग्री के रूप में शामिल करती है।
स्थिति को उस चीज से मेल करें जो पृष्ठ वास्तव में कहता है
एक सॉफ्ट 404 एक विशेष प्रोटोकॉल प्रतिक्रिया नहीं है। यह एक क्रॉलर का निदान है कि सफल ट्रांसपोर्ट मेटाडेटा गायब, खाली, या त्रुटि-जैसी रेंडर की गई सामग्री के साथ संघर्ष करता है।
कंटेंट के लिए 404 या 410 लौटाएं जो प्रतिस्थापन के बिना है, एक समान स्थानांतरण के लिए एक विशेष स्थायी रीडायरेक्ट का उपयोग करें, और जब पृष्ठ मौजूद होना चाहिए तो रेंडरिंग को सुधारें। फिर पूरी प्रभावित URL परिवार में स्थिति और दृश्य मुख्य सामग्री दोनों को सत्यापित करें।
क्या आप एक ऐसा डेटा कार्यप्रवाह बनाने के लिए तैयार हैं जो अधिक अवलोकनीय हो?
आपके डेटासेट में प्रवेश करने से पहले स्थिति, पहचान, रूटिंग और रेंडर की गई सामग्री के लिए स्पष्ट सत्यापन नियमों का उपयोग करें।
आज ही साइन अप करें और पाएं $5 का मुफ्त क्रेडिट — कोई क्रेडिट कार्ड की आवश्यकता नहीं.
आपका $5 क्रेडिट प्राप्त करें →अक्सर पूछे जाने वाले प्रश्न
क्या एक कस्टम 404 पृष्ठ एक सॉफ्ट 404 बनाता है?
जब सर्वर वास्तव में एक 404 स्थिति लौटाता है, तो एक कस्टम 404 पृष्ठ सॉफ्ट 404 नहीं बनाता। समस्या तब होती है जब त्रुटि पृष्ठ 200 लौटाता है या अप्रासंगिक सफल पृष्ठ पर रीडायरेक्ट करता है।
क्या सॉफ्ट 404 अनुक्रमण को प्रभावित करते हैं?
खोज प्रणालियाँ सामान्यत: सॉफ्ट 404 के रूप में वर्गीकृत पृष्ठों को बाहर रखते हैं क्योंकि सामग्री गायब या गैर-कार्यात्मक दिखाई देती है फिर भी सफलता के समान प्रतिक्रिया होती है। बड़े सॉफ्ट-त्रुटि सूची भी क्रॉल का ध्यान बर्बाद कर सकती हैं और वास्तविक साइट दोषों को अस्पष्ट कर सकती हैं।
क्या हर सॉफ्ट 404 को होमपेज पर रीडायरेक्ट करना चाहिए?
सॉफ्ट 404 URL को सभी को होमपेज पर रीडायरेक्ट नहीं करना चाहिए। केवल तब रीडायरेक्ट करें जब कोई निकट, प्रासंगिक प्रतिस्थापन मौजूद हो; अन्यथा उपयोगी कस्टम त्रुटि पृष्ठ के साथ 404 या 410 लौटाएं।
क्या एक मान्य पृष्ठ को सॉफ्ट 404 के रूप में गलत वर्गीकृत किया जा सकता है?
एक मान्य पृष्ठ को सॉफ्ट 404 के रूप में वर्गीकृत किया जा सकता है जब महत्वपूर्ण संसाधन विफल हो जाते हैं, रेंडर की गई मुख्य सामग्री खाली होती है, या पृष्ठ में बहुत कम भिन्न जानकारी होती है। क्रॉलर-रेंडर की गई आउटपुट का निरीक्षण करें और अपेक्षित सामग्री को बहाल करें।
एक स्क्रैपर सॉफ्ट 404 का पता कैसे लगा सकता है?
एक स्क्रैपर स्थिति, अंतिम URL, शीर्षक, मुख्य- सामग्री संरचना, ज्ञात त्रुटि वाक्यांशों और साइट के त्रुटि टेम्पलेट के साथ समानता की तुलना कर सकता है। होस्ट-विशिष्ट सामग्री अपेक्षाएँ एकल वैश्विक शब्द सूची की तुलना में अधिक विश्वसनीय होती हैं।