pandas क्या है? Python में DataFrames, सफाई और विश्लेषण

pandas क्या है?

Scrapeless वेब अनलॉकर सार्वजनिक वेब सामग्री को पुनः प्राप्त करता है जिसे Python एप्लिकेशन निकाल सकते हैं और प्रवाह विश्लेषण के लिए तैयार कर सकते हैं।

pandas एक ओपन-सोर्स Python पुस्तकालय है जो संरचित डेटा को मैनिपुलेट और विश्लेषण करने के लिए है। इसके मुख्य वस्त्र Series हैं, जो एक लेबलयुक्त एक-आयामी संग्रह का प्रतिनिधित्व करती हैं, और DataFrame, जो लेबलयुक्त पंक्तियों और कॉलम के साथ एक तालिका का प्रतिनिधित्व करती है। आप pandas का उपयोग रिकॉर्ड फ़िल्टर करने, मानों को साफ़ करने, डेटासेट्स को जोड़ने, समूहों का सारांश बनाने, और विश्लेषण चरणों के बीच डेटा स्थानांतरित करने के लिए करते हैं।

pandas तब सबसे उपयोगी होता है जब एक तालिका को दोहराने योग्य रूपांतरणों के सेट की आवश्यकता होती है। एक स्प्रेडशीट परिणाम दिखा सकती है, लेकिन एक pandas वर्कफ़्लो रिकॉर्ड करता है कि परिणाम कैसे उत्पन्न हुआ। वेब-डेटा कार्य में, वह वर्कफ़्लो पुनर्प्राप्ति और निष्कर्षण के बाद शुरू होता है: पुस्तकालय स्रोत रिकॉर्ड को एक विश्लेषण तालिका में बदलता है जिसकी प्रकार, कुंजी और गायब मान स्पष्ट अर्थ रखते हैं।

TL;DR

  • pandas लेबलयुक्त तालिका डेटा के साथ काम करता है। Series और DataFrames आपको कॉलम और ROW लेबल द्वारा रूपांतरण व्यक्त करने देते हैं।
  • गायब मानों के लिए एक व्यापार नियम की आवश्यकता होती है। एक अनजान कीमत, एक विफल निष्कर्षण, और एक सच्ची शून्य विभिन्न अवलोकनों का वर्णन करते हैं।
  • जोड़ने की कुंजी एकmerged table का अर्थ निर्धारित करती है। समकक्ष कुंजी पंक्तियों की संख्या बढ़ाती हैं और कुल को विकृत करती हैं।
  • pandas में मेमोरी सीमाएँ हैं। केवल आवश्यक कॉलम पढ़ें, प्रकारों का निरीक्षण करें, और उन्हें लोड करने से पहले बड़े कार्यभार की योजना बनाएं।

Series और DataFrame क्या हैं?

एक Series लेबल के साथ मानों को संग्रहीत करती है, और एक DataFrame कई कॉलम को लेबल वाली तालिका में व्यवस्थित करती है। pandas डेटा मॉडल असमान कॉलम का समर्थन करता है, इसलिए पहचानकर्ता, संख्यात्मक राशियाँ, और पाठ एक ही डेटा सेट में हो सकते हैं।

एक सार्वजनिक उत्पाद अवलोकनों की तालिका की कल्पना करें। प्रत्येक पंक्ति एक संग्रह संदर्भ में एक उत्पाद का प्रतिनिधित्व करती है। कॉलम उत्पाद पहचानकर्ता, प्रदर्शित शीर्षक, मूल्य, मुद्रा, क्षेत्र, और स्रोत URL रखते हैं। एक संख्यात्मक मूल्य कॉलम अंकगणित का समर्थन करता है, जबकि स्रोत URL अवलोकन की ओर वापसी का रास्ता बनाए रखता है।

सूची एक लेबल प्रणाली है, और यह स्वचालित रूप से एक अद्वितीय व्यापार पहचानकर्ता नहीं है। एक डिफ़ॉल्ट पंक्ति सूची बस तालिका के वर्तमान क्रम का वर्णन कर सकती है। यदि उत्पाद कुंजी जोड़ने या डुप्लीकेशन के लिए महत्वपूर्ण है, तो उस कुंजी को स्पष्ट रखें और उसे मान्य करें। पंक्तियों की छंटाई या फ़िल्टरिंग को यह नहीं बदलना चाहिए कि एक रिकॉर्ड किस उत्पाद का संदर्भ लेता है।

pandas कई संचालन को लेबल द्वारा संरेखित करता है। वह व्यवहार सुविधाजनक है जब आप संरेखण का इरादा रखते हैं, लेकिन जब आप केवल स्थिति द्वारा मिलान के लिए मानों की अपेक्षा करते हैं तो यह आपको आश्चर्य में डाल सकता है। स्वतंत्र रूप से तैयार वस्तुओं को संयोजित करने से पहले लेबल और आकृति की जाँच करें।

pandas वेब-डेटा पाइपलाइन में कहाँ फिट होता है

pandas एक वेब-डेटा पाइपलाइन के रूपांतरण और विश्लेषण चरणों में है। एक अधिग्रहण उपकरण सामग्री पुनः प्राप्त करता है, एक निष्कर्षणकर्ता उस सामग्री को रिकॉर्ड में बदलता है, और pandas उन रिकॉर्ड को तुलना, रिपोर्ट, या मॉडल इनपुट के लिए तैयार करता है।

एक सफल नेटवर्क प्रतिक्रिया अभी एक उपयोगी DataFrame नहीं है। प्रतिक्रिया में HTML, एक API लिफाफा, या एक चुनौती पृष्ठ हो सकता है। विश्लेषण तालिका बनाने से पहले इच्छित क्षेत्रों को निकालें और प्रतिक्रिया को मान्य करें। अन्यथा, एक साफ-सुथरी तालिका में त्रुटि संदेश या अधूरी रिकॉर्ड हो सकते हैं।

Scrapeless Web Unlocker सार्वजनिक वेब सामग्री के लिए पुनर्प्राप्ति परत प्रदान कर सकता है, जबकि आपका एप्लिकेशन निष्कर्षण और तालिका स्कीमा का मालिक है। वेब अनलॉकर सामग्री-निष्कर्षण मॉडल उस विभाजन का समर्थन करता है। pandas पर सेवाओं की प्रतिक्रिया की संरचना को स्वचालित रूप से समझता नहीं है या हर पुनः प्राप्त पृष्ठ को अर्थपूर्ण पंक्तियों में परिवर्तित नहीं करता।

पुनः प्राप्त वेब सामग्री के लिए तैयारी के लिए कार्यप्रवाह दिखाता है कि क्यों अधिग्रहण और सफाई अलग निर्णय बने रहना चाहिए। प्रस्तुति के विवरण को हटाने से पहले स्रोत संदर्भ को संरक्षित करें; डाउनस्ट्रीम उपयोगकर्ताओं को यह स्पष्ट करने की आवश्यकता हो सकती है कि कोई मान क्यों बदला।

pandas तालिकाएँ कैसे पढ़ता और लिखता है

pandas सामान्य तालिका प्रारूपों और डेटा स्टोर के लिए इनपुट और आउटपुट उपकरण प्रदान करता है। pandas IO प्रणाली पाठ प्रारूपों, स्प्रेडशीट, स्तंभ प्रारूपों, और डेटाबेस इंटरैक्शन के लिए पाठकों और लेखकों को शामिल करती है, जिनकी निर्भरता प्रारूप के अनुसार भिन्न होती है।

फाइल प्रारूप डेटा गुणवत्ता स्थापित नहीं करता। एक CSV में अग्रणी शून्य के साथ उत्पाद पहचानकर्ता, मिश्रित तिथि प्रारूप, या एक मूल्य कॉलम हो सकता है जिसमें मुद्रा के प्रतीक शामिल हैं। हर क्षेत्र के लिए अनुमान पर निर्भर होने के बजाय इच्छित कॉलम प्रकार और पार्सिंग नियम निर्दिष्ट करें। एक पहचानकर्ता अक्सर पाठ होता है भले ही हर वर्तमान मान संख्यात्मक दिखता हो।

निर्णय लें कि कैसे निर्धारित इनपुट तालिकाबद्ध होता है। कई ऑफ़र के साथ एक अवलोकन एक ऑफ़र तालिका उत्पन्न कर सकता है जो उत्पाद पहचानकर्ता द्वारा लिंक किया गया हो, बजाय इसके कि एक ही सेल में एक असंरचित सूची हो। एक अलग तालिका में दोहराए जाने वाले संस्थाएं रखना कार्डिनलिटी को दृष्टिगत बनाता है और एक स्ट्रिंग के अंदर एक कई-से-एक संबंध को छिपाने से बचता है।

निर्यात करते समय, प्राप्त करने वाले उपकरण पर विचार करें। आवश्यक स्कीमा को संरक्षित करें और चुनें कि DataFrame सूची को कॉलम के रूप में लिखा जाए। एक फ़ाइल जो बिना त्रुटियों के खुलती है, फिर भी पहचान बिंदुओं को खो सकती है या शून्य मानों की व्याख्या को बदल सकती है।

कैसे गायब और असंगत मानों की सफाई करें

गायब डेटा को इस अनुसार संभाला जाना चाहिए कि मूल्य गायब क्यों है और तालिका का उपयोग कैसे किया जाएगा। pandas गायब-मूल्य व्यवहार डेटा प्रकार और इसके प्रतिनिधित्व पर निर्भर करता है, इसलिए गायबता के लिए परीक्षण करना हर कॉलम को सामान्य पाठ के रूप में मानने की तुलना में अधिक सुरक्षित है।

एक उत्पाद अवलोकन के लिए, गायब मूल्य का मतलब हो सकता है कि वस्तु उपलब्ध नहीं है, साइट ने मूल्य प्रकाशित नहीं किया, या निष्कर्षणकर्ता विफल हो गया। उन कारणों में से सभी शून्य नहीं बनना चाहिए। जब भिन्नता एक रिपोर्ट को प्रभावित करती है तो एक अवलोकन-स्थिति क्षेत्र या मान्यता कारण रखें।

पाठ को चयनात्मक रूप से सामान्य करें। चारों ओर कीWhitespace को हटाना कुंजियों में सुधार कर सकता है, लेकिन अक्षर केस बदलना केस-संवेदनशील पहचानों के लिए गलत हो सकता है। मात्रा को उनके स्थान और मुद्रा संदर्भ के साथ पार्स करें। एक दशमलव विभाजक हजारों विभाजक के साथ अदला-बदली नहीं की जा सकती, और उस संदर्भ के बिना प्रदर्शित मूल्य को परिवर्तित करना संभावित लेकिन गलत संख्याएँ उत्पन्न कर सकता है।

जो परिवर्तन निर्णय की आवश्यकता करते हैं, उनके लिए एक मूल-मूल्य स्तंभ रखें। इससे एक पार्सर परिवर्तन को ऑडिट करना या उस मूल्य की जांच करना संभव हो जाता है जिसे सफाई नियम ने अस्वीकार कर दिया। एक पुनरुत्पादक तालिका को स्वीकार किए गए पंक्तियों और फेंके गए पंक्तियों दोनों को स्पष्ट करना चाहिए।

क्यों जोड़ों को कार्डिनैलिटी चेक की आवश्यकता होती है

एक जॉइन डेटा सेटों को कुंजियों के मिलान करके जोड़ता है, और डुप्लिकेट कुंजियाँ परिणामी पंक्ति की गणना को बढ़ा सकती हैं। pandas मर्ज और जॉइन मॉडल कुंजी-आधारित संयोजन और इनपुट के बीच संबंध की जांच के विकल्पों का वर्णन करता है।

मान लीजिए कि उत्पाद तालिका में प्रति उत्पाद एक पंक्ति होनी चाहिए, जबकि अवलोकन तालिका में पुनरावृत्त संग्रह होते हैं। उत्पादों से अवलोकनों को जोड़ना अपेक्षित होता है कि उत्पाद गुणों को बढ़ाए बिना अवलोकनों को गुणा किए बिना। यदि उत्पाद तालिका में गलती से डुप्लिकेट उत्पाद कुंजियाँ हैं, तो एकल अवलोकन कई उत्पाद पंक्तियों से मेल खा सकता है।

उस तरफ अद्वितीयता की जांच करें जिसे अद्वितीय होना चाहिए। असमर्थित कुंजियों का भी निरीक्षण करें: एक बाईं जॉइन अवलोकनों को बनाए रखती है लेकिन उत्पाद गुणों को गायब छोड़ सकती है, जबकि एक आंतरिक जॉइन बिना मेल वाले अवलोकनों को हटा देती है। न तो परिणाम स्वचालित रूप से सही है। विकल्प इस बात पर निर्भर करता है कि क्या असमर्थित अवलोकनों को जांच के लिए दृश्य में रहना चाहिए।

गायब कुंजियों को भी ध्यान देने की आवश्यकता है। pandas एक-दूसरे से अलग तरह से मेल खा सकते हैं। दोहराई गई कुंजियों के बिना एक विश्वसनीय कुंजी के बिना रिकॉर्ड को एक तालिका में विलय करने से पूर्व अलग करें, जो कुल या अलर्ट को संचालित करेगा।

समूहबद्धता और समुच्चय वास्तव में क्या उत्तर देते हैं

समूहबद्धता चयनित श्रेणियों के भीतर रिकॉर्डों का संक्षेपण करती है, इसलिए समूहबद्ध स्तंभ प्रश्न को परिभाषित करते हैं जिसका उत्तर दिया जा रहा है। विभिन्न प्रश्नों का उत्तर देने वाले क्षेत्र द्वारा एक औसत मूल्य एक अलग प्रश्न को उत्तर देता है।

एक मीट्रिक की गणना करने से पहले अवलोकन की इकाई को परिभाषित करें। यदि लोकप्रिय उत्पाद अन्य उत्पादों की तुलना में अधिक अवलोकनों में दिखाई देते हैं, तो कच्चे अवलोकनों पर एक औसत उन उत्पादों को अधिक वजन देता है। आपको प्रत्येक उत्पाद के लिए एक वर्तमान अवलोकन या एक प्रलेखित सैंपलिंग नियम की आवश्यकता हो सकती है।

डिडुप्लीकेशन को समान अनुशासन की आवश्यकता होती है। समान पंक्तियों को हटाना एक व्यवसाय कुंजी के लिए सबसे नए अवलोकन का चयन करने से अलग है। जब कार्य समय के साथ परिवर्तन को मापना हो तो ऐतिहासिक पंक्तियों को बनाए रखें। जब कार्य आज के उपलब्ध अवलोकनों की तुलना करना हो तो वर्तमान दृश्य चुनें। उन उपयोगों को अलग करने के लिए आवश्यक समय और संदर्भ को संग्रहीत करें।

एक छोटे निरीक्षण योग्य उपसेट के साथ मीट्रिक को मान्य करें। योगदान करने वाली पंक्तियों, गायब-मूल्य नीति और समूह आकारों की तुलना करें। एक समुच्चय सही ढंग से निष्पादित हो सकता है जबकि एक ऐसा प्रश्न उत्तर दे सकता है जिसे कोई भी पूछने का इरादा नहीं रखता।

pandas की तुलना स्प्रेडशीट्स और SQL से

pandas, स्प्रेडशीट्स और SQL तालिका संचालन में ओवरलैप करते हैं लेकिन निष्पादन संदर्भ और सहयोग में भिन्न होते हैं। उस पर निर्भर करते हुए चुनें कि डेटा कहाँ रहता है और रूपांतरण कैसे बनाए रखा जाएगा।

विकल्पउपयोगी ताकतजाँचना निर्णय
pandasदोहराए जाने योग्य पायथन रूपांतरण और विश्लेषणस्मृति में फिट, प्रकार नियम और निर्भरता प्रबंधन
स्प्रेडशीटइंटरैक्टिव निरीक्षण और परिचित साझाकरणक्या मैनुअल संपादन और सूत्र दोहराने योग्य रहते हैं
SQLपहले से एक डेटाबेस में संग्रहीत डेटा को क्वेरी करनाक्या फ़िल्टरिंग और समुच्चय को संग्रह के पास चलाया जाना चाहिए

एक संपूर्ण कार्यप्रवाह समझदारी से हो सकता है। प्रासंगिक पंक्तियों के लिए एक डेटाबेस को क्वेरी करें, pandas में एक सीमित परिणाम का विश्लेषण करें, और समीक्षकों के लिए एक प्रस्तुतीकरण तालिका निर्यात करें। जब डेटाबेस पहले इसे कम कर सकता है, तो पूरे डेटा सेट को पायथन में ले जाने से बचें।

जब एक डेटा फ़्रेम बहुत बड़ा हो जाता है

pandas मुख्य रूप से इन-मेमोरी डेटा के साथ काम करता है, और संचालन अतिरिक्त मध्यवर्ती वस्तुएँ बना सकता है। बड़े डेटा सेट के लिए pandas मार्गदर्शन कम डेटा लोड करने, उपयुक्त प्रकारों का चयन करने, और जहां ऑपरेशन इसकी अनुमति देता है, चंक्ड प्रोसेसिंग का उपयोग करने पर जोर देता है।

विश्लेषण के लिए आवश्यक पंक्तियों और स्तंभों को केवल पढ़ें। लोड करते समय प्रतिनिधि डेटा के बाद मेमोरी के उपयोग की जांच करें जो केवल संकुचित फ़ाइल के आकार से अनुमानित किया गया है। दोहराए गए लंबे पाठ मान और अनावश्यक वस्तु कॉलम एक तालिका को मेमोरी में डिस्क पर की तुलना में बहुत बड़ा बना सकते हैं।

चंकिंग सबसे अच्छा काम करता है जब गणना आंशिक परिणामों को सुरक्षित रूप से संयोजित कर सके। श्रेणी के द्वारा रिकॉर्डों की गणना को जमा किया जा सकता है, लेकिन वैश्विक जॉइन या पूरे डेटा सेट में रैंकिंग को अधिक योजनाबद्ध आवश्यकता है। एक चंक लूप अकेले हर ऑपरेशन को आउट-ऑफ-मेमोरी समाधान में नहीं बदलता है।

तुलना करें स्क्रैपलेस पुनर्प्राप्ति मूल्य जब अधिग्रहण कार्यप्रवाह बजट का हिस्सा हो, तो संग्रह और विश्लेषण संसाधनों के लिए अलग से खाता। नेटवर्क लागत को बचाने से उस मेमोरी को हटाया नहीं जाता है जो बनाए रखे गए रिकॉर्ड को संसाधित करने की आवश्यकता होती है।

निष्कर्ष

pandas तालिका विश्लेषण को दोहराने योग्य बनाता है जब डेटा सेट में स्पष्ट प्रकार, कुंजी, और रूपांतरण नियम होते हैं। एक छोटे नमूने के साथ शुरू करें, कच्चे संदर्भ को बनाए रखें, जॉइन्स और गायब मूल्यों की जांच करें, और पुष्टि करें कि प्रत्येक मीट्रिक अवलोकन की इच्छित इकाई से मेल खाती है। एक विश्वसनीय डेटा फ़्रेम उन निर्णयों का परिणाम है।

विश्लेषण के लिए वेब डेटा तैयार करें

अपने पुनर्प्राप्ति परत का मूल्यांकन करें जो विश्लेषण तालिका को बनाने वाले pandas परिवर्तनों से अलग है।

आज साइन अप करें और प्राप्त करें ₹5 का मुफ्त क्रेडिट — कोई क्रेडिट कार्ड आवश्यक नहीं है.

अपने ₹5 क्रेडिट का दावा करें →

अक्सर पूछे जाने वाले प्रश्न

प्रश्न: क्या पांडा एक वेब स्क्रैपर है?

पांडा एक डेटा संचालन और विश्लेषण पुस्तकालय है, न कि एक सामान्य वेब-क्रॉलिंग ढांचा। कुछ पाठक समर्थित तालिका स्रोतों को लोड कर सकते हैं, लेकिन पुनर्प्राप्ति, पृष्ठ इंटरैक्शन, और HTML निष्कर्षण अलग जिम्मेदारियां होती हैं। सफाई और विश्लेषण के लिए पांडा का उपयोग करने से पहले वैध रिकॉर्ड तैयार करें।

प्रश्न: सीरीज और डेटा फ्रेम के बीच क्या अंतर है?

एक सीरीज एक लेबल वाला एक-आयामी संग्रह है, जबकि एक डेटा फ्रेम लेबल वाले कॉलम और पंक्तियों की तालिका है। चयनित डेटा फ्रेम कॉलम को सामान्यतः एक सीरीज के रूप में दर्शाया जाता है। लेबल संरेखण को प्रभावित करते हैं, इसलिए अलग ऑब्जेक्ट से मूल्यों को मिलाते समय उन्हें जाँचें।

प्रश्न: क्या गायब कीमतों को शून्य से बदल दिया जाना चाहिए?

गायब कीमतों को केवल तब शून्य में बदलना चाहिए जब शून्य सही व्यावसायिक अर्थ हो। एक अप्रकाशित राशि या विफल निष्कर्षण आमतौर पर ज्ञात नहीं होता, न ही मुफ्त होता है। एक कारण या अवलोकन स्थिति को संरक्षित करें ताकि सारांश जानबूझकर गायब डेटा को छोड़ या रिपोर्ट कर सकें।

प्रश्न: क्या पांडा मेमोरी से बड़ी डेटा संसाधित कर सकता है?

पांडा स्वचालित रूप से हर ऑपरेशन को मेमोरी से बड़ी डेटा पर काम करने के लिए नहीं बनाता है। कॉलम घटाना, प्रकार चुनना, और उपयुक्त ऑपरेशनों को विभाजित करना मदद कर सकता है। वैश्विक संचालन के लिए डेटाबेस या अन्य निष्पादन दृष्टिकोण की आवश्यकता हो सकती है जो डेटासेट और विश्लेषण के लिए उपयुक्त हो।

प्रश्न: मर्ज क्यों अपेक्षित से अधिक पंक्तियाँ उत्पन्न करता है?

एक मर्ज अतिरिक्त पंक्तियाँ उत्पन्न कर सकता है जब एक कुंजी दोनों इनपुट में कई पंक्तियों से मेल खाती है। जुड़ने से पहले अपेक्षित कुंजी संबंध को मान्य करें और डुप्लिकेट कुंजियों का निरीक्षण करें। पंक्ति-गणना जांचें और अप्रत्याशित-कुंजी जांचें एक सही संचालन को गलत डेटा मॉडल पर लागू करने में मदद करती हैं।

संदर्भ