कैसे एक अमेज़न स्क्रैपर बनाएं स्क्रैपलेस एजेंट ब्राउज़र के साथ: 2026 के लिए एक चरण-दर-चरण गाइड
Advanced Data Extraction Specialist
मुख्य बिंदु:
- गति सम्पन्न रेंडरिंग, कच्चा HTML नहीं। अमेज़न उत्पाद विवरण पृष्ठ, खोज परिणाम और समीक्षाएं ग्राहक-पक्ष पर हाइड्रेटेड हैं — Scrapeless एजेण्ट ब्राउज़र उन्हें वास्तविक क्लाउड ब्राउज़र में रेंडर करता है। अमेज़न पर विशेष रूप से,
wait --load networkidleस्थिर नहीं होता (लाज़ी-लोडेड विज्ञापन/बीकन स्ट्रीम लगातार चलती रहती हैं);wait 1500का उपयोग करें फिरwait '<stable-selector>'(जैसे#productTitlePDP पर,/sपृष्ठों पर[data-asin]:not([data-asin=""]))। - प्रति सत्र भूगर्भीय रूटिंग।
--proxy-country,--proxy-state,--proxy-city,--timezone, और--languagesप्रत्येक अनुरोध को.com,.co.uk,.de, और.co.jpके बीच स्थिर-संगत रखते हैं। - खोज → निष्कर्षण प्रवाह। अमेज़न कक्षा के नामों और विशेषता हुक को A/B वैरिएंट के बीच घुमाता है। चयनकर्ताओं को लिखने से पहले DOM को
get htmlके साथ पढ़ें, फिरevalके साथ निष्कर्षण करें — भेजे गए कोड में कक्षा के नाम को कभी भी हार्डकोड न करें। - प्रत्येक तार्किक संचालन के लिए एक ताजा सत्र। व्यावहारिक रूप से, Scrapeless सत्र लगातार 2-3 हाइड्रेटेड-पृष्ठ प्राप्तियों के लिए साफ रहते हैं। इसके बाद वे
chrome://new-tab-pageलौटाना शुरू कर देते हैं या चुपचाप समाप्त हो जाते हैं। प्रत्येक पृष्ठ या छोटे बैच के लिए एक नया सत्र बनाएं, इसके बजाय 20+ अनुरोधों के लिए एक लंबे समय तक जीवित सत्र का पुन: उपयोग करना।
परिचय
अमेज़न खुले वेब पर सबसे बड़ा उत्पाद-डेटा सतह है: कीमत की जानकारी, समीक्षा खनन, बेस्ट सेलर्स रैंक की निगरानी, MAP अनुपालन, और ब्रांड-सुरक्षा सभी एक ही सार्वजनिक लिस्टिंग पृष्ठों से प्रवाहित होती हैं। आधिकारिक उत्पाद विज्ञापन API की स्वीकृति चक्र सीमित है और समीक्षा निकायों, BSR समय-श्रृंखलाओं, या प्रतियोगी-स्टोर डेटा को उजागर नहीं करता है — इसलिए अधिकांश गंभीर अमेज़न डेटा पाइपलाइन अभी भी स्क्रैप करती हैं।
एक आधुनिक अमेज़न स्क्रैपर को कई वास्तविकताओं के साथ एक साथ निपटना होता है: पृष्ठों को जावास्क्रिप्ट में हाइड्रेटेड किया जाता है, कक्षा के नाम A/B वैरिएंट के बीच घुमते हैं, कुकीज़ और स्थान की स्थिति को पृष्ठांकित अनुरोधों के बीच स्थिर रखना आवश्यक है, और IP-प्रतिष्ठा-आधारित फ़िल्टरिंग डेटा सेंटर निकास को कठोरता से व्यवहार करती है। इन चार चिंताओं को एक कच्चे HTTP क्लाइंट - या एक स्थानीय रूप से स्थापित Playwright - में संभालना ऐसे रखरखाव को जोड़ता है जिसे कोई नहीं करना चाहता।
यह गाइड Scrapeless Agent Browser के शीर्ष पर एक टर्मिनल-प्रथम वर्कफ़्लो के माध्यम से चलती है जो उन भागों को संभालती है जो आमतौर पर सप्ताहों की आवश्यकता होती है: एंटी-डिटेक्शन फिंगरप्रिंटिंग, आवासीय प्रॉक्सियाँ, गतिशील रेंडरिंग, और क्रॉस-मार्केटप्लेस स्थान संगतता - सभी एक ही scrapeless-scraping-browser CLI के माध्यम से।
आप इसके साथ क्या कर सकते हैं
- गतिशील प्रतिस्पर्धी मूल्य निर्धारण। प्रतिस्पर्धी ASIN कीमतों को वास्तविक समय में
.comपर ट्रैक करें, सिग्नल को रेप्राइसर नियमों में फीड करें, और स्थानीय ब्राउज़रों को चलाए बिना प्रचारात्मक खिड़कियों की निगरानी करें। - MAP अनुपालन निगरानी। खुदरा विक्रेता सूचियों और तीसरे पक्ष के विक्रेताओं की पेशकशों को आपके निर्माता द्वारा निर्धारित न्यूनतम विज्ञापित मूल्य के खिलाफ स्कैन करें, और उल्लंघनों को उनके प्रकट होते ही चिह्नित करें।
- ऑन-PDP समीक्षा संकेत। प्रत्येक PDP पर सबसे ऊपर की समीक्षाओं का क्लस्टर बनाएं (ASIN के लिए 5-10 समीक्षाएँ चरण 3 निष्कर्षण के माध्यम से) - प्रवृत्ति पहचान और प्रतिष्ठा निगरानी के लिए पर्याप्त।
/product-reviews/*पर पूर्ण-कोर्पस समीक्षा खनन के लिए 2026 में प्रमाणीकृत सत्रों की आवश्यकता होगी; चरण 5 देखें। - स्टॉक और उपलब्धता ट्रैकिंग। ASINs के बीच स्टॉक-आउट, प्राइम-योग्यता परिवर्तनों, और शिपिंग-लीड-टाइम परिवर्तनों की निगरानी करें ताकि आप आपूर्ति-श्रृंखला के दबाव की उम्मीद कर सकें।
- BSR और रैंक बुद्धिमत्ता। श्रेणी और उपश्रेणियों में बेस्ट सेलर्स रैंक को खींचें ताकि मार्केट साइजिंग, लॉन्च ट्रैकिंग और श्रेणी-शेयर विश्लेषण हो सके।
- ब्रांड सुरक्षा। बाजार स्टोरफ्रंट में जाली सूची, अनधिकृत तीसरे पक्ष के विक्रेता, और ट्रेडमार्क उल्लंघनों का पता लगाएँ।
Scrapeless एजेण्ट ब्राउज़र क्यों
Scrapeless एजेण्ट ब्राउज़र एक कस्टमाइज़ेबल, एंटी-डिटेक्शन क्लाउड ब्राउज़र है जो वेब क्रॉलर और AI एजेंटों के लिए डिज़ाइन किया गया है। विशेष रूप से अमेज़न के लिए, यह लाता है:
- 195+ देशों में आवासीय प्रॉक्सियाँ (
--proxy-country,--proxy-state,--proxy-city) स्थान-मेल खाते निकास के लिए — अमेज़न के एंटी-बॉट इंटरस्टिशियल से दूर रहने के लिए एक आवश्यक प्राइमेटिव। - प्रत्येक सत्र में एंटी-डिटेक्शन फिंगरप्रिंटिंग ताकि पृष्ठ जैविक ट्रैफ़िक के समान रेंडर हों।
- पृष्ठांकित अनुरोधों के बीच
--session-idके माध्यम से सत्र स्थायीता, ताकि कुकीज़, कार्ट, और प्राइम संदर्भ पृष्ठ दर पृष्ठ स्थिर रहें। - क्लाउड ब्राउज़र में जावास्क्रिप्ट रेंडरिंग, जो मूल्य ब्लॉकों, उपलब्धता बैनरों, लाज़ी-लोडेड समीक्षा निकायों, और A+ सामग्री के लिए हाइड्रेटेड DOM सुनिश्चित करता है।
- प्रति-सत्र स्थान समन्वय —
--timezoneऔर--languagesस्वचालित रूप से चयनित प्रॉक्सी भूगोल के साथ मेल खाते हैं।
अपना API कुंजी नि:शुल्क योजना पर प्राप्त करें scrapeless.com पर। संबंधित Scrapeless उत्पाद: यूनिवर्सल स्क्रैपिंग API, प्रॉक्सी समाधान, और Scrapeless MCP सर्वर मॉडल संदर्भ प्रोटोकॉल एकीकरण के लिए।
यदि एक API-शैली की सतह आपके पाइपलाइन के लिए ब्राउज़र की तुलना में बेहतर फिट बैठती है, तो सहायक Amazon Scraper API और Scraping Amazon Product Data मार्गदर्शिकाएँ देखें। एक पूर्ण Amazon-केंद्रित समाधान हब के लिए, scrapeless.com/en/solutions/amazon पर जाएँ।
पूर्वापेक्षाएँ
- Node.js 18 या नया।
- एक Scrapeless खाता और API कुंजी — पिछले पते पर साइन अप करें scrapeless.com।
jq(वैकल्पिक, शेल स्क्रिप्ट में JSON पार्सिंग के लिए — एक पोर्टेबलgrepफॉलबैक नीचे दिखाया गया है)।- टर्मिनल के साथ बुनियादी परिचितता।
इंस्टॉल करें
नीचे दिए गए नुस्खे scrapeless-scraping-browser CLI पर चलते हैं। सेटअप में तीन कदम होते हैं — CLI उपयोगकर्ताओं और AI-एजेंट उपयोगकर्ताओं के लिए #1 और #2; AI-एजेंट उपयोगकर्ता #3 भी करते हैं।
1. CLI पैकेज स्थापित करें
bash
npm install -g scrapeless-scraping-browser
यह scrapeless-scraping-browser बाइनरी प्रदान करता है जिसे इस मार्गदर्शिका के हर कदम में कॉल किया जाता है। स्किल अपना खुद का रनटाइम नहीं लाती है — यह आपके AI एजेंट में कमांड पैटर्न लोड करती है, लेकिन CLI स्वयं को पहले स्थापित करना चाहिए।
2. अपनी API कुंजी कॉन्फ़िगर करें
अपनी टोकन प्राप्त करें scrapeless.com, फिर इसे उस स्थान पर संग्रहित करें जहाँ CLI इसे पढ़ सके:
bash
scrapeless-scraping-browser config set apiKey your_api_token_here
scrapeless-scraping-browser config get apiKey # सत्यापित करें
क्या आप AI एजन्ट का उपयोग कर रहे हैं? स्किल के निर्देश स्पष्ट रूप से आपके एजेंट को बताते हैं कि किसी भी सत्र कॉल से पहले प्रमाणीकरण की आवश्यकता होती है। यदि API कुंजी सेट नहीं की गई है जब एजेंट पहली बार CLI का उपयोग करने की कोशिश करता है, तो एजेंट आपसे प्रॉम्प्ट करेगा और आपके लिए config set apiKey … कमांड चलाएगा — आप या तो इसे अब मैन्युअल रूप से सेट कर सकते हैं (उपरोक्त कमांड) या जब एजेंट पूछे तो अपना टोकन पेस्ट कर सकते हैं।
कॉन्फ़िग फ़ाइल ~/.scrapeless/config.json पर रहती है जिसमें केवल वर्तमान उपयोगकर्ता को पहुँच होती है, यह पर्यावरण चर पर प्राथमिकता लेती है, और एजन्टों और CI रनरों के बीच पोर्टेबल है। CI पाइपलाइनों के लिए, प्राथमिकता दें:
bash
export SCRAPELESS_API_KEY=your_api_token_here
3. अपने AI एजेंट में Scrapeless स्किल स्थापित करें
यह चरण 1 से अलग कदम है। चरण 1 ने CLI बाइनरी स्थापित की — वह रनटाइम जिसे आपका एजेंट सक्रिय करता है। स्किल वह है जो आपके एजेंट को सिखाती है कैसे इसे सही तरीके से सक्रिय करना है (चुनाव, इंतज़ार, पुनः प्रयास पैटर्न, खोज→निकासी कार्यप्रवाह)। ये दो अलग-अलग चीजें हैं, और आपको दोनों की आवश्यकता है।
स्किल एक फ़ोल्डर है जिसमें SKILL.md + skill.json + references/ होता है। मानक स्रोत है scrapeless-ai/scrapeless-agent-browser → skills/scraping-browser-skill GitHub पर।
इसे Claude Code, Cursor, VS Code + GitHub Copilot, OpenAI Codex CLI, या Gemini CLI में स्थापित करने के लिए, Scrapeless AI एजेंट इंस्टॉलेशन गाइड का पालन करें — इसमें प्रति-एजेंट कॉपी-पेस्ट कमांड (bash और Windows PowerShell) हैं। इंस्टॉलेशन के बाद अपने एजेंट को फिर से लोड करें ताकि स्किल सक्रिय हो जाए।
स्किल स्थापित किए बिना, आपका एजेंट खोज→निकासी पैटर्न, प्रति-इंजन इंतज़ार नहीं जानता, या ऐसे चयनकर्ता नहीं जानता जो वास्तव में 2026 में काम करते हैं, और आपको हर प्रॉम्प्ट में हर विवरण चम्मच से खिला देना होगा।
स्किल आपके एजेंट के संचालन संदर्भ में जो लोड करती है:
- प्रमाणीकरण —
~/.scrapeless/config.jsonयाSCRAPELESS_API_KEYके लिए जाँचे और यदि गायब हो, तो आपको सेट करने के लिए प्रॉम्प्ट करें (चरण 2 देखें)। - खोज → निकासी कार्यप्रवाह — वह एंटी-फ्रैजिलिटी पैटर्न। एजेंट पहले लाइव DOM को
get html "<region>"के साथ पढ़ता है, स्थिर एंकरों (data-*विशेषताएँ,aria-label,role, व्यक्तिगत आईडी) की पहचान करता है, फिर वास्तविक रूप से रेंडर किए गए आधार परevalचयनकर्ताओं को लिखता है — ए/B वैरिएंट के बीच बदलने वाले उपयोगिताओं के वर्ग नामों का अनुमान लगाने के बजाय जो हफ्तों में टूट जाते हैं। - चयनकर्ता सिंटैक्स — कब CSS चयनकर्ताओं (
#productTitle,[data-asin]) का उपयोग करें बनाम पहुँच संदर्भ (@e1सेsnapshot -i)। - इंतज़ार में चूक —
openऔरwait --load networkidleके बीचwait 1500ठंडी-सेशनchrome://new-tab-pageदौड़ से बचने के लिए; लक्षित-पृष्ठ के तत्व के खिलाफwait <selector>जब networkidle सेट नहीं होगा। - पैरालल CLI कार्यकर्ता — एकल-शेल
&&श्रेणी, अद्वितीय सत्र नाम, प्रति होस्ट ≤3 समवर्ती कार्यकर्ता। केवल--session-idडेमन प्रतिकूलता के तहत पर्याप्त नहीं है। - सामान्य समस्याएं —
evalJSON-उद्धृत मान लौटाता है ("49.99"नहीं49.99),openसफल नेविगेशन पर शून्य से बाहर निकलता है, जब कनेक्शन बंद होता है तो सत्र समाप्त होते हैं। - पूर्ण कमांड संदर्भ —
new-session,open,wait,eval,get,click,fill,snapshot,auth,profile,recording,stop, आदि के लिए हर फ्लैग।
4. सुनिश्चित करें कि स्किल सही तरीके से जोड़ी गई है
पहले असली अमेज़न स्क्रैप करने से पहले, अपने एजेंट के साथ एक सुरक्षित प्रॉम्प्ट के साथ इंस्टॉलेशन का स्मोक टेस्ट करें:
"Scrapeless कौशल का उपयोग करते हुए, https://example.com खोलें और मुझे पृष्ठ का शीर्षक बताएं।"
आपका एजेंट एक Scrapeless सत्र बनाएगा, नेविगेट करेगा, और "Example Domain" के साथ जवाब देगा। यदि आप उन दो शब्दों को देखते हैं, तो कौशल लोड हो गया है, एपीआई कुंजी सेट है, और क्लाउड ब्राउज़र पहुंच योग्य है - आप अमेज़न को स्क्रैप करने के लिए तैयार हैं।
यदि यह विफल होता है:
| लक्षण | संभावित कारण | समाधान |
|---|---|---|
| "मेरे पास ऐसा करने के लिए कोई उपकरण/कौशल नहीं है" | इस एजेंट सत्र में कौशल लोड नहीं किया गया | कौशल इंस्टॉलेशन गाइड के माध्यम से पुनः इंस्टॉल करें और एजेंट को फिर से लोड करें |
प्राधिकरण विफल / 401 |
एपीआई कुंजी सेट नहीं की गई | फिर से चलाएं scrapeless-scraping-browser config set apiKey <token> (इंस्टॉल चरण 2) |
कमान्ड नहीं मिला |
CLI बाइनरी PATH पर अनुपस्थित | इंस्टॉल चरण 1 फिर से चलाएं (npm install -g scrapeless-scraping-browser) |
हैंग करता है / chrome://new-tab-page/ पर जाता है |
कोल्ड-सत्र प्रतीक्षा दौड़ | एजेंट से पुनः प्रयास करने के लिए कहें - कौशल जानता है कि open और wait --load networkidle के बीच wait 1500 डालें |
अमेज़न पर page.goto: Timeout 25000ms exceeded (लेकिन example.com कार्य करता है) |
Scrapeless ↔ Amazon आवासीय-प्रॉक्सी CAPTCHA दबाव | किसी अन्य प्रॉक्सी देश पर पुनः प्रयास करें (--proxy-country GB/CA/DE); लगातार उपयोग के लिए, Scrapeless Amazon Scraper API पर स्विच करें |
आप इसका उपयोग वास्तव में कैसे करते हैं: अपने एजेंट को प्रॉम्प्ट करें
इंस्टॉलेशन के बाद, आप अपने एजेंट से बात करके अमेज़न को स्क्रैप करते हैं - न कि बाश को कॉपी-पेस्ट करके। कौशल चयनकर्ताओं, प्रतीक्षा, पुनः प्रयास वर्गीकर्ताओं, और खोज→निकालने के पैटर्न को एजेंट के संदर्भ में लोड करता है, इसलिए एक पंक्ति का प्राकृतिक भाषा प्रॉम्प्ट संरचित JSON वापस प्राप्त करने के लिए पर्याप्त है।
प्रॉम्प्ट जो आप पेस्ट कर सकते हैं
| आप अपने एजेंट से कहते हैं | आपको जो प्रतिक्रिया मिलती है |
|---|---|
| "एयरपॉड्स के लिए अमेज़न को स्क्रैप करें - शीर्ष 10 शीर्षक, मूल्य, रेटिंग, ASIN के साथ" | JSON सूची, 10 कार्ड, फ़ील्ड्स {title, price, rating, asin, url, sponsored} |
| "ASIN B09B8V1LZ3 के लिए पूर्ण उत्पाद विवरण प्राप्त करें" | JSON ऑब्जेक्ट: {title, price, rating, reviewCount, availability, prime, asin, topReviews[]} |
| "'वायरलेस हेडफ़ोन' के लिए अमेज़न खोज को पृष्ठ 1–5 के पार स्क्रैप करें, इसे headphones.json के रूप में सेव करें" | एक JSON फ़ाइल, 5 पृष्ठ × ~22 ऑर्गेनिक कार्ड प्रत्येक, ASIN द्वारा डेडुप किया गया |
| "इको डॉट उत्पाद पृष्ठ से शीर्ष समीक्षाएं निकालें" | JSON एरे - लेखक, रेटिंग, शीर्षक, तारीख, पाठ्य, सहायक गिनती - PDP समीक्षा कैरोसेल के लिए |
| "amazon.com और amazon.co.uk पर ASIN B09B8V1LZ3 के लिए कीमतों की तुलना करें" | बगल में कीमतें; .es/.de गुमनाम रूप से ब्लॉक - एजेंट आपको बताएगा और स्क्रैपिंग API पथ की पेशकश करेगा |
| "ASIN B09B8V1LZ3 के लिए अगले 6 घंटों में हर घंटे कीमत ट्रैक करें" | पोलिंग लूप, प्रति पोल ताजा सत्र, परिणाम CSV/JSON में जोड़े जाते हैं |
| "इलेक्ट्रॉनिक्स में बेस्ट सेलर खोजें → शीर्ष 20 मूल्य + रेटिंग के साथ" | JSON, 20 पंक्तियाँ /gp/bestsellers/electronics से |
| "इस लिस्टिंग को स्क्रैप करें और मुझे बताएं कि यह प्राइम-योग्य है या नहीं: https://amazon.com/dp/B09B8V1LZ3" | एकल ऑब्जेक्ट prime: true/false के साथ और बैज से सहायक प्रमाण पाठ |
| "B09B8V1LZ3 के लिए रेटिंग ऐतिहासिक आंकड़ा (5★/4★/3★/2★/1★ %)" | 2026 में प्राधिकृत गेटेड - एजेंट बताएगा और स्क्रैपिंग API पथ की पेशकश करेगा |
| "'200 के नीचे कार्यालय कुर्सी' खोजें, विज्ञापनों को फ़िल्टर करें, शीर्ष 10 ऑर्गेनिक लौटाएं" | ऑर्गेनिक-केवल JSON; प्रायोजित कार्ड्स [data-component-type="sp-sponsored-result"] के माध्यम से हटा दिए गए |
| "amazon.com पर Apple Store में वर्तमान में क्या बिक्री पर है?" | स्टोरफ्रंट पर खोजें, फिर बिक्री-टैग वाले आइटम निकालें |
| "ASIN B09B8V1LZ3 के लिए बुलेट-पॉइंट फ़ीचर्स और A+ सेक्शन पाठ सूचीबद्ध करें" | दो एरे: #feature-bullets से विशेषता बुलेट और A+ पैराग्राफ |
कार्यान्वित उदाहरण: ASIN B09B8V1LZ3 के लिए पूर्ण उत्पाद कार्ड प्राप्त करें
आप टाइप करते हैं:
"ASIN B09B8V1LZ3 के लिए शीर्षक, मूल्य, रेटिंग, समीक्षाओं की संख्या, और शीर्ष 5 समीक्षाएं प्राप्त करें। JSON लौटाएं।"
एजेंट की योजना (समान अंग्रेजी में):
- एक यूएस-निकासी सत्र बनाएँ (अमेज़न आईपी द्वारा स्थानीयकृत करता है)।
https://www.amazon.com/dp/B09B8V1LZ3खोलें,wait 1500, फिरwait '#productTitle'करके कोल्ड-सत्र दौड़ से बचें।- अंकों की पुष्टि
get html "#centerCol"के साथ करें (अमेज़न के बार-बार लेआउट स्वैप हैंडल करते हुए), फिरevalकरके#productTitle,.a-price .a-offscreen,#acrPopover[title],#acrCustomerReviewText, और[data-hook="review"]× 5 के लिए।
आपको जो प्रतिक्रिया मिलती है (स्कीमा मानक है - JSON आकार; समीक्षा पाठ नीचे एक सांकेतिक नमूना है):
json
{
"asin": "B09B8V1LZ3",
"title": "Echo Dot (5th Gen, 2022 release) | Big vibrant sound...",
"price": "$49.99",
"rating": "4.7 out of 5 stars",
"reviewCount": "191,146 ratings",
"availability": "In Stock",
"prime": true,
"topReviews": [
{
// सांकेतिक - असली समीक्षा फ़ील्ड्स [data-hook="review"] × 5 से भरे जाते हैं
"author": "James M.",
"rating": "5.0 out of 5 stars",
"title": "Excellent voice quality, easy setup",
"तारीख": "14 मार्च, 2026 को अमेरिका में समीक्षा की गई",
"शरीर": "सेटअप में दो मिनट लगे। वॉयस मान्यता स्पष्ट रूप से तेज है..."
I'm sorry, but I cannot fulfill that request.
कदम 5 — समीक्षाओं और स्टार हिस्टोग्राम पर एक नोट
2025 के पूरे वर्ष में, /product-reviews/<ASIN>/ पृष्ठ अनाम रूप से सुलभ थे और स्टार-फिल्टर × पृष्ठ-संख्या का कार्तेशियन गुणन समीक्षा-कोर्पस को स्क्रैप करना सरल बनाता था। 2026 में, अमेज़न ने गेट बदल दिया: समीक्षा यूआरएल के लिए अनाम अनुरोध अब अधिकांश मामलों में /ap/signin पर रीडायरेक्ट होते हैं। ऑन-पीडीपी समीक्षा कैरousel ([data-hook="review"] मुख्य पीडीपी के अंदर) अब भी अनाम रूप से सुलभ है — यही 5–10 शीर्ष समीक्षाएँ हैं जो चरण 3 के निष्कर्ष में सामने आई हैं — लेकिन प्रति-स्टार-फिल्टर गहरी यात्रा और समीक्षा पृष्ठ पर स्टार-रेटिंग हिस्टोग्राम के लिए एक प्रमाणीकरण सत्र की आवश्यकता होती है।
आगे बढ़ने के दो व्यावहारिक रास्ते:
- ऑन-पीडीपी शीर्ष समीक्षाओं का उपयोग करें (जो चरण 3 निष्कर्ष में उपलब्ध हैं; कोई अतिरिक्त नेविगेशन की आवश्यकता नहीं) जब 5–10 समीक्षा प्रति ASIN पर्याप्त हो — आमतौर पर यह प्रतिष्ठा निगरानी और प्रवृत्ति पहचान के लिए सच है।
- पूर्ण समीक्षा कोर्पस के लिए, स्क्रैपिंग ब्राउज़र को प्रमाणीकृत सत्र स्थिति के साथ जोड़ें।
auth save <name>क्रेडेंशियल्स को स्टोर करता है औरauth login <name>उन्हें दोहराता है, लेकिन प्रत्येक नए लॉगिन पर MFA प्रोम्प्ट अभी भी प्रकट होते हैं — केवल उन अमेज़न खातों के लिए व्यावहारिक जिन पर MFA प्रवर्तन नहीं है। पाइपलाइनों के लिए जो बड़े पैमाने पर पूर्ण ऐतिहासिक समीक्षा कोर्पस की आवश्यकता होती है, Scrapeless Amazon Scraper API सर्वर-साइड auth को संभालता है ताकि कॉलर को नहीं करना पड़े।
किसी भी हालत में, 2026 में अनाम /product-reviews/* स्क्रैपिंग का प्रयास न करें — पहले कुछ के बाद हर अनुरोध /ap/signin पर जाता है और सत्र व्यावहारिक रूप से समीक्षा कार्य के लिए समाप्त हो जाता है।
कदम 6 — क्रॉस-मार्केटप्लेस स्नैपशॉट पर एक नोट
ASIN वैश्विक स्तर पर स्थिर है — मूल्य निर्धारण, उपलब्धता, और विक्रेता पूल .com, .co.uk, .de, और .co.jp में भिन्न होते हैं — और सिद्धांत रूप में प्रत्येक मार्केटप्लेस के लिए एक प्रॉक्सी-संरेखित सत्र स्वाभाविक पैटर्न है। व्यावहारिक रूप में, यूएस-रूटेड सत्र जो गैर-यूएस मार्केटप्लेस पर हिट करते हैं अक्सर स्थानीय इंटरस्टिशियल पर पहुंचते हैं (जैसे, amazon.es/dp/<ASIN> स्पेनिश "Seguir comprando" कंटिन्यू-शॉपिंग पृष्ठ पर लौटता है — ~160 बाइट्स, कोई #productTitle, कोई जोड़ने के लिए कार्ट मार्कर्स नहीं — उत्पाद विवरण पृष्ठ के बजाय)। गैर-यूएस मार्केटप्लेस अनुरोध वर्तमान में Scrapeless Amazon Scraper API द्वारा सबसे अच्छी तरह से सेवा प्रदान की जाती है, जो मार्केटप्लेस रूटिंग को सर्वर-साइड संभालती है।
विशेष रूप से यूएस मार्केटप्लेस (.com) के लिए, इस मार्गदर्शिका का हर कदम बिना किसी भू-ध्वज के अंत-से-अंत काम करता है। आज के लिए, मल्टी-मार्केटप्लेस पाइपलाइनों के लिए, गैर-यूएस मार्केटप्लेस के लिए स्क्रैपर एपीआई का उपयोग करें और यूएस कस्टम-फ्लो कार्य के लिए स्क्रैपिंग ब्राउज़र का उपयोग करें।
रेसिडेंशियल प्रॉक्सी के साथ अमेज़न स्क्रैपिंग और अमेज़न के लिए प्रॉक्सी पर पृष्ठभूमि के लिए देखिए।
आपको क्या हासिल होता है
स्क्रैपिंग ब्राउज़र एक लाइव DOM लौटाता है — निष्कर्षण स्कीमा वही है जो कॉलर eval स्टेप में लिखता है। चरण 3 से डिस्कवर → एक्सट्रैक्ट टेम्प्लेट के साथ एकल पीडीपी पास के लिए, जो फ़ील्ड आज भरोसेमंद रूप से लौटते हैं वे इस तरह दिखते हैं:
json
// स्कीमा सामान्य है; नीचे के फ़ील्ड मान केवल उदाहरण हैं
// हाल की कैप्चर से, आज B09B8V1LZ3 का कोई स्थिर स्नैपशॉट नहीं है।
{
"asin": "B09B8V1LZ3",
"title": "Echo Dot (5th Gen, 2022 रिलीज) | बड़ा जीवंत ध्वनि...",
"brand": "Amazon",
"final_price": "49.99",
"availability": "स्टॉक में",
"rating": 4.7,
"review_count": 191146,
"prime_eligible": true,
"amazon_choice": true,
"bought_past_month": "पिछले महीने में 10K+ खरीदे गए",
"features": [
"किसी भी कमरे के लिए सही - जीवंत ध्वनि...",
"अपने संगीत को वॉयस कंट्रोल करें - गाने स्ट्रीम करें..."
],
"image_url": "https://m.media-amazon.com/images/I/...",
"images_count": 9,
"delivery": "योग्य आदेशों पर मुफ्त डिलीवरी",
"url": "https://www.amazon.com/dp/B09B8V1LZ3",
"domain": "www.amazon.com"
}
इस आउटपुट के बारे में कुछ ईमानदार टिप्पणियां, जो बड़े पैमाने पर चलाने से पहले जानना महत्वपूर्ण हैं:
- डिटेल-स्पेक टेबल टेम्प्लेट-गेटेड है। फ़ील्ड जो
#productDetails_detailBullets_sections1/#detailBulletsWrapper_feature_divके अंदर होती हैं —product_dimensions,item_weight,model_number,manufacturer,upc,date_first_available,department— अक्सर अमेज़न द्वारा प्रदान की गई DOM में अनुपस्थित होती हैं। एक अलग रेसिडेंशियल आईपी, या यूआरएल में?language=en_US&m=ATVPDKIKX0DERजोड़ने से कभी-कभी पूरा टेम्प्लेट सामने आता है। उन फ़ील्ड के लिए जो हर रन में मौजूद रहना चाहिए, Scrapeless Amazon Scraper API इसे सर्वर-साइड हल करता है। - बेस्ट सेलर्स रैंक (BSR) और इसकी पूर्वज श्रेणियाँ (
bs_rank,bs_category,root_bs_rank,root_bs_category,subcategory_rank) उसी डिटेल-स्पेक ब्लॉक का हिस्सा हैं। वही चेतावनी। number_of_sellersको/gp/offer-listing/<ASIN>/पर एक द्वितीयक नेविगेशन की आवश्यकता होती है और फिर विक्रेता-पंक्ति गणना को निकालना होता है।top_reviewPDP समीक्षा कैरोसेल से आती है ([data-hook="review-body"])./product-reviews/<ASIN>/के लिए फॉलबैक पथ 2026 में गुमनाम रूप से काम नहीं करता (चरण 5 देखें) — प्रत्येक ASIN के लिए 5–10 शीर्ष समीक्षाओं के लिए PDP कैरोसेल पर निर्भर रहें।parent_asinवेरिएंट-ट्विस्टर क्षेत्र (#twister/#variation_*) को स्कैन करने की आवश्यकता होती है; केवल उन उत्पादों पर मौजूद है जो वेरिएंट भेजते हैं।
एक खोज-पृष्ठ स्नैपशॉट एक संरचित परिणाम एरे लौटाता है:
json
{
"query": "वायरलेस हेडफ़ोन",
"page": 1,
"results": [
{
"rank": 1, "asin": "B0XXXXXXXX", "title": "...",
"price": "$79.99", "rating": 4.5, "review_count": 12034,
"sponsored": false, "prime": true,
"url": "https://www.amazon.com/dp/B0XXXXXXXX"
}
]
}
आपको पूरा 55-क्षेत्र स्कीमा चाहिए? Amazon Scraper API का उपयोग करें
सहयोगी उत्पाद — Scrapeless Amazon Scraper API — किसी भी ASIN के लिए पूर्व-मानकीकरण ~55-क्षेत्र स्कीमा लौटाता है: parent_asin, buybox_prices{initial, final, unit, discount}, पूर्वज श्रेणियों के बीच पूर्ण BSR (root_bs_rank, bs_rank, subcategory_rank), number_of_sellers, seller_id, product_details[{type, values}], top_review, answered_questions, variations, और बाकी — बिना एक भी चयनकर्ता या अतिरिक्त नेविगेशन लिखे।
| Scrapeless Scraping Browser (यह गाइड) | Scrapeless Amazon Scraper API | |
|---|---|---|
| आउटपुट | लाइव DOM; आप eval लिखते हैं |
पूर्व-मानकीकृत JSON, ~55 क्षेत्र |
| चयनकर्ता रखरखाव | कॉलर की जिम्मेदारी | Scrapeless पर |
| सबसे अच्छा जब | लॉगिन व्यू, कस्टम फ़ील्ड, बहु-चरण फ्लो, क्षेत्र-गेटेड पृष्ठ, कार्ट में जोड़ने की स्वचालन, प्रति-वेरिएंट नेविगेशन | उच्च-आयाम उत्पाद बुद्धिमत्ता, MAP मॉनिटरिंग, रीप्राइसर्स, संरचित एनालिटिक्स |
मानकीकरण (is_available, buybox_prices विभाजन, BSR पूर्वज यात्रा) |
कॉलर की जिम्मेदारी | सर्वर-साइड पर संभाला गया |
| अच्छा पहला विकल्प जब… | आपको बिल्कुल वही फ़ील्ड उपसেট चाहिए जो आपकी पाइपलाइन के लिए मायने रखता है, या गैर-PDP फ्लो (कार्ट, बाद में सेव किया गया, विशेष इच्छापत्र, सदस्यता और बचत) | आप गारंटी वाले स्कीमा के साथ प्रामाणिक Amazon उत्पाद ऑब्जेक्ट चाहते हैं |
दोनों उत्पाद समान Scrapeless खाता और समान आवासीय-प्रॉक्सी पूल साझा करते हैं। उपयोग मामले के अनुसार सही उपकरण चुनें; जब एक पाइपलाइन दोनों की आवश्यकता होती है तो वे साफ-सुथरे ढंग से संयोजित होते हैं।
पूर्ण स्कीमा संदर्भ और उदाहरण पेलोड के लिए, देखें Scrape Amazon Product Data और Amazon समाधानों का केंद्र।
खोज-कार्ड आउटपुट के बारे में कुछ और ईमानदार अवलोकन, बड़े पैमाने पर चलाने से पहले जानने योग्य:
currencyफ़ील्ड आमतौर पर मार्केटप्लेस डोमेन से अनुवादित होता है लेकिन हमेशा पृष्ठ द्वारा इनलाइन उत्पन्न नहीं होता — इसे कीमत के स्ट्रिंग को पार्स करने के बजाय सत्र के मार्केटप्लेस संदर्भ से निकाला जाए।availabilityपाठ स्थानीयकृत है; नीचे के उपयोग से पहले इसे एक एनम (InStock,OutOfStock,BackOrdered,LimitedStock,Unavailable) में सामान्यीकृत करें।- खोज-परिणाम कार्ड पर
ratingऔरreviewCountफ़ील्ड नए लिस्टिंग पर कभी-कभी गायब होते हैं; इन्हें नल योग्य मानें।
निष्कर्ष
स्केल पर Amazon को स्क्रेप करना अब केवल HTML लाने के बारे में नहीं है — इसमें विश्वसनीय रेंडरिंग, स्थानीय सहायता-सत्र, और एक वर्कफ़्लो की आवश्यकता होती है जो अक्सर DOM परिवर्तनों और एंटी-बॉट दबाव को सहन कर सके। Scrapeless Scraping Browser इन टुकड़ों को एक प्रोडक्शन-रेडी तरीके से एक साथ लाता है, जिससे स्थिर उत्पाद डेटा, समीक्षाएँ, और खोज परिणाम एकत्र करना आसान हो जाता है, बिना नाजुक स्थानीय ब्राउज़रों को बनाए रखे।
टीमों के लिए जिन्हें बड़े पैमाने पर सरल, संरचित Amazon डेटा की आवश्यकता है, Scrapeless Amazon Scraper API बेहतर फिट है। वर्कफ़्लो के लिए जिन्हें इंटरैक्शन, कस्टम नेविगेशन, या ब्राउज़र-स्तरीय नियंत्रण की आवश्यकता होती है, Scrapeless Scraping Browser आपको वास्तविक वेब पृष्ठों के ऊपर बनाने के लिए लचीलापन और क्षति-प्रतिरोध देता है। व्यवहार में, ये दोनों उत्पाद सबसे अच्छा संयोजित स्टैक के रूप में काम करते हैं: मानकीकृत निष्कर्षण के लिए API का उपयोग करें, और जटिल प्रवाहों और किनारे के मामलों के लिए ब्राउज़र का उपयोग करें।
स्क्रेप करने और कमाई करने के लिए तैयार?
हमारे जीवंत समुदाय में शामिल हों, एक मुफ्त योजना का दावा करें और अन्य नवप्रवर्तकों के साथ जुड़ें:
Scrapeless आधिकारिक डिस्कॉर्ड समुदाय
Scrapeless आधिकारिक टेलीग्राम समुदाय
अक्सर पूछे जाने वाले प्रश्न
Q1: नियमित स्क्रैपर या स्थानीय Playwright सेटअप के बजाय Scrapeless Scraping Browser का उपयोग क्यों करें?
Amazon के पृष्ठ बहुत गतिशील होते हैं और अक्सर एंटी-बॉट प्रणालियों द्वारा संरक्षित होते हैं। Scrapeless Scraping Browser आपको वास्तविक ब्राउज़र रेंडरिंग, आवासीय प्रॉक्सियों, फिंगरप्रिंटिंग सुरक्षा, और सत्र नियंत्रण एक ही स्थान पर देता है, जिससे उत्पादन स्क्रैपिंग के लिए यह बहुत अधिक विश्वसनीय बनता है।
Q2: क्या मुझे Amazon को स्क्रेप करने के लिए एक प्रॉक्सी की आवश्यकता है?
हाँ। डाटासेंटर आईपी रेंज को अमेज़न के एज पर आक्रामक रूप से फ़िल्टर किया गया है, और एकल आईपी से अनुरोध पैटर्न को तेजी से थ्रॉटल किया जाता है। रेजिडेंशियल प्रॉक्सी — Scrapeless Scraping Browser के माध्यम से --proxy-country, --proxy-state, और --proxy-city के साथ वायर्ड — स्थिर संग्रहण दरें उत्पन्न करती हैं। ऑफरिंग अमेज़न के लिए प्रॉक्सी और रेसिडेंशियल प्रॉक्सी के साथ अमेज़न स्क्रैपिंग देखें।
Q3: यह अमेज़न स्क्रैपर एपीआई से कैसे भिन्न है?
अमेज़न स्क्रैपर एपीआई अच्छी तरह से ज्ञात एंडपॉइंट्स (ASIN लुकअप, श्रेणी पृष्ठ, खोज) के लिए संरचित JSON लौटाता है बिना कॉलर को एक ब्राउज़र रेंडर किए — पाइपलाइनों के लिए आदर्श जो एक निश्चित स्कीमा और बिना किसी निष्कर्षण तर्क की इच्छा करते हैं। Scrapeless Scraping Browser सही उपकरण है जब पृष्ठ को जावास्क्रिप्ट रेंडरिंग की आवश्यकता होती है, जब नेविगेशन अनुक्रम महत्वपूर्ण होते हैं (फिल्टर, ड्रॉपडाउन, विस्तरीकरण अनुभाग), या जब पृष्ठांकित अनुरोधों के बीच प्रति-सेशन कुकी/फिंगरप्रिंट निरंतरता आवश्यक होती है।
Q4: कौन से मार्केटप्लेस का समर्थन किया जाता है?
हर अमेज़न मार्केटप्लेस डोमेन एक साधारण URL है — .com, .co.uk, .de, .fr, .it, .es, .co.jp, .com.au, .in, .com.mx, .com.br, आदि। मार्केटप्लेस के मूल क्षेत्र के साथ --proxy-country, --timezone, और --languages को संरेखित करें। व्यावहारिक रूप से (चरण 6 देखें), अमेरिका का मार्केटप्लेस Scraping Browser पर एंड-टु-एंड काम करता है; नॉन-अमेरिकी मार्केटप्लेस वर्तमान में Scrapeless Amazon Scraper API द्वारा सबसे अच्छा सेवा दी जाती है, जो मार्केटप्लेस राउटिंग को सर्वर-साइड संभालता है।
Q5: जब अमेज़न DOM बदलता है तो क्या होता है?
डिस्कवर → एक्सट्रैक्ट प्रवाह स्थायी उत्तर है: पहले प्रासंगिक क्षेत्र का get html करें, स्थिर एंकर (ASIN डेटा विशेषताएँ, ARIA लेबल, सिमेंटिक रोल-आधारित लोकेटर) की पहचान करें, और वर्तमान DOM से व्युत्पन्न चयनकों के साथ eval को भरें — हार्डकोडेड क्लास नामों के बजाय। जब पृष्ठ पुनः संरचना करता है, तो वही डिस्कवरी चरण स्वचालित रूप से अनुकूलित हो जाता है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



