वापस ब्लॉग पर

गूगल एआई ओवरव्यू को स्क्रैप करने का तरीका: एसईओ और ब्रांड एआई दृश्यता निगरानी के लिए एक संपूर्ण गाइड

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

18-May-2026

मुख्य बातें:

  • एक अभिनेता, पूरी AI ओवरव्यू सतह। scraper.overview AI ओवरव्यू बॉडी (मार्कडाउन + प्लेन टेक्स्ट), सिटी स्रोत पैनल, संबंधित खोज वेब स्रोत, प्रायोजित प्लेसमेंट, और खरीद-झंडा सेट को - सभी को एकल HTTP POST से संरचित JSON के रूप में वापस करता है।
  • देश-पिन वाले आवासीय निकास। input.country फ़ील्ड अनुरोध को एक भू-मैच आवासीय प्रॉक्सी के माध्यम से मार्गदर्शित करता है ताकि AI ओवरव्यू गूगल जो उत्पन्न करता है वह उस देश में एक वास्तविक उपयोगकर्ता जो देखेगा सही हो। इसे US और GB के खिलाफ सत्यापित किया गया है।
  • एक मानक लिफाफा। हर सफल प्रतिक्रिया { status, task_id, task_result } है। task_result.content मार्कडाउन है जिसमें [N] उद्धरण संदर्भ हैं; task_result.rawtext वही बॉडी है बिना उद्धरण के; task_result.source और task_result.web_source दो क्रमबद्ध लिंक पैनल हैं।
  • scraper.google.search और scraper.aimode के साथ पेयर करें। AI ओवरव्यू एक गूगल AI सतह है - AI मोड टैब और क्लासिक ऑर्गेनिक SERP भाई-बहन हैं। वही Scrapeless खाता, वही ऑथ हेडर।
  • शुरू करने के लिए स्वतंत्र। नए Scrapeless खातों में मुफ्त Scraper API क्रेडिट शामिल हैं - Scrapeless वेबसाइट पर साइन अप करें।

परिचय: गूगल के AI ओवरव्यू तक संरचित पहुंच

गूगल का AI ओवरव्यू (AIO) SERP के शीर्ष पर सू informasi, तुलना, और खरीदारी संबंधी प्रश्नों के बढ़ते हिस्से के लिए बैठता है। SEO टीमों के लिए, इसने फीचर्ड स्निपेट को लोड-बेयरिंग उत्तर सतह के रूप में हटा दिया है; ब्रांड मॉनिटरिंग के लिए यह अब उत्पाद के बारे में एक संभावित ग्राहक द्वारा पढ़ी जाने वाली पहली चीज है; AI-ग्राउंडिंग पाइपलाइनों के लिए यह उद्धरणों का एक क्यूरेटेड सेट है जिसे गूगल पहले ही प्रासंगिकता के लिए सत्यापित कर चुका है।

SERP से सीधे AIO को स्क्रैप करना एक चल लक्ष्य है। ब्लॉक "जनरेटिंग" प्लेसहोल्डर के पीछे लेज़ी-लोड करता है, मार्कअप A/B वेरिएंट में घूमता है, और उद्धरण पैनल बॉडी से स्वतंत्र रूप से हाइड्रेट किया जाता है। एक DOM-स्क्रैपिंग पाइपलाइन काम करने के लिए बनाई जा सकती है लेकिन इसमें किसी भी फ्रंट-एंड लक्ष्य का चयनकर्ता-रखरखाव कर का कर होता है - और इसे आवासीय निकास, जावास्क्रिप्ट रेंडरिंग, और CAPTCHA हैंडलिंग की आवश्यकता होती है।

Scrapeless Scraper AI ओवरव्यू API (actor: "scraper.overview") इसे एक HTTP POST में घटित करता है। कॉल करने वाला एक प्रॉम्प्ट और एक देश भेजता है; API AIO बॉडी के साथ संरचित JSON लिफाफा वापस करता है दो प्रारूपों में (उद्धरणों के साथ मार्कडाउन, बिना प्लेन टेक्स्ट), उद्धृत स्रोत, संबंधित-खोज वेब स्रोत, AIO के ऊपर प्रायोजित प्लेसमेंट, और खरीद/लिंक झंडे। प्रमाणीकरण, प्रॉक्सी रूटिंग, जावास्क्रिप्ट रेंडरिंग, लेज़ी-लोड पोलिंग, और चयनकर्ता रखरखाव सभी सर्वर-साइड चिंताएँ हैं।

यह गाइड पूर्ण एकीकरण के माध्यम से चलता है: टीमें API का उपयोग क्यों करती हैं, अनुरोध और प्रतिक्रिया का स्वरूप, पैरामीटर और फ़ील्ड संदर्भ, चलने योग्य पायथन और नोड.जेएस क्लाइंट, सत्यापन में देखी गई त्रुटि मैट्रिक्स, और साथ-साथ के अभिनेताओं (scraper.google.search, scraper.aimode) का एक संक्षिप्त दौरा पूरा करते हैं जो उत्पादन गूगल-AI पाइपलाइन को पूरा करते हैं।


इसके साथ आप क्या कर सकते हैं

  • AI ओवरव्यू रैंक और उपस्थिति मॉनिटरिंग। ट्रैक करें कि आपके लक्षित कीवर्ड में से कौन सा वास्तव में AIO उत्पन्न करता है, और कितनी बार - AIO ट्रिगर दर स्वयं 2026 में एक उच्च-सिग्नल SEO KPI है।
  • GEO उद्धरण ट्रैकिंग। प्रत्येक AIO के लिए उद्धृत डोमेन की सूची निकालें और प्रत्येक ब्रांड, प्रत्येक विषय क्लस्टर, प्रत्येक भूगोल के लिए उद्धरण का हिस्सा मिलाएं। यह ऑर्गेनिक वॉयस का GEO समकक्ष है।
  • AI उत्तरों पर ब्रांड मॉनिटरिंग। देखें कि तीसरे पक्ष की समीक्षाएँ, तुलना, और संपादकीय सामग्री गूगल का AIO तब सामने लाता है जब संभावनाएँ आपके ब्रांड या आपके प्रतिस्पर्धियों के लिए खोजती हैं।
  • प्रतिस्पर्धी दृश्यता ऑडिट। एक प्रतिस्पर्धी के ब्रांडेड प्रश्नों के लिए उद्धृत-स्रोत सूचियों की तुलना अपने खुद के साथ करें — अंतर आपके GEO सामग्री रोडमैप है।
  • LLM मूल्यांकन और RAG के लिए प्रशिक्षण डेटा। प्रत्येक AIO एक क्यूरेटेड प्रश्न → ग्राउंडेड-उत्तर → उद्धरण-सेट त्रैतीयक है। एक निश्चित समय-चिह्न और प्रॉक्सी भूगोल पर कैप्चर की गई, यह RAG मूल्यांकनों और उत्तर-गुणवत्ता बेंचमार्क के लिए एक पुनरुत्पादित ग्राउंड ट्रुथ है।
  • प्रायोजित-प्लेसमेंट इंटेलिजेंस। समान प्रतिक्रिया में उसी प्रश्न के लिए AIO के ऊपर चलने वाले विज्ञापन होते हैं (विज्ञापनकर्ता, शीर्षक, प्रदर्शन URL, ट्रैकिंग टोकन)। इसे AIO बॉडी के साथ जोड़ें ताकि AI-संवर्धित SERPs पर विज्ञापनदाता का व्यवहार अध्ययन किया जा सके।
  • खरीदारी के इरादे का सामने आना। task_result.is_overview_shopping, is_shopping, और purchase_link AIO-स्तरीय झंडे हैं जो परिवर्तनों को चिह्नित करते हैं जिन्हें गूगल ने वाणिज्यिक के रूप में वर्गीकृत किया है। खरीद के इरादे की शर्तों के लिए फ़िल्टर करने वाले खुदरा-इंटेल पाइपलाइनों के लिए उपयोगी।
  • बहु-स्थानीय कैप्चर। प्रत्येक अनुरोध के लिए input.country सेट करें ताकि आप US, GB, DE, FR, JP, और समर्थन करने वाले अन्य आवासीय-प्रॉक्सी फ़ुट प्रिंट में वास्तविक उपयोगकर्ताओं द्वारा देखे जाने वाले AIO को पढ़ सकें।

Scrapeless पर, हम केवल सार्वजनिक रूप से उपलब्ध डेटा तक पहुँचते हैं जबकि लागू कानूनों, विनियमों, और वेबसाइट की गोपनीयता नीतियों का कड़ाई से पालन करते हैं। इस पोस्ट में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है।


क्यों स्क्रेपलेस स्क्रैपर एआई ओवरव्यू एपीआई

एपीआई गूगल के एआई ओवरव्यू ब्लॉक को एक एकल संरचित-JSON HTTP कॉल में बदल देता है - एक लाज़ी-लोडेड, घूर्णनशील, भू-संवेदनशील सतह।

  • कोई DOM स्क्रेपिंग नहीं, कोई प्ले राइट नहीं, कोई चयनकर्ता रखरखाव नहीं। {prompt, country} भेजें, {ads, content, rawtext, source, web_source, ...} प्राप्त करें। शरीर मार्कडाउन के रूप में इनलाइन [N] उद्धरण संदर्भों के साथ और एक उद्धरण-हीन टेक्स्ट जुड़वां के रूप में दिया जाता है।
  • देश-पिन किया हुआ आवासीय निकास। input.country क्षेत्र अनुरोध को भू-मैच आवासीय प्रॉक्सी के माध्यम से राऊट करता है। लौटाया गया एआई ओवरव्यू वह है जो उस देश में एक वास्तविक उपयोगकर्ता देखेगा - न कि एक सामान्य यूएस फॉल्बैक।
  • लाज़ी-लोड सर्वर-साइड संभाला गया। AIO "जेनरेटिंग" प्लेसहोल्डर के पीछे रेंडर होते हैं जिसे अभिनेता सर्वर-साइड पर पोल करता है; यह पोलिंग सत्यापन में देखी गई ~12–18 सेकंड की अंत से अंत तक की लैटेंसी पर हावी होती है। कॉलर केवल निपटाए गए शरीर को प्राप्त करता है और एक वेट लूप लागू नहीं करता।
  • पूर्व-विश्लेषित उद्धरण पैनल। task_result.source एआई ओवरव्यू के उद्धृत-स्रोत पैनल है (लिंक जो गूगल उत्तर को आवंटित करता है); task_result.web_source संबंधित-खोज पैनल है जो AIO के अंतर्गत दिखाई देता है। दोनों {title, url, snippet, website_name, favicon, thumbnail} के रूप में आते हैं।
  • शॉपिंग संकेत पहले-क्लास क्षेत्रों के रूप में। is_overview_shopping, is_shopping, और purchase_link वाणिज्यिक-इरादे AIO को मार्क करते हैं बिना कि कॉलर को शरीर को विश्लेषण करना पड़े।
  • अन्य उत्पाद श्रृंखला के समान स्क्रेपलेस प्रमाणन। स्क्रैपर एआई ओवरव्यू एपीआई scraper.google.search, scraper.amazon, और यूनिवर्सल स्क्रेपिंग एपीआई के समान x-api-token हेडर का उपयोग करता है। एक खाता, कई सतहें।

स्क्रेपलेस वेबसाइट पर मुफ्त योजना पर अपना एपीआई कुंजी प्राप्त करें। स्क्रैपर एपीआई श्रृंखला स्क्रेपिंग ब्राउज़र, यूनिवर्सल स्क्रेपिंग एपीआई, और एआई एजेंट के साथ मूल्य निर्धारण कैटलॉग में स्थित है।


पूर्वापेक्षाएँ

  • एक स्क्रेपलेस खाता और एपीआई कुंजी - स्क्रेपलेस पर साइन अप करें।
  • curl (धुंध परीक्षण के लिए) या नीचे के एकीकृत क्लाइंट के लिए Python 3.10+ / Node.js 18+ के साथ एक टर्मिनल।
  • HTTP और JSON के साथ बुनियादी परिचितता।

कोई ब्राउज़र नहीं, कोई प्ले राइट नहीं, कोई प्रॉक्सी योजना अलग से खरीदने के लिए। अभिनेता आवासीय निकास, जावास्क्रिप्ट रेंडरिंग, एंटी-डिटेक्शन, और लाज़ी-लोड पोलिंग सर्वर-साइड संभालता है।


स्क्रैपर एआई ओवरव्यू एपीआई कैसे काम करता है

एकीकरण एक HTTP POST है। स्क्रेपलेस डैशबोर्ड से एक एपीआई टोकन प्राप्त करें और इसे पर्यावरण चर के रूप में संग्रहीत करें:

bash Copy
export SCRAPELESS_API_TOKEN=your_token_here

अंत बिंदु है POST https://api.scrapeless.com/api/v2/scraper/execute हेडर x-api-token: <YOUR_TOKEN> के साथ और एक JSON बॉडी जो अभिनेता और इसके इनपुट का नाम देती है:

bash Copy
curl --location 'https://api.scrapeless.com/api/v2/scraper/execute' \
  --header 'Content-Type: application/json' \
  --header "x-api-token: ${SCRAPELESS_API_TOKEN}" \
  --data '{
    "actor": "scraper.overview",
    "input": {
        "prompt":  "सर्वश्रेष्ठ दौड़ने वाले जूते",
        "country": "US"
    }
}'

एक सफल कॉल ~15 सेकंड में HTTP 200 लौटाता है और शरीर नीचे दिए गए मानक लिफाफे है।

अनुरोध पैरामीटर

पैरामीटर आवश्यक प्रकार विवरण
actor हाँ स्ट्रिंग "scraper.overview" होना चाहिए
input.prompt हाँ स्ट्रिंग वह Google क्वेरी जिसके लिए आप एआई ओवरव्यू चाहते हैं। मुक्त-फॉर्म प्राकृतिक भाषा। एक खाली मान HTTP 400 लौटाता है जिसमें Field validation for 'Prompt' failed on the 'required' tag
input.country हाँ स्ट्रिंग ISO 3166-1 अल्फा-2 देश कोड - US, GB, DE, FR, JP, आदि। आवासीय प्रॉक्सी निकास और इसलिए Google द्वारा लौटाए गए AIO के स्थानीयकृत स्वरूप को निर्धारित करता है।

प्रतिक्रिया लिफाफा

एक सफल प्रतिक्रिया एक JSON ऑब्जेक्ट होती है जिसमें तीन शीर्ष-स्तरीय कुंजी होती हैं:

json Copy
{
  "status":    "success",
  "task_id":   "ca132d3f-dc04-464e-b652-53231a8aeb8f",
  "task_result": {
    "ads":                  [ /* AIO के ऊपर प्रायोजित स्थान */ ],
    "content":              "**GraphQL** एक ओपन-सोर्स क्वेरी भाषा है ... ([GraphQL][1]) ([Postman Blog][2]) ...\n\n[1]: https://graphql.org/ \"GraphQL — ...\"",
    "rawtext":              "GraphQL एक ओपन-सोर्स क्वेरी भाषा है ...",
    "is_overview_shopping": true,
    "is_shopping":          true,
    "purchase_link":        true,
    "metadata":             { "rawUrl": "https://www.google.com/search?ApiType=overview&IsShopping=true&oq=...&q=..." },
    "products":             null,

"source": [ /* एआई ओवरव्यू द्वारा उद्धृत स्रोत / ],
"web_source": [ /
एआईओ के नीचे संबंधित खोज वेब स्रोत */ ]
}
}

Copy
`task_result` फ़ील्ड संदर्भ:

| फ़ील्ड | प्रकार | विवरण |
|---|---|---|
| `content` | स्ट्रिंग | एआई ओवरव्यू का मुख्य भाग मार्कडाउन के रूप में, जिसमें इनलाइन `[N]` उद्धरण संदर्भ और एक `[N]: <url> "<label>"` फुटनोट तालिका नीचे होती है। टेबल, शीर्षक और बोल्ड फॉर्मेटिंग एआईओ के प्रदर्शित स्वरूप से सुरक्षित रखी जाती है। |
| `rawtext` | स्ट्रिंग | वही एआईओ मुख्य भाग जिसे उद्धरणों और अंतर्निर्मित मीडिया ब्लॉकों से हटाया गया है — उपयोगी जब डाउनस्ट्रीम उपभोक्ता सरल गद्य (एलएलएम प्रॉम्प्ट, एम्बेडिंग, सर्च-इंडेक्स अंतर्ग्रहण) चाहते हैं। |
| `source` | वस्तुओं की सूची | एआई ओवरव्यू के *उद्धृत स्रोत* पैनल — वह पृष्ठ जिन्हें गूगल उत्तर के लिए जिम्मेदार ठहराता है। प्रत्येक आइटम `{शीर्षक, यूआरएल, अंश, वेबसाइट_नाम, फेविकॉन, थंबनेल, प्रकार, स्टोर्स}` होता है। |
| `web_source` | वस्तुओं की सूची | *संबंधित वेब* पैनल जो एआईओ के नीचे aparece — यह `source` के समान आकार होता है। ये एआईओ के सीधे उद्धरण नहीं होते; ये संबंधित लिंक हैं जो गूगल इसके साथ प्रदर्शित करता है। |
| `ads` | वस्तुओं की सूची | वह प्रायोजित स्थान जो एआईओ के लिए उसी क्वेरी के ऊपर चले। प्रत्येक आइटम `{विज्ञापनदाता, शीर्षक, विवरण, डिस्प्ले_यूआरएल, यूआरएल, गूगल_एड_यूआरएल, अनुभाग_शीर्षक, स्लॉट, ट्रैकिंग_टोकन, प्रकार}` होता है। |
| `is_overview_shopping` | बूलियन | जब गूगल ने एआईओ को खरीदारी-उन्मुख ओवरव्यू के रूप में वर्गीकृत किया हो तो सत्य। |
| `is_shopping` | बूलियन | जब उस एसईआरपी ने जो एआईओ उत्पन्न किया ने एक शॉपिंग मॉड्यूल ले रखा हो। |
| `purchase_link` | बूलियन | जब एआईओ मुख्य भाग में कम से कम एक सीधा खरीदारी लिंक हो। |
| `products` | वस्तुओं की सूची \| शून्य | खरीदारी एआईओ के लिए संरचित उत्पाद सूची। कुछ खरीदारी क्वेरियों के लिए भरी जाने वाली (हर आइटम: `नाम`, `कीमत`, `मूल_कीमत`, `छूट`, `रेटिंग`, `समीक्षा_गण`, `विक्रेता`, `चित्र`, `यूआरएल`, `डिलीवरी`, `स्टोर्स`, `अनुभाग_शीर्षक` — कई स्ट्रिंग फ़ील्ड खाली हो सकते हैं जब गूगल ने उस विशेषता को प्रदर्शित नहीं किया) और दूसरों के लिए `null`, भले ही `is_shopping` सत्य हो। सत्यापन में, 5 में से 1 खरीदारी कैप्चर ने 10-आइटम की सूची लौटाई; बाकी `null` थे। कोड को सुरक्षात्मक रूप से (`result.get("products") or []`) लिखें और जब `null` हो तो `source` और `content` पर वापस जाएं। |
| `metadata.rawUrl` | स्ट्रिंग | समकक्ष `google.com/search?ApiType=overview&IsShopping=...&q=...` यूआरएल जो अभिनेता ने आंतरिक रूप से इस्तेमाल किया — ऑडिट लॉग और मैनुअल रेंडर के खिलाफ क्रॉस-चेक करने के लिए उपयोगी। |

लिफाफा `status` (`"success"` या `"failed"`) और `task_id` (कार्रवाई के लिए एक UUID) शीर्ष स्तर पर भी रखता है। `task_id` को अपने स्वयं के लॉग में भंडारण करें — यह किसी विशेष क्रियान्वयन के बारे में समर्थन टिकट दायर करते समय सहसम्बंध कुंजी होती है।

---

## पायथन में एपीआई का एकीकरण

पूर्ण एकीकरण एकल `POST` और `.json()` पार्स है। स्क्रिप्ट नीचे पर्यावरण से एपीआई टोकन पढ़ती है, `prompt="best running shoes"` और `country="US"` के साथ अभिनेता को कॉल करती है, और एआईओ मुख्य भाग, शीर्ष पांच उद्धृत источों और एआईओ के ऊपर प्रायोजित स्थानों की गणना को प्रिंट करती है।

```python
import os
import requests

URL = "https://api.scrapeless.com/api/v2/scraper/execute"
HEADERS = {
    "x-api-token":  os.environ["SCRAPELESS_API_TOKEN"],
    "Content-Type": "application/json",
}
BODY = {
    "actor": "scraper.overview",
    "input": {
        "prompt":  "best running shoes",
        "country": "US",
    },
}

resp = requests.post(URL, headers=HEADERS, json=BODY, timeout=60)
resp.raise_for_status()
data = resp.json()

if data.get("status") != "success":
    raise SystemExit(f"AIO स्क्रैप विफल: {data}")
# अगर यह "लंबित" या "चालू" है, तो परिणाम डेटा प्राप्त करने के लिए "task_id" का उपयोग करें और पुनः प्रयास करें।

result = data["task_result"]

print(f"task_id = {data['task_id']}")
print(f"शॉपिंग झंडे: is_shopping={result['is_shopping']} "
      f"is_overview_shopping={result['is_overview_shopping']} "
      f"purchase_link={result['purchase_link']}\n")

# सामान्य-पाठ मुख्य भाग — डाउनस्ट्रीम एलएलएम / एम्बेडिंग पाइपलाइन के लिए सबसे अच्छा
print("=== एआई ओवरव्यू (rawtext) ===")
print(result["rawtext"][:1200], "...\n")

# एआई ओवरव्यू पैनल से शीर्ष-5 उद्धृत स्रोत
print("=== शीर्ष उद्धृत स्रोत ===")
for s in result["source"][:5]:
    print(f"  - {s['website_name']:<20}  {s['url']}")

print(f"\nएआईओ के ऊपर विज्ञापन: {len(result['ads'])}")

इस स्क्रिप्ट का एक प्रतिनिधि रन एआईओ मुख्य भाग को 12-18 सेकंड में लौटाता है और क्वेरी के लिए छह से बारह उद्धृत स्रोत प्रिंट करता है।

बैच कैप्चर के साथ पुनः प्रयास

उत्पादन में, कॉल को एक छोटे पुनः प्रयास लूप में लपेटें। अभिनेता कभी-कभी एचटीटीपी 400 लौटाता है जिसमें {"message":"execution failed","status":"failed","task_id":"..."} होता है जब गूगल किसी दिए गए प्रॉक्सी भौगोलिक स्थान में क्वेरी के लिए एआईओ प्रदर्शित नहीं करता या जब उपरी रेंडर क्षणिक होता है। छोटे बैक-ऑफ के साथ पुनः प्रयास करना आमतौर पर इसे स्पष्ट करता है:

python Copy
import os, time, requests

URL = "https://api.scrapeless.com/api/v2/scraper/execute"
HEADERS = {
    "x-api-token":  os.environ["SCRAPELESS_API_TOKEN"],
    "Content-Type": "application/json",
}
python Copy
def fetch_aio(prompt: str, country: str = "US", retries: int = 3, backoff: float = 3.0):
    body = {"actor": "scraper.overview", "input": {"prompt": prompt, "country": country}}
    last = None
    for attempt in range(retries):
        resp = requests.post(URL, headers=HEADERS, json=body, timeout=60)
        last = resp
        if resp.status_code == 200:
            payload = resp.json()
            if payload.get("status") == "success":
                return payload["task_result"]
        # transient: 400 with "execution failed" is the retryable case
        if resp.status_code == 400 and "execution failed" in resp.text:
            time.sleep(backoff * (attempt + 1))
            continue
        # hard error: bad auth, bad actor, missing prompt — do not retry
        resp.raise_for_status()
    raise RuntimeError(f"AIO scrape exhausted retries for {prompt!r}: {last.text}")

keywords = [
    "बेस्ट रनिंग जूते",
    "रनिंग के लिए बेस्ट वायरलेस ईयरबड्स",
    "रनिंग जूतों का चयन कैसे करें",
]
for kw in keywords:
    result = fetch_aio(kw, country="US")
    print(f"\n=== {kw} ===")
    print(f"  उद्धृत स्रोत: {len(result['source'])}  "
          f"वेब स्रोत: {len(result['web_source'])}  "
          f"विज्ञापन: {len(result['ads'])}")

यह कीवर्ड-बैच मॉनिटरिंग के लिए लोड-बियरिंग पैटर्न है। समवर्तीता को मध्यम रखें — प्रत्येक टोकन पर तीन से पांच समानांतर श्रमिक एक सुरक्षित प्रारंभिक बिंदु है — और 'execution failed' संकेत पर पीछे हटें, न कि इसे एक कठिन विफलता के रूप में मानें।

आपकी API कुंजी मुफ्त योजना पर प्राप्त करें: Scrapeless वेबसाइट


Node.js (18+) में API को एकीकृत करना

Node में वही कॉल, निर्मित fetch का उपयोग करते हुए:

js Copy
const URL = "https://api.scrapeless.com/api/v2/scraper/execute";

async function fetchAIO(prompt, country = "US") {
  const resp = await fetch(URL, {
    method: "POST",
    headers: {
      "x-api-token": process.env.SCRAPELESS_API_TOKEN,
      "Content-Type": "application/json",
    },
    body: JSON.stringify({
      actor: "scraper.overview",
      input: { prompt, country },
    }),
  });

  if (!resp.ok) {
    const text = await resp.text();
    throw new Error(`HTTP ${resp.status}: ${text}`);
  }
  const payload = await resp.json();
  if (payload.status !== "success") {
    throw new Error(`AIO स्क्रैप विफल: ${JSON.stringify(payload)}`);
  }
  return payload.task_result;
}

const result = await fetchAIO("बेस्ट रनिंग जूते", "US");

console.log(`खरीदारी ध्वज: is_shopping=${result.is_shopping} ` +
            `is_overview_shopping=${result.is_overview_shopping}`);

console.log("\n=== AI ओवरव्यू (कच्चा पाठ) ===");
console.log(result.rawtext.slice(0, 1200), "...\n");

console.log("=== शीर्ष उद्धृत स्रोत ===");
for (const s of result.source.slice(0, 5)) {
  console.log(`  - ${s.website_name.padEnd(20)} ${s.url}`);
}

console.log(`\nAIO के ऊपर विज्ञापन: ${result.ads.length}`);

पुनः प्रयास पैटर्न Python संस्करण के समान है: केवल 'HTTP 400 + "execution failed"' पर पुनः प्रयास करें; '401', '4xx' जिसमें 'code: 14002' (अमान्य अभिनेता) और 'Prompt' पर वैधता त्रुटि को कठिन विफलताओं के रूप में मानें जिन्हें पुनः प्रयास करने से ठीक नहीं होगा।


एंड-टू-एंड Google-AI स्क्रैपिंग के लिए साथी अभिनेता

स्क्रैपर AI ओवरव्यू API एक Google AI सतह को कवर करता है। प्रोडक्शन पाइपलाइन्स जो ब्रांड दृश्यता की निगरानी करते हैं, GEO डेटा सेट बनाते हैं, या उत्तर-गुणवत्ता मॉडल को प्रशिक्षित करने के लिए अक्सर दो और की आवश्यकता होती है।

scraper.google.search — पारंपरिक ऑर्गेनिक SERP

AIO के नीचे दस नीले लिंक, लोग भी पूछते हैं जो जोड़े, ज्ञान पैनल, विशेष स्निपेट और संबंधित खोजें ब्लॉक के लिए, scraper.google.search संरचित समकक्ष है। 'scraper.overview' के source एरे में उद्धृत-स्रोत डोमेन अलग-अलग उपयोगी होते हैं, लेकिन जब उन्हें उसी प्रश्न के लिए जैविक शीर्ष-10 के खिलाफ जोड़ा जाता है तो उनका अधिक अर्थ होता है — वह जुड़ाव आपको बताता है कि क्या एक उद्धृत डोमेन जैविक रूप से भी रैंक कर रहा है, और किस स्थिति में।

scraper.aimode — AI मोड टैब

Google का AI मोड एक अलग, पूर्ण-पृष्ठ संवादात्मक अनुभव है जो SERP से निकलता है। यह उत्तर को अधिक चैट-जैसे प्रारूप में फिर से लिखता है, अनुसरण करने वाले प्रॉम्प्ट लेता है, और एक अलग उद्धरण पैनल लेआउट का उपयोग करता है। scraper.aimode इसके लिए विशेष अभिनेता है। Google के AI खोज द्वारा एक विषय को कैसे पेश किया जा रहा है, इसका पूरा दृश्य प्राप्त करने के लिए, 'scraper.overview', 'scraper.google.search', और 'scraper.aimode' सभी को उसी प्रश्न, उसी देश, उसी समयStamp पर कैप्चर करें।

LLM-उत्तर परिदृश्य के लिए अन्य सार्वभौमिक स्क्रैपिंग API

Google AI ओवरव्यू एक उद्धरण सतह है। ब्रांड-स्तरीय GEO प्रोग्राम के लिए, आपको आमतौर पर ChatGPT खोज परिणामों, Perplexity उत्तरों, और अन्य LLM-पावर्ड खोज अनुभवों की निगरानी करने की आवश्यकता होती है। Universal Scraping API उनके लिए समर्पित मार्ग है - वही x-api-token, अलग अभिनेता नाम, वही JSON-एनवेलप आकार।

Copy
### `scraper.amazon` (Rufus) व्यावसायिक पक्ष के लिए

जब मॉनिटर की गई ब्रांड एक भौतिक उत्पाद होता है, तो Amazon Rufus एआई-उत्तर पाइपलाइन के दूसरे छोर पर होता है। [Amazon Rufus अभिनेता](https://www.scrapeless.com/hi/blog/how-to-scrape-rufus-data-amazon) किसी भी प्राकृतिक-भाषा उत्पाद प्रश्न के लिए बातचीत आधारित खरीदारी सहायक का सटीक उत्तर लौटाता है। Google AIO के साथ मिलकर, यह आपको बताता है कि कैसे दो सबसे बड़े एआई-उत्तर सतहें आपके उत्पाद या आपके प्रतिस्पर्धियों के उत्पाद को स्थिति देने में मदद करती हैं।

चारों अभिनेता एक Scrapeless खाता, एक `x-api-token` हेडर, और एक लिफाफे के आकार को साझा करते हैं। एक बार एकल क्लाइंट रैपर को वायर करें और इसे परिवार में फिर से उपयोग करें।

---

## सामान्य समस्याओं से बचने के लिए कैसे करें

### आपको जो त्रुटि प्रतिक्रियाएँ दिख सकती हैं

एपीआई हर त्रुटि मामले के लिए संरचित JSON लौटाता है। `code` फील्ड, जब मौजूद हो, Scrapeless त्रुटि कोड है; `message` मानव-पाठनीय व्याख्या है।

| परिदृश्य | HTTP | प्रतिक्रिया शरीर |
|---|---|---|
| अमान्य एपीआई टोकन | `401` | `{"code":14404,"message":"invalid access token"}` |
| गलत अभिनेता नाम | `400` | `{"code":14002,"message":"invalid actor: <name>","status":"failed"}` |
| अनुपस्थित या खाली `input.prompt` | `400` | `{"message":"Key: 'overviewParam.Prompt' Error:Field validation for 'Prompt' failed on the 'required' tag","status":"failed"}` |
| अमान्य देश कोड | `400` | `{"message":"execution failed","status":"failed","task_id":"..."}` |
| क्वेरी जो AIO को कभी नहीं देने या अस्थायी अपस्ट्रीम विफलताओं के लिए है | `400` | `{"message":"execution failed","status":"failed","task_id":"..."}` |
| सफलता | `200` | `{"status":"success","task_id":"...","task_result":{...}}` |
| लंबित | `201` | `{"status":"pending","task_id":"..."}` कार्य निष्पादित हो रहा है। कृपया बाद में दोबारा प्रयास करें। |
| चल रहा है | `202` | `{"status": "running", "task_id":"..."}` कार्य बना दिया गया है। आप बाद में कार्य आईडी का उपयोग करके परिणाम प्राप्त कर सकते हैं।|

`144xx` कोड प्रमाणीकरण और अभिनेता मान्यता के लिए होते हैं; `Field validation` पेलोड अनुरोध-आकार है; `execution failed` कोई-AIO और ट्रांझिएंट अपस्ट्रीम मामलों को कवर करता है। हमेशा किसी भी विफल प्रतिक्रिया से `task_id` को संग्रहित करें — यह वह है जिसे Scrapeless सहायता एकल खराब कार्यान्वयन का संबंध बनाने की आवश्यकता होती है।

### समस्या-समाधान जोड़े

**समस्या: एक क्वेरी `execution failed` लौटाता है लेकिन पुनः प्रयास करने पर कार्य करता है।**
समाधान: यह अस्थायी अपस्ट्रीम संकेत है। वही क्वेरी जो अब विफल होती है, आमतौर पर पांच से तीस सेकंड बाद सफल होती है। 3-6 सेकंड का बैक-ऑफ और छोटे प्रयास बजट (3 प्रयास) के साथ पुनः प्रयास करें। उस बजट के दौरान लगातार विफलता को "इस भौगोलिक क्षेत्र में इस क्वेरी के लिए कोई AIO उपलब्ध नहीं है" के रूप में मानें न कि एक एकीकरण बग के रूप में।

**समस्या: एक क्वेरी लगातार `execution failed` लौटाता है जो पुनः प्रयास करने पर भी नहीं बदलता।**
समाधान: हर Google क्वेरी एक एआई अवलोकन उत्पन्न नहीं करती। एकल-शब्द क्वेरी, नेविगेशनल क्वेरी (`"facebook"`), और क्वेरी जो Google ने ग्राउंड करने के लिए नहीं चुनी है, आमतौर पर ऐसा नहीं करती। सुनिश्चित करने के लिए, उसी भौगोलिक क्षेत्र (घरेलू VPN या एक असली डिवाइस) से `https://www.google.com/search?q=<query>` खोलें; यदि किसी मानव उपयोगकर्ता के लिए कोई AIO उत्पन्न नहीं होता है, तो अभिनेता भी इसे उत्पन्न नहीं करेगा। क्वेरी को अधिक सूचना-आधारित करने के लिए फिर से शब्दबद्ध करें ("X कैसे काम करता है", "Y के लिए सबसे अच्छा X", "X बनाम Y")।

**समस्या: `task_result.products` `null` है जबकि `is_shopping` `true` है।**
समाधान: कुछ खरीदारी AIO के लिए `task_result.products` भरा जाता है और दूसरों के लिए `null` होता है — भले ही `is_shopping` सही हो। जब मौजूद होता है, तो प्रत्येक आइटम में `name`, `price`, `orig_price`, `discount`, `rating`, `review_count`, `seller`, `img`, `url`, `delivery`, `stores`, और `section_title` होता है (कई स्ट्रिंग फील्ड ऐसे हो सकते हैं जिनमें Google ने उस विशेषता को नहीं प्रस्तुत किया)। जब क्षेत्र `null` हो, तो `task_result.source` से उत्पाद के उम्मीदवार पढ़ें (उक्त स्रोत पैनल — अक्सर खुदरा विक्रेता पृष्ठ) और `task_result.content` में अंतर्निहित उत्पाद संदर्भों के लिए मार्कडाउन शरीर का विश्लेषण करें। हमेशा `null` के खिलाफ सावधानी से कोड करें: `result.get("products") or []`।

**समस्या: `task_result.source` और `task_result.web_source` समान दिखते हैं — कौन सा है कौन सा?**
समाधान: `source` एआई अवलोकन का अपना उद्धरण पैनल है (लिंक जिनसे AIO की पहचान होती है)। `web_source` AIO के नीचे प्रस्तुत संबंधित खोज पैनल है। GEO उद्धरण ट्रैकिंग के लिए, `source` से गिनती करें; संबंधित सामग्री के अवसरों के लिए, `web_source` का उपयोग करें।

**समस्या: `content` में AIO शरीर में मार्कडाउन उद्धरण संदर्भ हैं (`[1]`, `[2]`) लेकिन मुझे साधारण गद्य चाहिए।**
समाधान: `task_result.rawtext` का उपयोग करें — यह उद्धरण-फाट stripped जुड़वां है, जो एम्बेडिंग, डाउनस्ट्रीम LLM प्रॉम्प्ट, और खोज-सूचक संचयन के लिए उपयुक्त है। जब आपको श्रेय के साथ उत्तर देने की आवश्यकता हो, तो `content` का उपयोग करें।

**समस्या: वही क्वेरी विभिन्न कॉल्स पर विभिन्न AIO शरीर लौटाती है।**
समाधान: एआई अवलोकन गैर-निर्धारणकारी हैं — Google इन्हें प्रति सत्र फिर से उत्पन्न करता है और ये घंटे और दिन के साथ परिवर्तित होते हैं। निगरानी उपयोग मामलों के लिए, हर कैप्चर पर टाइमस्टैम्प और `country` को पिन करें और कच्ची प्रतिक्रिया को बनाए रखें; शरीर को एक नमूना के रूप में मानें, जिसे स्थायी नहीं समझा जाना चाहिए। उद्धृत-स्रोत सेट आमतौर पर गद्य शरीर की तुलना में अधिक स्थिर होता है।
**समस्या: दर-सीमा और समवर्ती सीमाएं सार्वजनिक दस्तावेज़ों में नहीं हैं।**
समाधान: श्रृंखला कॉल से शुरू करें। HTTP 429 या `execution failed` में वृद्धि पर ध्यान देते हुए, समवर्तीता को تدريجात्मक रूप से बढ़ाएं। स्थायी उच्च-वॉल्यूम पाइपलाइनों के लिए, Scrapeless समर्थन से संपर्क करें ताकि एक समर्पित लेन का प्रबंध किया जा सके।

---

## निष्कर्ष: एक-लाइन निर्भरता के रूप में संरचित AIOs

गूगल की एआई अवलोकन SEO, GEO, ब्रांड निगरानी और एआई-ग्राउंडिंग पाइपलाइनों के लिए एक लोड-बेयरिंग सतह बन गई है। इसे DOM स्वचालन के माध्यम से स्क्रैप करना काम करता है लेकिन इसके नीचे पूरे सेलेक्टर-मेण्टेनेन्स, आवासीय-इग्रेस, लेज़ी-लोड, और CAPTCHA-हैंडलिंग स्टैक को ले जाता है। Scrapeless Scraper AI Overview API पूरी एकीकरण को एक HTTP POST में तीन आवश्यक फ़ील्ड्स (`actor`, `input.prompt`, `input.country`) के साथ कम कर देता है और एक संरचित JSON लिफाफा लौटाता है जहाँ AIO बोडी, उद्धृत स्रोत, संबंधित पैनल, AIO के ऊपर के विज्ञापन, और खरीदारी के झंडे सभी प्रथम श्रेणी के फ़ील्ड हैं।

`scraper.google.search` के साथ जैविक SERP के लिए और `scraper.aimode` के साथ गूगल के AI मोड टैब के लिए, तीन अभिनेता मिलकर एक ही Scrapeless खाते से गूगल की पूरी AI-संवर्धित खोज सतह को कवर करते हैं। साथी [यूनिवर्सल स्क्रैपिंग API](https://www.scrapeless.com/hi/product/universal-scraping-api) समान पैटर्न को ChatGPT, Perplexity, और अन्य LLM-उत्तर सतहों तक बढ़ाता है — एक उत्पादन GEO कार्यक्रम के निर्माण ब्लॉक्स।

[app.scrapeless.com](https://app.scrapeless.com) पर मुफ्त Scraper API क्रेडिट के लिए साइन अप करें, और पूरी API संदर्भ को [`apidocs.scrapeless.com`](https://apidocs.scrapeless.com) पर पढ़ें।

---

## क्या आप अपने एआई-शक्तिशाली खोज पाइपलाइन का निर्माण करने के लिए तैयार हैं?

हमारे समुदाय में शामिल हों ताकि एक मुफ्त योजना प्राप्त कर सकें और Scrapeless पर GEO, ब्रांड-AI, और खोज-निगरानी पाइपलाइनों का निर्माण करने वाले डेवलपर्स से जुड़ सकें: 
[डिस्कॉर्ड](https://discord.gg/scrapeless) 
[टेलीग्राम](https://t.me/scrapeless)

[Scrapeless वेबसाइट](https://app.scrapeless.com/passport/login/?utm_source=website&utm_medium=blog&utm_campaign=aioverview&utm_term=guide) पर मुफ्त Scraper API क्रेडिट के लिए साइन अप करें और ऊपर के पैटर्न को उन कीवर्ड, देशों, और ब्रांड शर्तों के अनुसार अनुकूलित करें जिनकी आपके पाइपलाइन को आवश्यकता है।

## अक्सर पूछे जाने वाले प्रश्न

**Q1: क्या गूगल एआई अवलोकनों का स्क्रैपिंग कानूनी है?**
सार्वजनिक एआई अवलोकन सामग्री जो `google.com` पर उभरी है, सार्वजनिक रूप से दृश्य खोज परिणाम का हिस्सा है और सामान्य रूप से अनुसंधान, SEO निगरानी, और प्रतिस्पर्धात्मक विश्लेषण के लिए पहुंच की दृष्टि से उचित मानी जाती है। विशेष अधिकार क्षेत्र और उपयोगकर्ताओं की परिस्थितियाँ भिन्न होती हैं — वाणिज्यिक उपयोग, AIO बोडी का पुनर्वितरण, और बड़े पैमाने पर स्वचालित पहुंच पर गूगल की सेवा की शर्तें और स्थानीय डेटा-संरक्षण कानून के अंतर्गत अतिरिक्त विचार हो सकते हैं। गूगल की सेवा की शर्तें और आपके स्थानीय नियमों की समीक्षा करें, और स्क्रैप की गई AIO सामग्री को प्रकाशित करने या पुनर्वितरित करने से पहले वकील से परामर्श करें।

**Q2: क्या हर गूगल क्वेरी एक एआई अवलोकन उत्पन्न करती है?**
नहीं। गूगल यह चुनता है कि कब AIO को उभारा जाए और यह दर क्वेरी श्रेणी, भूगोल, भाषा, और चल रहे उत्पाद प्रयोगों के अनुसार भिन्न होती है। सूचना, तुलना, "कैसे X काम करता है", "सर्वश्रेष्ठ X", और खरीदारी-इच्छा वाली क्वेरियाँ 2026 में एक को ट्रिगर करने की सबसे अधिक संभावना होती हैं। नेविगेशनल क्वेरियाँ (`"facebook"`, `"amazon login"`) और एकल-शब्द अस्पष्ट क्वेरियाँ आमतौर पर नहीं होती हैं। अभिनेता उन क्वेरियों के लिए `execution failed` लौटाता है जिन्हें गूगल उस भूगोल में नहीं ग्राउंड करता है।

**Q3: `input.country` में कौन से देश समर्थित हैं?**
देश का फ़ील्ड ISO 3166-1 अल्फा-2 कोड स्वीकार करता है और इसे `US` और `GB` के खिलाफ एंड-टू-एंड सत्यापित किया जाता है। अभिनेता का समर्थन करने वाला आवासीय-प्रॉक्सी फुटप्रिंट 195+ देशों में फैला हुआ है, इसलिए अधिकांश सामान्य कोड (`DE`, `FR`, `JP`, `CA`, `AU`, `BR`, `IN`, `ES`, `IT`, `NL`) काम करते हैं; एक unsupported कोड `execution failed` लौटाता है। स्केलिंग से पहले छोटे धूम्रपान परीक्षण के साथ अपने विशेष देश के खिलाफ सत्यापित करें।

**Q4: एकल कॉल कितनी तेज है?**
एंड-टू-एंड विलंबता आमतौर पर सत्यापन में 12–18 सेकंड होती है। इसका अधिकांश भाग गूगल के "जेनरेटिंग" प्लेसहोल्डर के पीछे AI अवलोकन को तय करने के लिए सर्वर-साइड पोलिंग है — अभिनेता केवल प्रस्तुत बोडी लौटाता है, प्लेसहोल्डर नहीं।

**Q5: क्या मैं कई क्वेरियों को समवर्ती रूप से बैच कर सकता हूँ?**
हां। प्रति टोकन तीन से पांच समानांतर श्रमिकों के साथ शुरू करें और `execution failed` दर पर नजर रखते हुए स्केल करें। सार्वजनिक दर-सीमा और समवर्ती सीमाएँ प्रलेखित नहीं की गईं हैं; उच्च-वॉल्यूम लेनों के लिए Scrapeless समर्थन से संपर्क करें।

**Q6: `scraper.overview` `scraper.google.search` और `scraper.aimode` से कैसे भिन्न है?**
`scraper.overview` विशेष रूप से एआई अवलोकन ब्लॉक — बोडी, उद्धरण, संबंधित पैनल, प्रायोजित स्थानों, खरीदारी झंडों को लौटाता है। `scraper.google.search` SERP का बाकी हिस्सा लौटाता है — जैविक दस नीले लिंक, फ़ीचर्ड स्निपेट, पीपल ऑल्सो आस्क, नॉलेज पैनल, संबंधित खोजें। `scraper.aimode` गूगल की अलग AI मोड संवादात्मक पृष्ठ लौटाता है। गूगल के AI खोज के द्वारा किसी विषय को कैसे प्रस्तुत किया जाता है, इसके पूर्ण दृश्य के लिए, एक ही क्वेरी, एक ही देश, एक ही समय पर सभी तीन को कैप्चर करें।

**Q7: क्या मैं खरीदारी AIOs के लिए संरचित उत्पाद सूची प्राप्त कर सकता हूँ?**
हाँ, कुछ शॉपिंग AIO के लिए। जब भर दिया जाता है, `task_result.products` `{name, price, orig_price, discount, rating, review_count, seller, img, url, delivery, stores, section_title}` के एक ऐरे के रूप में होता है (जब Google उस विशेषता को नहीं दिखाता है, तो कई स्ट्रिंग फ़ील्ड खाली हो सकते हैं)। यह अन्य शॉपिंग AIO के लिए `null` होता है भले ही `is_shopping` `true` हो — सत्यापन में, 5 में से 1 शॉपिंग कैप्चर ने 10-सामग्री का ऐरे लौटाया; बाकी null थे। когда поле равно null, читайте кандидатов на продукцию из `task_result.source` (часто страницы розничных продавцов) и парсите встроенные упоминания в `task_result.content`. हमेशा `null` के खिलाफ सुरक्षात्मक रूप से कोड करें (`result.get("products") या []`).

**Q8: `is_overview_shopping` का क्या अर्थ है और यह `is_shopping` से कैसे भिन्न है?**
`is_shopping` तब सच है जब अंतर्निहित SERP में एक शॉपिंग मॉड्यूल है (कारोसेल जैविक परिणामों के ऊपर)। `is_overview_shopping` तब सच है जब Google ने AI अवलोकन को स्वयं शॉपिंग-उन्मुख के रूप में वर्गीकृत किया। `purchase_link` तब सच है जब AIO शरीर में कम से कम एक सीधा खरीद URL होता है। वाणिज्यिक उद्देश्य वाली AIO को खुदरा-खुफिया पाइपलाइनों में फ़िल्टर करने के लिए संयोजन का उपयोग करें।

**Q9: क्या मुझे खुद लेज़ी-लोड प्लेसहोल्डर को संभालना है?**
नहीं। AIO एक "उत्पन्न हो रहा है" प्लेसहोल्डर के पीछे रेंडर होता है, और अभिनेता सर्वर-पक्ष पर तब तक पोल करता है जब तक शरीर स्थिर नहीं हो जाता। वह पोलिंग ~12–18 सेकंड के अंत-से-अंत की विलंबता का प्रमुख घटक है। कॉलर्स एक प्रतीक्षा लूप को लागू नहीं करते हैं।

**Q10: मुझे दीर्घकालिक निगरानी के लिए प्रतिक्रिया को कैसे संग्रहीत करना चाहिए?**
पूर्ण API संदर्भ और लाइव अनुरोध का खेल का मैदान: [`apidocs.scrapeless.com`](https://apidocs.scrapeless.com)। SDK और एकीकरण दस्तावेज़: [`docs.scrapeless.com`](https://docs.scrapeless.com)।

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची