वापस ब्लॉग पर

गूगल सर्च परिणामों को पायथन के साथ कैसे स्क्रैप करें (2026)

Sophia Martinez
Sophia Martinez

Specialist in Anti-Bot Strategies

31-Jul-2026

Google खोज परिणाम पृष्ठ (SERP) क्या है?

जब भी गूगल खोज परिणामों को वेब स्क्रैपिंग पर चर्चा की जाती है, आप "SERP" संक्षेप का सामना करेंगे। SERP का अर्थ है सर्च इंजन रिजल्ट पेज। यह वह पृष्ठ है जो आपको खोज बार में क्वेरी डालने के बाद मिलता है।

अतीत में, गूगल आपकी क्वेरी के लिए लिंक की एक सूची प्रदान करता था। आज, यह पूरी तरह से अलग है - SERPs विभिन्न प्रकार की सुविधाओं और तत्वों को शामिल करते हैं जो आपके खोज अनुभव को तेज और सुविधाजनक बनाते हैं।
आम तौर पर, पृष्ठ में शामिल हैं:

  • ऑर्गेनिक सर्च परिणाम
  • भुगतान किए गए सर्च परिणाम
  • विशेष स्निपेट्स
  • ज्ञान ग्राफ
  • अन्य तत्व: जैसे कि मानचित्र, चित्र, या समाचार कहानियाँ जो क्वेरी के आधार पर दिखाई देती हैं।

क्या Google खोज परिणामों को स्क्रैप करना कानूनी है?

Google खोज परिणामों को स्क्रैप करने से पहले, कानूनी निहितार्थों को समझना आवश्यक है। गूगल की सेवा की शर्तें उनके खोज परिणामों को स्क्रैप करने से मना करती हैं, जैसा कि उनकी नीतियों में कहा गया है:

"आप सेवाओं तक पहुँचने के लिए किसी भी आकार की साधन का उपयोग करके स्क्रैप, क्रॉल, या कोई स्वचालित साधन का उपयोग नहीं करेंगे।"

इन शर्तों का उल्लंघन IP बैन या यहां तक कि Google से कानूनी कार्रवाई का कारण बन सकता है। हालांकि, स्क्रैपिंग की वैधता क्षेत्राधिकार, आपके द्वारा स्क्रैप किया जा रहा डेटा, और आप इसे किस प्रकार उपयोग कर रहे हैं, पर निर्भर करती है।

गूगल को स्क्रैप करने के विकल्प:

  • Google कस्टम सर्च API: Google एक आधिकारिक API प्रदान करता है जिससे खोज परिणामों को पुनर्प्राप्त किया जा सकता है, जो डेटा तक पहुँचने का एक कानूनी और संरचित तरीका प्रदान करता है बिना उनकी नीतियों का उल्लंघन किए।
  • अन्य खोज API: यदि आप Google का उपयोग करने के लिए प्रतिबद्ध नहीं हैं, तो अन्य खोज इंजन और सेवाएँ हैं जो खोज परिणामों तक पहुँचने के लिए API प्रदान करती हैं, जैसे कि बिंग, और Scrapeless

Google खोज स्क्रैपिंग क्यों कठिन है?

Google SERPs को स्क्रैप करना कई चुनौतियों का सामना करता है, यही कारण है कि इसे कठिन माना जाता है। इनमें शामिल हैं:

  1. बॉट पहचान: Google बॉट्स का पता लगाने और ब्लॉक करने के लिए कई तकनीकों का उपयोग करता है, जिसमें शामिल हैं:
  • CAPTCHA
  • IP ब्लॉकिंग
  • दर सीमा निर्धारित करना
  1. गतिशील सामग्री: Google खोज परिणाम अक्सर JavaScript का उपयोग करके गतिशील रूप से उत्पन्न होते हैं, जिससे स्क्रैपिंग करना जटिल हो सकता है। सामग्री प्रारंभिक पृष्ठ लोड के बाद लोड हो सकती है, जिससे पृष्ठ को पूरी तरह से प्रदर्शित करने के लिए Selenium जैसे उपकरणों की आवश्यकता हो सकती है।
  2. HTML संरचना में बदलाव: Google अक्सर अपने खोज परिणामों की लेआउट और संरचना बदलता है, जिसका अर्थ है कि स्क्रैपर्स को कोड को बंद होने से बचाने के लिए तेजी से अनुकूलित करने की आवश्यकता होती है।
  3. जटिल डेटा: SERP में विभिन्न जटिल तत्व जैसे विज्ञापन, चित्र, वीडियो, और समृद्ध स्निपेट शामिल हैं, जिससे लगातार अर्थपूर्ण डेटा निकालना चुनौतीपूर्ण हो जाता है।

इन चुनौतियों के बावजूद, सही तकनीकों और उपकरणों के साथ Google खोज परिणामों को स्क्रैप करना अभी भी संभव है।

आइए Python के साथ Google खोज परिणामों को स्क्रैप करने की प्रक्रिया को निम्नलिखित चरणों में तोड़ते हैं:

Python के साथ Google खोज परिणामों को स्क्रैप कैसे करें

चरण 1: HTTP अनुरोध भेजें

स्क्रैपिंग शुरू करने से पहले, आपको Google के खोज पृष्ठ पर एक अनुरोध भेजने की आवश्यकता होगी। चूंकि Google अधिकांश अनुरोधों को बॉट्स से ब्लॉक करता है, इसलिए एक उचित User-Agent हेडर सेट करके वास्तविक उपयोगकर्ता का अनुकरण करना आवश्यक है।

Python Copy
import requests
from fake_useragent import UserAgent

# एक यादृच्छिक उपयोगकर्ता-एजेंट उत्पन्न करें
ua = UserAgent()
headers = {'User-Agent': ua.random}

# Google खोज क्वेरी
query = "Python के साथ Google खोज परिणामों को कैसे स्क्रैप करें"
url = f"https://www.google.com/search?q={query}"

# GET अनुरोध भेजें
response = requests.get(url, headers=headers)

# जांचें कि क्या अनुरोध सफल था
if response.status_code == 200:
    print(response.text)
else:
    print("पृष्ठ प्राप्त करने में विफल")

चरण 2: ऑर्गेनिक सर्च परिणामों का पार्स करें

एक बार जब आपके पास Google SERP की HTML सामग्री होती है, तो आप आवश्यक डेटा निकालने के लिए BeautifulSoup का उपयोग कर सकते हैं।

Python Copy
from bs4 import BeautifulSoup

# पृष्ठ सामग्री का पार्स करें
soup = BeautifulSoup(response.text, 'html.parser')

# सभी खोज परिणाम कंटेनरों को खोजें
search_results = soup.find_all('div', class_='BVG0Nb')

for result in search_results:
    title = result.text
    link = result.find('a')['href']
    print(f"शीर्षक: {title}")
    print(f"लिंक: {link}\n")

चरण 3: Selenium के साथ JavaScript परिणामों को रेंडर करें

Selenium उन पृष्ठों को संभालने के लिए एक उत्कृष्ट उपकरण है जो सामग्री को रेंडर करने के लिए JavaScript का उपयोग करते हैं। यह एक ब्राउज़र को स्वचालित करता है और उपयोगकर्ता इंटरएक्शन का अनुकरण करता है, जिससे गतिशील रूप से उत्पन्न सामग्री को स्क्रैप करने के लिए यह आदर्श हो जाता है।

Python Copy
from selenium import webdriver
from selenium.webdriver.common.by import By
from webdriver_manager.chrome import ChromeDriverManager

# Selenium WebDriver सेट करें
driver = webdriver.Chrome(ChromeDriverManager().install())

# Google खोलें और खोज करें
driver.get("https://www.google.com/")
search_box = driver.find_element(By.NAME, 'q')
search_box.send_keys("Python के साथ Google खोज परिणामों को कैसे स्क्रैप करें")
search_box.submit()

# परिणामों के लोड होने की प्रतीक्षा करें और लिंक निकालें
driver.implicitly_wait(5)

# खोज परिणाम प्राप्त करें
search_results = driver.find_elements(By.CLASS_NAME, 'BVG0Nb')

for result in search_results:
    title = result.text

Here's the translation of the given text into Hindi:

python Copy
link = result.find_element(By.TAG_NAME, 'a').get_attribute('href')
    print(f"शीर्षक: {title}")
    print(f"लिंक: {link}\n")

driver.quit()

चरण 4: ब्लॉकिंग और दर सीमा को कम करें

गूगल द्वारा पहचान लिए जाने और ब्लॉक होने के संभावनाओं को कम करने के लिए आपको चाहिए:

  • यूजर एजेन्स बदलें: विभिन्न ब्राउज़रों से अनुरोधों का अनुकरण करने के लिए अलग-अलग यूजर एजेन्स का उपयोग करें।
  • विलंब जोड़ें: मानव जैसे ब्राउज़िंग व्यवहार का अनुकरण करने के लिए अनुरोधों के बीच यादृच्छिक विलंब प्रस्तुत करें।
  • प्रॉक्सी का उपयोग करें: अपने अनुरोधों को वितरित करने और पहचान से बचने के लिए IP पतों को घुमाएँ।
  • Robots.txt का सम्मान करें: हमेशा गूगल के robots.txt फ़ाइल की जाँच करें और नैतिक स्क्रैपिंग प्रथाओं का पालन करें।

स्क्रैपलेस डीप सर्पएपीआई के साथ गूगल खोज परिणामों को स्क्रैप करें

गूगल को सीधे स्क्रैप करना संभव है, लेकिन यह थकाऊ और त्रुटिपूर्ण हो सकता है, और यह अक्सर ब्लॉक होने का परिणाम देता है। यहीं स्क्रैपलेस आता है। शक्तिशाली CAPTCHA सॉल्वर, IP रोटेशन, बुद्धिमान प्रॉक्सी, और वेब अनलॉकर के साथ, स्क्रैपलेस एक शक्तिशाली API है जो विशेष रूप से उपयोगकर्ताओं को बिना ब्लॉक हुए खोज परिणामों को स्क्रैप करने में मदद करने के लिए बनाया गया है।

प्रबंधित SERP API का उपयोग क्यों करें?

  • कानूनी: स्क्रैपलेस खोज परिणामों को एक्सेस करने का एक कानूनी और अनुपालन तरीका प्रदान करता है।
  • विश्वसनीयता: API पहचान से बचने के लिए उन्नत तकनीकों का उपयोग करता है, जिससे डेटा संग्रह में बाधा नहीं आती।
  • उपयोग में आसानी: स्क्रैपलेस एक सरल API प्रदान करता है जो Python के साथ आसानी से एकीकृत होता है, जो डेवलपर्स के लिए खोज परिणाम डेटा तक त्वरित पहुँच प्राप्त करना आदर्श बनाता है।
  • अनुकूलन योग्य: आप अपने आवश्यकताओं के अनुसार परिणामों को कस्टमाइज कर सकते हैं, जैसे सामग्री के प्रकार (जैसे, ऑर्गेनिक लिस्टिंग, विज्ञापन आदि) को निर्धारित करना।

गूगल खोज अनुरोध कैसे चलाएँ

डेटा को लक्षित और विशिष्ट बनाने के लिए, हम इस लेख में एक डेमो के रूप में गूगल ट्रेंड्स को क्रॉल करते हैं।

वेब ब्लॉकिंग और गूगल खोज स्क्रैपिंग से निराश?
हमारे समुदाय में शामिल हों और मुफ्त परीक्षण के साथ प्रभावी समाधान प्राप्त करें!

चरण 1. स्क्रैपलेस डैशबोर्ड में लॉग इन करें और "गूगल सर्च API" पर जाएं।

Google Search API

चरण 2. बाईं ओर आवश्यक कीवर्ड, क्षेत्र, भाषा, प्रॉक्सी और अन्य जानकारी को कॉन्फ़िगर करें। सुनिश्चित करें कि सब कुछ ठीक है, फिर "स्क्रैपिंग शुरू करें" पर क्लिक करें।

  • q: पैरामीटर वह क्वेरी परिभाषित करता है जिसे आप खोजना चाहते हैं।
  • gl: पैरामीटर वह देश परिभाषित करता है जिसका उपयोग गूगल खोज के लिए किया जाएगा।
  • hl: पैरामीटर वह भाषा परिभाषित करता है जिसका उपयोग गूगल खोज के लिए किया जाएगा।
Start Scraping

चरण 3. क्रॉलिंग परिणाम प्राप्त करें और उन्हें निर्यात करें।

Get the crawling results

क्या आपको अपने प्रोजेक्ट में एकीकृत करने के लिए केवल नमूना कोड चाहिए? हम आपकी मदद करेंगे! या आप किसी भी भाषा के लिए हमारी API दस्तावेज़ीकरण पर जा सकते हैं जिसकी आवश्यकता हो।

  • Python:
Python Copy
import http.client
import json

conn = http.client.HTTPSConnection("api.scrapeless.com")
payload = json.dumps({
   "actor": "scraper.google.search",
   "input": {
      "q": "coffee",
      "hl": "en",
      "gl": "us"
   }
})
headers = {
   'Content-Type': 'application/json'
}
conn.request("POST", "/api/v1/scraper/request", payload, headers)
res = conn.getresponse()
data = res.read()
print(data.decode("utf-8"))
  • Golang
Go Copy
package main

import (
   "fmt"
   "strings"
   "net/http"
   "io/ioutil"
)

func main() {

   url := "https://api.scrapeless.com/api/v1/scraper/request"
   method := "POST"

   payload := strings.NewReader(`{
    "actor": "scraper.google.search",
    "input": {
        "q": "coffee",
        "hl": "en",
        "gl": "us"
    }
}`)

   client := &http.Client {
   }
   req, err := http.NewRequest(method, url, payload)

   if err != nil {
      fmt.Println(err)
      return
   }
   req.Header.Add("Content-Type", "application/json")

   res, err := client.Do(req)
   if err != nil {
      fmt.Println(err)
      return
   }
   defer res.Body.Close()

   body, err := ioutil.ReadAll(res.Body)
   if err != nil {
      fmt.Println(err)
      return
   }
   fmt.Println(string(body))
}

निष्कर्ष: एक Python स्क्रैपर या SERP API चुनें

गूगल खोज परिणामों को स्क्रैप करना जटिल हो सकता है, लेकिन सही उपकरणों और तकनीकों के साथ, यह निश्चित रूप से संभव है! बस याद रखें: यह केवल कोड लिखने के बारे में नहीं है—यह पहचान से बचने, कानूनी सीमाओं का सम्मान करने और आवश्यकतानुसार विकल्प खोजने के बारे में है।

स्क्रैपलेस स्क्रैपिंग API आपके गूगल खोज परिणामों को स्क्रैप करने की दुनिया में सबसे अच्छे दोस्त हो सकता है!

साइन इन करें और अभी मुफ्त परीक्षण प्राप्त करें!

स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।

सबसे लोकप्रिय लेख

सूची