गूगल सर्च परिणामों को पायथन के साथ कैसे स्क्रैप करें (2026)
Specialist in Anti-Bot Strategies
Google खोज परिणाम पृष्ठ (SERP) क्या है?
जब भी गूगल खोज परिणामों को वेब स्क्रैपिंग पर चर्चा की जाती है, आप "SERP" संक्षेप का सामना करेंगे। SERP का अर्थ है सर्च इंजन रिजल्ट पेज। यह वह पृष्ठ है जो आपको खोज बार में क्वेरी डालने के बाद मिलता है।
अतीत में, गूगल आपकी क्वेरी के लिए लिंक की एक सूची प्रदान करता था। आज, यह पूरी तरह से अलग है - SERPs विभिन्न प्रकार की सुविधाओं और तत्वों को शामिल करते हैं जो आपके खोज अनुभव को तेज और सुविधाजनक बनाते हैं।
आम तौर पर, पृष्ठ में शामिल हैं:
- ऑर्गेनिक सर्च परिणाम
- भुगतान किए गए सर्च परिणाम
- विशेष स्निपेट्स
- ज्ञान ग्राफ
- अन्य तत्व: जैसे कि मानचित्र, चित्र, या समाचार कहानियाँ जो क्वेरी के आधार पर दिखाई देती हैं।
क्या Google खोज परिणामों को स्क्रैप करना कानूनी है?
Google खोज परिणामों को स्क्रैप करने से पहले, कानूनी निहितार्थों को समझना आवश्यक है। गूगल की सेवा की शर्तें उनके खोज परिणामों को स्क्रैप करने से मना करती हैं, जैसा कि उनकी नीतियों में कहा गया है:
"आप सेवाओं तक पहुँचने के लिए किसी भी आकार की साधन का उपयोग करके स्क्रैप, क्रॉल, या कोई स्वचालित साधन का उपयोग नहीं करेंगे।"
इन शर्तों का उल्लंघन IP बैन या यहां तक कि Google से कानूनी कार्रवाई का कारण बन सकता है। हालांकि, स्क्रैपिंग की वैधता क्षेत्राधिकार, आपके द्वारा स्क्रैप किया जा रहा डेटा, और आप इसे किस प्रकार उपयोग कर रहे हैं, पर निर्भर करती है।
गूगल को स्क्रैप करने के विकल्प:
- Google कस्टम सर्च API: Google एक आधिकारिक API प्रदान करता है जिससे खोज परिणामों को पुनर्प्राप्त किया जा सकता है, जो डेटा तक पहुँचने का एक कानूनी और संरचित तरीका प्रदान करता है बिना उनकी नीतियों का उल्लंघन किए।
- अन्य खोज API: यदि आप Google का उपयोग करने के लिए प्रतिबद्ध नहीं हैं, तो अन्य खोज इंजन और सेवाएँ हैं जो खोज परिणामों तक पहुँचने के लिए API प्रदान करती हैं, जैसे कि बिंग, और Scrapeless।
Google खोज स्क्रैपिंग क्यों कठिन है?
Google SERPs को स्क्रैप करना कई चुनौतियों का सामना करता है, यही कारण है कि इसे कठिन माना जाता है। इनमें शामिल हैं:
- बॉट पहचान: Google बॉट्स का पता लगाने और ब्लॉक करने के लिए कई तकनीकों का उपयोग करता है, जिसमें शामिल हैं:
- CAPTCHA
- IP ब्लॉकिंग
- दर सीमा निर्धारित करना
- गतिशील सामग्री: Google खोज परिणाम अक्सर JavaScript का उपयोग करके गतिशील रूप से उत्पन्न होते हैं, जिससे स्क्रैपिंग करना जटिल हो सकता है। सामग्री प्रारंभिक पृष्ठ लोड के बाद लोड हो सकती है, जिससे पृष्ठ को पूरी तरह से प्रदर्शित करने के लिए Selenium जैसे उपकरणों की आवश्यकता हो सकती है।
- HTML संरचना में बदलाव: Google अक्सर अपने खोज परिणामों की लेआउट और संरचना बदलता है, जिसका अर्थ है कि स्क्रैपर्स को कोड को बंद होने से बचाने के लिए तेजी से अनुकूलित करने की आवश्यकता होती है।
- जटिल डेटा: SERP में विभिन्न जटिल तत्व जैसे विज्ञापन, चित्र, वीडियो, और समृद्ध स्निपेट शामिल हैं, जिससे लगातार अर्थपूर्ण डेटा निकालना चुनौतीपूर्ण हो जाता है।
इन चुनौतियों के बावजूद, सही तकनीकों और उपकरणों के साथ Google खोज परिणामों को स्क्रैप करना अभी भी संभव है।
आइए Python के साथ Google खोज परिणामों को स्क्रैप करने की प्रक्रिया को निम्नलिखित चरणों में तोड़ते हैं:
Python के साथ Google खोज परिणामों को स्क्रैप कैसे करें
चरण 1: HTTP अनुरोध भेजें
स्क्रैपिंग शुरू करने से पहले, आपको Google के खोज पृष्ठ पर एक अनुरोध भेजने की आवश्यकता होगी। चूंकि Google अधिकांश अनुरोधों को बॉट्स से ब्लॉक करता है, इसलिए एक उचित User-Agent हेडर सेट करके वास्तविक उपयोगकर्ता का अनुकरण करना आवश्यक है।
Python
import requests
from fake_useragent import UserAgent
# एक यादृच्छिक उपयोगकर्ता-एजेंट उत्पन्न करें
ua = UserAgent()
headers = {'User-Agent': ua.random}
# Google खोज क्वेरी
query = "Python के साथ Google खोज परिणामों को कैसे स्क्रैप करें"
url = f"https://www.google.com/search?q={query}"
# GET अनुरोध भेजें
response = requests.get(url, headers=headers)
# जांचें कि क्या अनुरोध सफल था
if response.status_code == 200:
print(response.text)
else:
print("पृष्ठ प्राप्त करने में विफल")
चरण 2: ऑर्गेनिक सर्च परिणामों का पार्स करें
एक बार जब आपके पास Google SERP की HTML सामग्री होती है, तो आप आवश्यक डेटा निकालने के लिए BeautifulSoup का उपयोग कर सकते हैं।
Python
from bs4 import BeautifulSoup
# पृष्ठ सामग्री का पार्स करें
soup = BeautifulSoup(response.text, 'html.parser')
# सभी खोज परिणाम कंटेनरों को खोजें
search_results = soup.find_all('div', class_='BVG0Nb')
for result in search_results:
title = result.text
link = result.find('a')['href']
print(f"शीर्षक: {title}")
print(f"लिंक: {link}\n")
चरण 3: Selenium के साथ JavaScript परिणामों को रेंडर करें
Selenium उन पृष्ठों को संभालने के लिए एक उत्कृष्ट उपकरण है जो सामग्री को रेंडर करने के लिए JavaScript का उपयोग करते हैं। यह एक ब्राउज़र को स्वचालित करता है और उपयोगकर्ता इंटरएक्शन का अनुकरण करता है, जिससे गतिशील रूप से उत्पन्न सामग्री को स्क्रैप करने के लिए यह आदर्श हो जाता है।
Python
from selenium import webdriver
from selenium.webdriver.common.by import By
from webdriver_manager.chrome import ChromeDriverManager
# Selenium WebDriver सेट करें
driver = webdriver.Chrome(ChromeDriverManager().install())
# Google खोलें और खोज करें
driver.get("https://www.google.com/")
search_box = driver.find_element(By.NAME, 'q')
search_box.send_keys("Python के साथ Google खोज परिणामों को कैसे स्क्रैप करें")
search_box.submit()
# परिणामों के लोड होने की प्रतीक्षा करें और लिंक निकालें
driver.implicitly_wait(5)
# खोज परिणाम प्राप्त करें
search_results = driver.find_elements(By.CLASS_NAME, 'BVG0Nb')
for result in search_results:
title = result.text
Here's the translation of the given text into Hindi:
python
link = result.find_element(By.TAG_NAME, 'a').get_attribute('href')
print(f"शीर्षक: {title}")
print(f"लिंक: {link}\n")
driver.quit()
चरण 4: ब्लॉकिंग और दर सीमा को कम करें
गूगल द्वारा पहचान लिए जाने और ब्लॉक होने के संभावनाओं को कम करने के लिए आपको चाहिए:
- यूजर एजेन्स बदलें: विभिन्न ब्राउज़रों से अनुरोधों का अनुकरण करने के लिए अलग-अलग यूजर एजेन्स का उपयोग करें।
- विलंब जोड़ें: मानव जैसे ब्राउज़िंग व्यवहार का अनुकरण करने के लिए अनुरोधों के बीच यादृच्छिक विलंब प्रस्तुत करें।
- प्रॉक्सी का उपयोग करें: अपने अनुरोधों को वितरित करने और पहचान से बचने के लिए IP पतों को घुमाएँ।
- Robots.txt का सम्मान करें: हमेशा गूगल के robots.txt फ़ाइल की जाँच करें और नैतिक स्क्रैपिंग प्रथाओं का पालन करें।
स्क्रैपलेस डीप सर्पएपीआई के साथ गूगल खोज परिणामों को स्क्रैप करें
गूगल को सीधे स्क्रैप करना संभव है, लेकिन यह थकाऊ और त्रुटिपूर्ण हो सकता है, और यह अक्सर ब्लॉक होने का परिणाम देता है। यहीं स्क्रैपलेस आता है। शक्तिशाली CAPTCHA सॉल्वर, IP रोटेशन, बुद्धिमान प्रॉक्सी, और वेब अनलॉकर के साथ, स्क्रैपलेस एक शक्तिशाली API है जो विशेष रूप से उपयोगकर्ताओं को बिना ब्लॉक हुए खोज परिणामों को स्क्रैप करने में मदद करने के लिए बनाया गया है।
प्रबंधित SERP API का उपयोग क्यों करें?
- कानूनी: स्क्रैपलेस खोज परिणामों को एक्सेस करने का एक कानूनी और अनुपालन तरीका प्रदान करता है।
- विश्वसनीयता: API पहचान से बचने के लिए उन्नत तकनीकों का उपयोग करता है, जिससे डेटा संग्रह में बाधा नहीं आती।
- उपयोग में आसानी: स्क्रैपलेस एक सरल API प्रदान करता है जो Python के साथ आसानी से एकीकृत होता है, जो डेवलपर्स के लिए खोज परिणाम डेटा तक त्वरित पहुँच प्राप्त करना आदर्श बनाता है।
- अनुकूलन योग्य: आप अपने आवश्यकताओं के अनुसार परिणामों को कस्टमाइज कर सकते हैं, जैसे सामग्री के प्रकार (जैसे, ऑर्गेनिक लिस्टिंग, विज्ञापन आदि) को निर्धारित करना।
गूगल खोज अनुरोध कैसे चलाएँ
डेटा को लक्षित और विशिष्ट बनाने के लिए, हम इस लेख में एक डेमो के रूप में गूगल ट्रेंड्स को क्रॉल करते हैं।
वेब ब्लॉकिंग और गूगल खोज स्क्रैपिंग से निराश?
हमारे समुदाय में शामिल हों और मुफ्त परीक्षण के साथ प्रभावी समाधान प्राप्त करें!
चरण 1. स्क्रैपलेस डैशबोर्ड में लॉग इन करें और "गूगल सर्च API" पर जाएं।

चरण 2. बाईं ओर आवश्यक कीवर्ड, क्षेत्र, भाषा, प्रॉक्सी और अन्य जानकारी को कॉन्फ़िगर करें। सुनिश्चित करें कि सब कुछ ठीक है, फिर "स्क्रैपिंग शुरू करें" पर क्लिक करें।
q: पैरामीटर वह क्वेरी परिभाषित करता है जिसे आप खोजना चाहते हैं।gl: पैरामीटर वह देश परिभाषित करता है जिसका उपयोग गूगल खोज के लिए किया जाएगा।hl: पैरामीटर वह भाषा परिभाषित करता है जिसका उपयोग गूगल खोज के लिए किया जाएगा।

चरण 3. क्रॉलिंग परिणाम प्राप्त करें और उन्हें निर्यात करें।

क्या आपको अपने प्रोजेक्ट में एकीकृत करने के लिए केवल नमूना कोड चाहिए? हम आपकी मदद करेंगे! या आप किसी भी भाषा के लिए हमारी API दस्तावेज़ीकरण पर जा सकते हैं जिसकी आवश्यकता हो।
- Python:
Python
import http.client
import json
conn = http.client.HTTPSConnection("api.scrapeless.com")
payload = json.dumps({
"actor": "scraper.google.search",
"input": {
"q": "coffee",
"hl": "en",
"gl": "us"
}
})
headers = {
'Content-Type': 'application/json'
}
conn.request("POST", "/api/v1/scraper/request", payload, headers)
res = conn.getresponse()
data = res.read()
print(data.decode("utf-8"))
- Golang
Go
package main
import (
"fmt"
"strings"
"net/http"
"io/ioutil"
)
func main() {
url := "https://api.scrapeless.com/api/v1/scraper/request"
method := "POST"
payload := strings.NewReader(`{
"actor": "scraper.google.search",
"input": {
"q": "coffee",
"hl": "en",
"gl": "us"
}
}`)
client := &http.Client {
}
req, err := http.NewRequest(method, url, payload)
if err != nil {
fmt.Println(err)
return
}
req.Header.Add("Content-Type", "application/json")
res, err := client.Do(req)
if err != nil {
fmt.Println(err)
return
}
defer res.Body.Close()
body, err := ioutil.ReadAll(res.Body)
if err != nil {
fmt.Println(err)
return
}
fmt.Println(string(body))
}
निष्कर्ष: एक Python स्क्रैपर या SERP API चुनें
गूगल खोज परिणामों को स्क्रैप करना जटिल हो सकता है, लेकिन सही उपकरणों और तकनीकों के साथ, यह निश्चित रूप से संभव है! बस याद रखें: यह केवल कोड लिखने के बारे में नहीं है—यह पहचान से बचने, कानूनी सीमाओं का सम्मान करने और आवश्यकतानुसार विकल्प खोजने के बारे में है।
स्क्रैपलेस स्क्रैपिंग API आपके गूगल खोज परिणामों को स्क्रैप करने की दुनिया में सबसे अच्छे दोस्त हो सकता है!
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



