गूगल सर्च ऑपरेटर्स: एक व्यावहारिक डीप सर्पएपी गाइड
Advanced Data Extraction Specialist
TL;DR:
- गूगल सर्च ऑपरेटर एक प्रश्न को शब्द, साइट, फ़ाइल प्रकार, बहिष्कार, या तारीख द्वारा संकुचित करते हैं इससे पहले कि कोई परिणाम पार्सर तक पहुंचे।
- डीप सर्पएपी
qके अंदर ऑपरेटर अभिव्यक्ति भेजता है और भाषा, देश और गूगल डोमेन को अलग-अलग इनपुट फ़ील्ड में रखता है। - गूगल सर्च अभिनेता पार्स किए गए SERP अनुभागों को लौटाता है जैसे कि
organic_results, ताकि एक पाइपलाइन रैंक, शीर्षक, लिंक, और स्निपेट को बिना परिणाम-पृष्ठ HTML को पार्स किए स्टोर कर सके। site:ऑपरेटर खोज और डिबगिंग के लिए उपयोगी है, लेकिन गूगल कहता है कि इसके परिणाम व्यापक सूची रिपोर्ट नहीं हैं।
एक सर्च ऑपरेटर एक छोटे प्रश्न सिंटैक्स का टुकड़ा है जिसका प्रभाव बहुत बड़ा होता है। उद्धरण किसी वाक्यांश को बनाए रख सकते हैं। माइनस चिन्ह एक अवांछित अर्थ को हटा सकता है। site: खोज को एक डोमेन तक सीमित कर सकता है। filetype: शोध को रिपोर्टों की ओर खींच सकता है, मार्केटिंग पेजों के बजाय।
उपयोगी API पैटर्न यह है कि उस प्रश्न को ठीक से बनाए रखें, इसे एक सर्च अभिनेता को भेजें, और संरचित परिणाम रिकॉर्ड प्राप्त करें। इस गाइड में दिखाया गया है कि ऑपरेटर प्रश्नों को कैसे डिज़ाइन करें और उन्हें स्क्रैपलेस डीप सर्पएपी के माध्यम से कैसे चलाएँ बिना कोड को एक हाथ से बने गूगल URL पार्सर में बदलें।
गूगल सर्च ऑपरेटर क्या करते हैं
गूगल सर्च ऑपरेटर टोकन या विराम चिह्न होते हैं जो निर्दिष्ट करते हैं कि एक प्रश्न गूगल को कौन-से परिणाम वापस करने के लिए कहता है। गूगल के सर्च रिफाइनमेंट हेल्प में मुख्य उपयोगकर्ता-मुखी रूपों का दस्तावेजीकरण किया गया है: उद्धृत वाक्यांश, माइनस-शब्द बहिष्कार, site:, filetype:, और before: और after: तिथि सीमाएँ।
सिंटैक्स संक्षिप्त है, लेकिन स्पेसिंग महत्वपूर्ण है। site:example.com एक ऑपरेटर है। site: example.com वही अभिव्यक्ति नहीं है क्योंकि अभिप्राय ऑपरेटर से अलग है।
| लक्ष्य | प्रश्न पैटर्न | उदाहरण |
|---|---|---|
| सटीक वाक्यांश | "phrase" |
"agentic retrieval" |
| एक अर्थ को बाहर करना | -term |
jaguar speed -car |
| एक डोमेन या उपसर्ग को प्रतिबंधित करना | site:domain |
site:docs.python.org asyncio |
| फ़ाइल प्रकार को प्रतिबंधित करना | filetype:extension |
zero trust filetype:pdf |
| अद्यतन तिथि द्वारा बंधित | after:date before:date |
AI policy after:2025 before:2027 |
ऑपरेटरों को जोड़ा जा सकता है। शोध प्रश्न से शुरू करें, फिर शोर को हटाने के लिए आवश्यक न्यूनतम संख्या के प्रतिबंध जोड़ें।
वास्तविक शोध कार्यों के साथ मानचित्रित प्रश्न व्यंजनों
प्राथमिक दस्तावेज़ीकरण खोजें
एक डोमेन प्रतिबंध का उपयोग करें साथ ही एक सटीक अवधारणा:
site:developers.google.com/search "search operators"
यह तब अच्छी तरह से काम करता है जब संगठन के पास कई संपत्तियाँ होती हैं और एक सामान्य कीवर्ड प्रश्न स्रोत दस्तावेज़ीकरण से पहले टिप्पणी लौटाता है।
सार्वजनिक रिपोर्टों का पता लगाएँ
एक विश्वसनीय डोमेन, फ़ाइल प्रकार, और एक वाक्यांश को मिलाएँ:
site:nist.gov filetype:pdf "AI risk management"
ऑपरेटर खोज को संकुचित करता है। यह यह साबित नहीं करता है कि हर परिणाम वर्तमान, विशिष्ट प्रश्न के लिए प्राधिकृत, या पुन: उपयोग के लिए सुरक्षित है। ये जांचें शोध कार्यप्रवाह में बनी हुई हैं।
एक अस्पष्ट अर्थ को बाहर करें
अवांछित शब्द से ठीक पहले माइनस चिन्ह का उपयोग करें:
python concurrency -snake
बाहिष्कारों का सबसे अच्छा उपयोग पहले परिणाम सेट के निरीक्षण के बाद किया जाता है। बहुत जल्दी एक व्यापक शब्द को हटाने से उपयोगी पृष्ठों को छिपा सकता है जो इसे संयोग से उल्लेख करते हैं।
तिथि खिड़की के भीतर सामग्री की तुलना करें
प्रश्न में दोनों सीमाएँ रखें:
browser automation after:2025 before:2027
गूगल इनसे दस्तावेज़ अद्यतन फ़िल्टर के रूप में वर्णित करता है। तारीखों को खोज प्रतिबंधों के रूप में मानें, स्रोत पृष्ठ पर प्रकाशन या अद्यतन तारीख पढ़ने के विकल्प के रूप में नहीं।
site: की महत्वपूर्ण सीमा
site: ऑपरेटर स्रोत खोज, स्पैम जांच, और उन प्रश्नों के लिए मूल्यवान है जैसे "इस उपसर्ग के तहत कौन-से पृष्ठ इस शब्द के लिए आ सकते हैं?" यह अनुक्रमित यूआरएल का एक पूर्ण सूची नहीं है।
गूगल के निर्धारित site: दस्तावेज़ीकरण में कहा गया है कि परिणामों की सूची जरूरी नहीं कि व्यापक हो और निर्दिष्ट site:example.com प्रश्न सामान्य रूप से परिणाम नहीं रैंक करते। अनुक्रमण निदान के लिए, गूगल URL निरीक्षण को सर्च कंसोल में ऑपरेटर गणनाओं पर प्राथमिकता देने की सिफारिश करता है। व्यापक सर्च सेंट्रल ऑपरेटर संदर्भ भी अनुक्रमण और पुनर्प्राप्ति सीमाओं का उल्लेख करता है।
यह डेटा को लेबल करने के तरीके को बदलता है। "इस समय के लिए इस प्रश्न के लिए लौटाए गए परिणामों को स्टोर करें," "डोमेन पर सभी अनुक्रमित पृष्ठों" नहीं।
स्क्रैपलेस के साथ स्क्रैपिंग शुरू करें
अपने वेब स्क्रैपिंग और ऑटोमेशन कार्यप्रवाह को स्क्रैपलेस के साथ शक्ति दें!
आज ही साइन अप करें और $5 का फ्री क्रेडिट प्राप्त करें — कोई क्रेडिट कार्ड आवश्यक नहीं।स्क्रैपलेस डैशबोर्ड में अपने फ्री क्रेडिट का तुरंत दावा करें।
डीप सर्पएपी ऑपरेटर प्रश्नों को कैसे ले जाता है
Scrapeless scraper.google.search अभिनेता के माध्यम से Google खोज को उजागर करता है। अनुरोध एक एंडपॉइंट का उपयोग करता है और फ्री-फॉर्म प्रश्न को स्थानीय नियंत्रणों से अलग करता है:
| क्षेत्र | उद्देश्य |
|---|---|
actor |
scraper.google.search का चयन करता है |
input.q |
कुंजियों और खोज ऑपरेटरों को ठीक उसी तरह ले जाता है जैसे कि एक प्रश्न स्ट्रींग |
input.gl |
देश का संदर्भ चुनता है |
input.hl |
परिणाम भाषा चुनता है |
input.google_domain |
Google डोमेन का चयन करता है |
यह अलगाव परीक्षण के लिए उपयोगी है। वही ऑपरेटर प्रश्न एक अलग देश या भाषा के साथ चलाया जा सकता है बिना खोज अभिव्यक्ति को फिर से लिखे।
डीप सर्पएपी उत्पाद पृष्ठ प्रबंधित खोज सतह का वर्णन करता है, और डीप सर्पएपी त्वरित शुरूआत अभिनेता, एंडपॉइंट, प्रमाणीकरण हैडर और इनपुट आकार को दस्तावेज करता है।
प्रमाणीकरण अनुरोध भेजें
अनुरोध चलाने से पहले शेल में एक असली कुंजी निर्यात करें। नीचे वाला लाइव कॉल क्रेडेंशियल-गेटेड है; एंडपॉइंट, हैडर, JSON सिंटैक्स, और पार्सर को स्थानीय रूप से सत्यापित किया गया है, लेकिन बिना कुंजी के सफल सेवा प्रतिक्रिया का दावा नहीं किया जा रहा है।
bash
curl -sS -X POST https://api.scrapeless.com/api/v1/scraper/request \
-H 'Content-Type: application/json' \
-H "x-api-token: $SCRAPELESS_API_KEY" \
-d '{
"actor": "scraper.google.search",
"input": {
"q": "site:nist.gov filetype:pdf \"AI risk management\"",
"gl": "us",
"hl": "en",
"google_domain": "google.com"
}
}'
ऑपरेटर अभिव्यक्ति q में रहती है। site: या filetype: के बाद स्पेस न डालें। JSON और HTTP क्लाइंट ट्रांसपोर्ट एन्कोडिंग को संभालते हैं, इसलिए एप्लिकेशन को Google खोज URL को जोड़ने की जरूरत नहीं है।
संरचित प्रतिक्रिया पढ़ें
एक सामान्य वेब-खोज प्रतिक्रिया में पार्स की गई परिणाम अनुभागों को शीर्ष स्तर पर रखा जाता है। यह नमूना केवल कुंजी आकार दिखाता है; मूल्य वर्णनात्मक हैं।
json
{
"search_information": {},
"organic_results": [
{
"position": 1,
"title": "Illustrative report title",
"link": "https://example.org/report.pdf",
"snippet": "Illustrative result snippet"
}
],
"related_searches": [],
"pagination": {},
"metadata": {}
}
परिणाम मॉड्यूल प्रश्न के अनुसार भिन्न होते हैं। कोड को वह अनुभाग पढ़ना चाहिए जो उसने अनुरोध किया और अनुपस्थित वैकल्पिक अनुभागों को अनुपस्थित मानना चाहिए, न कि गलत JSON के रूप में।
यहां एक छोटा Python क्लाइंट है जो प्रश्न डिजाइन को प्रतिक्रिया हैंडलिंग से अलग रखता है:
python
import json
import os
import urllib.request
ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
def google_search(query: str, country: str = "us", language: str = "en") -> dict:
body = json.dumps({
"actor": "scraper.google.search",
"input": {
"q": query,
"gl": country,
"hl": language,
"google_domain": "google.com",
},
}).encode()
request = urllib.request.Request(
ENDPOINT,
data=body,
headers={
"Content-Type": "application/json",
"x-api-token": os.environ["SCRAPELESS_API_KEY"],
},
)
with urllib.request.urlopen(request) as response:
return json.loads(response.read())
serp = google_search('site:nist.gov filetype:pdf "AI risk management"')
for row in serp.get("organic_results") or []:
print(row.get("position"), row.get("title"), row.get("link"))
Python ब्लॉक स्थानीय सिंटैक्स संकलन पास करता है। नेटवर्क कॉल एक लेबल वाला पूर्वापेक्षा बना रहता है क्योंकि इस वातावरण में कोई Scrapeless API कुंजी नहीं है।
पुन: प्रयोज्य ऑपरेटर पाइपलाइन बनाएं
एक उत्पादन वर्कफ़्लो को लौटाए गए लिंक से अधिक संग्रहीत करना चाहिए। बाद में प्रत्येक पंक्ति को स्पष्ट करने के लिए पर्याप्त अनुरोध संदर्भ रखें:
- सटीक
qस्ट्रिंग, जिसमें ऑपरेटर शामिल हैं; - देश, भाषा, और Google डोमेन;
- कैप्चर टाइमस्टैम्प;
- लौटाई गई स्थिति, शीर्षक, लिंक, और स्निपेट;
- स्रोत मॉड्यूल, जैसे कि जैविक परिणाम;
- डेडुप्लीकेशन के लिए सामान्यीकृत लक्ष्य URL;
- वह शोध प्रश्न जिसने प्रश्न को प्रेरित किया।
यह एक SERP कैप्चर को एक ऑडिटेबल डेटासेट में बदल देता है। जब परिणाम भिन्न होते हैं, तो टीम प्रश्न और स्थानीयता की तुलना कर सकती है इससे पहले कि पार्सर को दोषी ठहराया जाए।
स्क्रैपर API अभिनेता गाइड बताता है कि खोज अभिनेता अन्य प्रबंधित अभिनेताओं के बगल में कैसे फिट होते हैं। कैप्चर फ़्रीक्वेंसी और भौगोलिक कवरेज चुनने से पहले कीमतें की समीक्षा करें।
सामान्य ऑपरेटर गलतियाँ
ऑपरेशन को अलग करना
site: example.com और filetype: pdf मान को अलग करते हैं। कॉलन के बगल में ऑपरेटर को रखें।
परिणाम की संख्या को इंडेक्स संख्या के रूप में मान लेना
एक site: परिणाम सेट एक खोज परिणाम नमूना है जो पुनः प्राप्ति बाधाओं के तहत है। यह एक इंडेक्स निर्यात नहीं है।
प्रश्न में स्थानीयता मिलाना
gl और hl उन नियंत्रणों को सीधे व्यक्त कर सकते हैं जब "अमेरिका से अंग्रेजी में परिणाम" जैसे गद्य न जोड़ें। q को जानकारी के इरादे पर केंद्रित रखें।
यह मान लेना कि हर प्रश्न वही मॉड्यूल लौटाता है
वेब, स्थानीय, छवि और अन्य खोज मोड के भिन्न प्रतिक्रिया अनुभाग होते हैं। चुने हुए मोड के दस्तावेजित आकार को पार्स करें और वैकल्पिक क्षेत्रों को नल करने योग्य रखें।
निष्कर्ष
खोज ऑपरेटर संग्रहण शुरू करने से पहले प्रश्न में सुधार करते हैं। डीप सर्पएपी उस अभिव्यक्ति को q में संरक्षित करता है, स्पष्ट स्थानीय क्षेत्र जोड़ता है, और पार्स किए गए SERP डेटा को लौटाता है जिसे क्रमबद्ध, संग्रहीत, और ऑडिट किया जा सकता है। विश्वसनीय पैटर्न प्रश्न टेम्पलेट, स्थानीय नियंत्रण, संरचित प्रतिक्रिया, और यह क्या परिणाम सेट प्रस्तुत करता है पर ईमानदार सीमाएँ हैं।
एक ऑपरेटर-प्रेरित खोज पाइपलाइन बनाने के लिए तैयार हैं?
एक मुक्त योजना का दावा करने और संरचित खोज डेटासेट बना रहे विकासकर्ताओं के साथ जुड़ने के लिए हमारी समुदाय में शामिल हों: Discord · Telegram।
app.scrapeless.com पर साइन अप करें और सटीक प्रश्नों को संरचित SERP रिकॉर्ड में बदलें।
अक्सर पूछे जाने वाले प्रश्न
प्रश्न: सबसे उपयोगी Google खोज ऑपरेटर क्या हैं?
उद्धरण, नकारात्मक अपवाद, site:, filetype:, before:, और after: कई शोध कार्यों को कवर करते हैं। प्रारंभिक परिणाम सेट में देखे गए शोर के आधार पर ऑपरेटर चुनें।
प्रश्न: क्या खोज ऑपरेटर को एक क्वेरी में जोड़ा जा सकता है?
हाँ। एक क्वेरी में उद्धृत वाक्यांश, डोमेन प्रतिबंध, फ़ाइल प्रकार, अपवाद, और दिनांक सीमा को जोड़ा जा सकता है। प्रत्येक अतिरिक्त बाधा संभावित परिणाम सेट को कम करती है, इसलिये केवल वही उपयोग करें जो कार्य को आवश्यक हो।
प्रश्न: क्या site: हर पृष्ठ को दिखाता है जिसे Google ने अनुक्रमित किया है?
नहीं। Google का कहना है कि site: परिणाम आवश्यक रूप से व्यापक नहीं होते हैं। अपने नियंत्रण वाले साइट के लिए अधिकारिक निदान के लिए Search Console उपकरणों का उपयोग करें।
प्रश्न: क्या Deep SerpApi उन्नत ऑपरेटर सिंटैक्स स्वीकार करता है?
हाँ। Google खोज अभिनेता के लिए q फील्ड में पूरा ऑपरेटर अभिव्यक्ति डालें। देश, भाषा, और Google डोमेन को उनके समर्पित फ़ील्ड में रखें।
प्रश्न: क्या Deep SerpApi को एक प्रॉक्सी कॉन्फ़िगरेशन की आवश्यकता है?
प्रबंधित अभिनेता के लिए कोई अलग प्रॉक्सी कॉन्फ़िगरेशन की आवश्यकता नहीं है। समर्थित अनुरोध फ़ील्ड जैसे gl के माध्यम से भौगोलिक संदर्भ सेट करें, और लागू नियमों के अनुसार लौटाए गए डेटा का उपयोग करें।
प्रश्न: जब Google परिणाम-पृष्ठ DOM बदलता है तो क्या होता है?
प्रबंधित अभिनेता पार्स किए गए फ़ील्ड लौटाता है न कि क्लाइंट को परिणाम-पृष्ठ DOM पार्सर बनाए रखने के लिए आवश्यक बनाता है। डाउनस्ट्रीम कोड को वैकल्पिक मॉड्यूल और फ़ील्ड को नल योग्य के रूप में रुख करना चाहिए क्योंकि परिणाम संरचना क्वेरी के अनुसार भिन्न होती है।
प्रश्न: API एक WAF या खोज एक्सेस घर्षण को कैसे संभालता है?
प्रबंधित सेवा अभिनेता के पीछे के नेटवर्क और निष्कर्षण परत को संभालती है। क्लाइंट दस्तावेजीकृत अनुरोध भेजता है और संरचित प्रतिक्रिया को संसाधित करता है; इसे सार्वजनिक या अधिकृत डेटा से परे पहुंच का दावा नहीं करना चाहिए।
प्रश्न: क्या यह कार्यप्रवाह बिना AI एजेंट के चल सकता है?
हाँ। शेल स्क्रिप्ट, पायथन नौकरी, शेड्यूलर, और डेटा पाइपलाइंस सीधे वही एंडपॉइंट कॉल कर सकती हैं। एक AI एजेंट खोज टूल के चारों ओर वैकल्पिक संचालन है।
प्रश्न: क्या Google खोज परिणाम एकत्र करना कानूनी है?
कानूनीयता क्षेत्राधिकार, उद्देश्य, अनुबंधों, और संबंधित डेटा पर निर्भर करती है। केवल सार्वजनिक या अधिकृत डेटा एकत्र करें, संग्रहीत जानकारी को कम करें, और संवेदनशील या उच्च जोखिम के उपयोग मामलों के लिए कानूनी सलाह प्राप्त करें।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।




