गूगल डॉर्किंग फॉर बिजनेस रिसर्च: ऑपरेटर्स, उदाहरण, और एपीआई ऑटोमेशन
Senior Cybersecurity Analyst
TL;DR:
- गूगल डोरकिंग का अर्थ है ऑपरेटर के साथ खोज शर्तों को संयोजित करना ताकि सार्वजनिक परिणामों को संकीर्ण किया जा सके। यह वाक्यांश प्रतिकूल प्रतीत होता है, लेकिन वही तकनीक विपणन अनुसंधान, अधिग्रहण, सामग्री ऑडिट और सार्वजनिक दस्तावेज़ खोज के लिए उपयोगी है।
- एक व्यावसायिक प्रश्न से शुरू करें, न कि ऑपरेटरों के बैग से।
site:,filetype:, उद्धृत वाक्यांश, और अपवाद तब सबसे उपयोगी होते हैं जब वे एक स्पष्ट समावेश या अपवाद नियम व्यक्त करते हैं। - परिणामों को लीड के रूप में मानें, न कि एक संपूर्ण डेटाबेस के रूप में। खोज ऑपरेटर इंडेक्सिंग और पुनरावृत्ति व्यवहार द्वारा सीमित होते हैं; यहां तक कि एक
site:क्वेरी भी एक व्यापक इंडेक्स रिपोर्ट नहीं है। - एक श्वेत-टोपी सीमा बनाए रखें। सार्वजनिक व्यावसायिक जानकारी खोजें। प्रमाणपत्र, निजी व्यक्तिगत डेटा, उजागर प्रशासक सतहों, या सामग्री का लक्ष्य न बनाएं जिसे आप पहुंच करने के लिए अधिकृत नहीं हैं।
- स्क्रैपलेस गूगल सर्च एपीआई दोहराए जाने वाले क्वेरी सेट को स्वचालित कर सकता है। क्वेरी, बाजार, समय, स्रोत यूआरएल, शीर्षक, स्निपेट, और स्थिति को संग्रहीत करें; फिर सामान्यीकृत यूआरएल द्वारा डुप्लिकेट को हटा दें।
गूगल डोरकिंग क्या है?
गूगल डोरकिंग सामान्य गूगल क्वेरी को खोज ऑपरेटरों के साथ मिलाने का अभ्यास है जो परिणाम सेट को संकीर्ण करते हैं। इसे उन्नत गूगल खोज भी कहा जाता है।
यह तकनीक स्वाभाविक रूप से एक सुरक्षा गतिविधि नहीं है। एक शोधकर्ता इसका उपयोग सार्वजनिक मूल्य निर्धारण पृष्ठों, अधिग्रहण दस्तावेजों, वार्षिक रिपोर्टों, भागीदार निर्देशिकाओं, नीति अपडेट, या किसी साइट के विशेष अनुभाग के तहत प्रकाशित सामग्री को खोजने के लिए कर सकता है।
ऑपरेटर केवल एक फ़िल्टर है। अधिकृतता और इरादा अभी भी महत्वपूर्ण हैं। एक खोज इंजन में प्रकट होने वाला परिणाम किसी निजी सिस्टम तक पहुंचने, एक नियंत्रण से बचने, प्रतिबंधित डेटा एकत्र करने, या कॉपीराइट सामग्री को फिर से प्रकाशित करने की अनुमति नहीं देता है।
व्यवसाय अनुसंधान के लिए ऑपरेटर चीटशीट
ऑपरेटर व्यवहार बदल सकता है, इसलिए इसे स्वचालित करने से पहले सही क्वेरी का परीक्षण करें। गूगल का सरकारी खोज सुधार गाइड उद्धरण चिह्न, अपवाद, और site: उपयोग को दस्तावेज करता है। गूगल सर्च सेंट्रल अलग से साइट मालिकों के लिए उपयोगी कई ऑपरेटरों का दस्तावेज करता है।
| ऑपरेटर या पैटर्न | उद्देश्य | व्यावसायिक उदाहरण |
|---|---|---|
"exact phrase" |
एक वाक्यांश की आवश्यकता | "request for proposal" logistics |
site:example.com |
परिणामों को एक डोमेन या उपसर्ग तक सीमित करें | site:vendor.example pricing |
filetype:pdf |
एक फ़ाइल प्रकार को प्राथमिकता दें | filetype:pdf "annual report" robotics |
-term |
एक शब्द को बाहर करें | "partner program" -jobs |
OR |
दो शर्तों में से किसी एक को स्वीकार करें | "case study" (retail OR ecommerce) |
site:example.com/path/ |
एक यूआरएल उपसर्ग तक सीमित करें | site:example.com/resources/ "market report" |
कम सावधानी से मात्रा का उपयोग करें और जीवित परिणामों का निरीक्षण करें। खोज इंजन मानव क्वेरी, न कि सख्त डेटाबेस क्वेरी भाषा की व्याख्या करते हैं।
गूगल सर्च सेंट्रल ऑपरेटर संदर्भ ऑपरेटरों में site: और filetype: को डिबगिंग के लिए उपयोग किए जाने वाले ऑपरेटरों में दस्तावेज करता है। इसका मार्गदर्शन महत्वपूर्ण है: ऑपरेटर इंडेक्सिंग और पुनरावृत्ति सीमाओं के अधीन हैं, इसलिए ये खोज कंसोल या पहले-डेय साइट सूची के लिए विकल्प नहीं हैं।
श्वेत-टोपी सीमा
यह गाइड सार्वजनिक व्यावसायिक अनुसंधान के लिए है।
अच्छे लक्ष्यों में शामिल हैं:
- सार्वजनिक उत्पाद, मूल्य निर्धारण, भागीदार, और दस्तावेज़ पृष्ठ;
- सार्वजनिक आरएफपी, नीति दस्तावेज, रिपोर्ट, और फाइलिंग;
- सार्वजनिक कार्यक्रम, स्थान, और निर्देशिका पृष्ठ;
- एक कंपनी के अपने सार्वजनिक पृष्ठ सामग्री और इंडेक्सिंग ऑडिट के लिए;
- प्रतिस्पर्धी या बाजार विश्लेषण के लिए आवश्यक सार्वजनिक उल्लेख।
कृपया पासवर्ड, एपीआई कुंजियाँ, व्यक्तिगत रिकॉर्ड, गोपनीय निर्यात, उजागर बैकअप, निजी कैमरे, आक्रमण के लिए लॉगिन पैनल, या अन्य संवेदनशील सामग्री को ढूँढने के लिए क्वेरी डिज़ाइन न करें। यदि एक सार्वजनिक परिणाम एक रहस्य या निजी रिकॉर्ड को उजागर करता है, तो संग्रह को रोकें और प्रभावित संगठन की जिम्मेदार प्रकटीकरण प्रक्रिया का पालन करें।
जहां भी लागू हो, रोबोट निर्देशों, साइट शर्तों, कॉपीराइट, गोपनीयता कानून, और दर सीमाओं का भी सम्मान करें। खोज की खोज डाउनस्ट्रीम बाध्यताओं को नहीं मिटाती है।
व्यावसायिक अनुसंधान के उदाहरण
सार्वजनिक मूल्य निर्धारण और पैकेजिंग पृष्ठ खोजें
जब आप पहले से ही विक्रेता को जानते हैं तो डोमेन प्रतिबंध का उपयोग करें:
site:vendor.example (pricing OR plans OR enterprise)
यह क्वेरी वर्तमान मूल्य निर्धारण, तुलना, और उद्यम पृष्ठों को प्रकट कर सकती है। यह साबित नहीं करती कि हर योजना सूचीबद्ध है या कि एक कैश स्निपेट जीवित पृष्ठ को दर्शाता है। परिणाम खोलें और अवलोकन समय को रिकॉर्ड करें।
सार्वजनिक आरएफपी और अधिग्रहण दस्तावेज़ खोजें
दस्तावेज़ प्रकार को एक सटीक वाक्यांश और उद्योग शब्द के साथ मिलाएँ:
filetype:pdf "request for proposal" "data platform"
सेट को संकीर्ण करने के लिए एक क्षेत्र, संगठन प्रकार, या तिथि वाक्यांश जोड़ें। दस्तावेज़ संस्करण और समय सीमा की पुष्टि करें स्रोत डोमेन पर एक लीड को पाइपलाइन में जोड़ने से पहले।
भागीदारों और एकीकरण पारिस्थितिक तंत्र का मानचित्रण करें
एक विक्रेता के सार्वजनिक भागीदार या एकीकरण क्षेत्रों की खोज करें:
site:vendor.example (partners OR integrations) -jobs
अपवाद एक सामान्य अप्रासंगिक भर्ती पृष्ठों के स्रोत को हटा देता है। संग्रह के बाद भागीदार नामों को सामान्यीकृत करें; एक लोगो ग्रिड और एक बाजार सूची एक ही कंपनी का उल्लेख कर सकते हैं।
सार्वजनिक सामग्री अनुभाग का ऑडिट
क्वेरी को एक पथ पर सीमित करें:
site:example.com/resources/ "web scraping"
यह किसी विषय के लिए गूगल द्वारा सेवा में लाए जाने वाले अनुभाग URLs का पता लगाने के लिए उपयोगी है। यह एक पूर्ण गणना नहीं है। गूगल की site: ऑपरेटर दस्तावेज़ीकरण स्पष्ट रूप से चेतावनी देता है कि परिणामों में अनुक्रमांकित URLs शामिल नहीं हो सकते और एक सामान्य site: क्वेरी की तरह रैंक नहीं किया जाता है।
सार्वजनिक नीति या अनुपालन अपडेट की निगरानी करें
एक प्राधिकृत डोमेन पर सटीक नीति भाषा के लिए खोजें:
site:regulator.example filetype:pdf "effective date" "data processing"
स्रोत URL और प्रकाशन या संशोधन तिथि को बनाए रखें। एक खोज-परिणाम स्निपेट कानूनी पाठ नहीं है।
योजनाबद्ध तरीके से एक क्वेरी तैयार करें
एक शोध तालिका से प्रारंभ करें।
| घटक | प्रश्न | उदाहरण |
|---|---|---|
| विषय | कौन सी इकाई या बाजार क्षेत्र में है? | गोदाम रोबोटिक्स |
| साक्ष्य | कौन सा सार्वजनिक कलाकृतियों प्रश्न का उत्तर देगा? | वार्षिक रिपोर्ट |
| स्रोत सीमा | कौन से डोमेन्स या अनुभाग प्राधिकृत हैं? | रेगुलेटर या विक्रेता डोमेन |
| प्रारूप | क्या दस्तावेज़ प्रकार उपयोगी है? | |
| अपवाद | क्या पूर्वानुमानित शोर उत्पन्न करता है? | नौकरी, करियर |
| बाजार | कौन सा देश/भाषा संदर्भ महत्वपूर्ण है? | अमेरिका, अंग्रेजी |
फिर सबसे संकीर्ण क्वेरी का निर्माण करें जो अभी भी खोज के लिए स्थान छोड़ती है। एक साथ हर ऑपरेटर जोड़ने से उपयोगी परिणाम छिप सकते हैं और डिबगिंग को लगभग असंभव बना सकते हैं।
एक क्वेरी रजिस्ट्री बनाएँ जिसमें एक मानव-पढ़ने योग्य उद्देश्य, मालिक, समीक्षा तिथि, और अनुमत लक्ष्य वर्ग हो। वह रजिस्ट्री विशेष रूप से महत्वपूर्ण हो जाती है जब क्वेरियों को API के माध्यम से शेड्यूल किया जाता है।
Google Dorking को Google सर्च API के साथ स्वचालित करें
Scrapeless Google Search API एक क्वेरी को संरचित खोज रिकॉर्ड में बदलता है। API तब उपयोगी होता है जब एक शोध टीम को दोहराने योग्य सेटिंग्स, पृष्ठीकरण, डेडूप्लिकेशन, और निर्यात की आवश्यकता होती है न कि मैन्युअल कॉपी और पेस्ट की।
निम्नलिखित स्क्रिप्ट एक अनुमत सेट के सार्वजनिक-व्यापार क्वेरियों को चलाती है, सीमित परिणाम ऑफसेट का पालन करती है, URLs को सामान्य बनाती है, और एक CSV फ़ाइल लिखती है।
प्राथमिक आवश्यकता: लाइव अनुरोधों के लिए
SCRAPELESS_API_KEYमें एक Scrapeless API कुंजी की आवश्यकता है। इसे अनुमत सूची में जोड़ने से पहले प्रत्येक क्वेरी की दायरा और प्राधिकरण की समीक्षा करें।
python
import csv
import os
from datetime import datetime, timezone
from urllib.parse import urlsplit, urlunsplit
import requests
API_URL = "https://api.scrapeless.com/api/v1/scraper/request"
QUERIES = [
'filetype:pdf "request for proposal" "data platform"',
'site:example.com/resources/ "market report"',
]
def canonical_url(raw: str) -> str:
parts = urlsplit(raw)
host = (parts.hostname or "").lower()
if host.startswith("www."):
host = host[4:]
netloc = host
if parts.port:
netloc = f"{host}:{parts.port}"
path = parts.path.rstrip("/") or "/"
return urlunsplit((parts.scheme.lower(), netloc, path, parts.query, ""))
def organic_results(payload: dict) -> list[dict]:
if isinstance(payload.get("organic_results"), list):
return payload["organic_results"]
data = payload.get("data", {})
if isinstance(data, dict) and isinstance(data.get("organic_results"), list):
return data["organic_results"]
return []
def search(query: str, start: int) -> dict:
response = requests.post(
API_URL,
headers={
"x-api-token": os.environ["SCRAPELESS_API_KEY"],
"Content-Type": "application/json",
},
json={
"actor": "scraper.google.search",
"input": {
"q": query,
"gl": "us",
"hl": "en",
"google_domain": "google.com",
"start": start,
},
},
timeout=60,
)
response.raise_for_status()
return response.json()
def collect(queries: list[str], offsets=(0, 10)) -> list[dict]:
observed_at = datetime.now(timezone.utc).isoformat()
rows_by_url = {}
for query in queries:
for start in offsets:
payload = search(query, start)
for fallback, item in enumerate(organic_results(payload), start=start + 1):
raw_url = item.get("link") or item.get("url") or ""
if not raw_url.startswith(("http://", "https://")):
continue
url = canonical_url(raw_url)
candidate = {
"observed_at": observed_at,
"query": query,
"position": item.get("position", fallback),
"title": item.get("title", ""),
"snippet": item.get("snippet", ""),
"url": url,
}
previous = rows_by_url.get(url)
if previous is None or candidate["position"] < previous["position"]:
rows_by_url[url] = candidate
return sorted(rows_by_url.values(), key=lambda row: (row["query"], row["position"]))
def write_csv(rows: list[dict], path="business_research.csv") -> None:
fields = ["observed_at", "query", "position", "title", "snippet", "url"]
with open(path, "w", newline="", encoding="utf-8") as handle:
writer = csv.DictWriter(handle, fieldnames=fields)
writer.writeheader()
writer.writerows(rows)
if __name__ == "__main__":
write_csv(collect(QUERIES))
स्क्रिप्ट डेडूप्लिकेशन कुंजी से अंश को बाहर रखती है लेकिन क्वेरी स्ट्रिंग को बनाए रखती है क्योंकि क्वेरी पैरामीटर वास्तव में अलग-अलग सार्वजनिक संसाधनों की पहचान कर सकते हैं। अनुसंधान लक्ष्य के आधार पर, आप ज्ञात ट्रैकिंग पैरामीटर जैसे UTM टैग भी हटा सकते हैं।
Google Search API दस्तावेज़ीकरण वर्तमान अनुरोध फ़ील्ड के लिए सत्य का स्रोत है। एक अनुरोध का परीक्षण करें और उसके वास्तविक प्रतिक्रिया की जांच करें इससे पहले कि पार्सर को अंतिम रूप दिया जाए।
पृष्ठीकरण, डेडूप्लिकेशन, और समीक्षा
पृष्ठीकरण नमूने का विस्तार करता है; यह एक exhaustive वेब डेटाबेस नहीं बनाता। प्रत्येक क्वेरी के लिए ऑफसेट को सीमित करें और उस गहराई को नौकरी की कॉन्फ़िगरेशन में रिकॉर्ड करें।
कई स्तरों पर डेडूप्लिकेट करें:
- सटीक कैनोनिकल URL;
- ज्ञात ट्रैकिंग-पैरामीटर रूपांतर;
- डाउनलोड के बाद दस्तावेज़ चेकसम, जब संग्रहित की अनुमति हो;
- विश्लेषण के दौरान सामान्यीकृत संगठन और शीर्षक।
सिर्फ शीर्षक के आधार पर विलय न करें। विभिन्न संगठन अक्सर "वार्षिक रिपोर्ट" या "प्रस्ताव के लिए अनुरोध" नामक दस्तावेज़ प्रकाशित करते हैं।
एक मैनुअल समीक्षा कतार जोड़ें इससे पहले कि एक परिणाम बिक्री लीड, अनुपालन आइटम, या प्रतिस्पर्धात्मक दावा बन जाए। खोज स्निपेट संदर्भ को कम कर सकते हैं, तिथियाँ उदाहरणों का संदर्भ ले सकती हैं, और PDFs को प्रतिस्थापित किया जा सकता है।
Scrapeless के साथ स्क्रैपिंग शुरू करें
Scrapeless के साथ अपनी वेब स्क्रैपिंग और स्वचालन कार्यप्रवाह को पावरअप करें!
आज ही साइन अप करें और $5 का मुफ्त क्रेडिट पाएं — कोई क्रेडिट कार्ड आवश्यक नहीं।अपना मुफ्त क्रेडिट अभी Scrapeless डैशबोर्ड में दावा करें।
परिचालन सीमाएँ
खोज ऑपरेटर खोज के सहायक हैं, कोई गारंटी नहीं।
- बाहरी क्वेरी के दृष्टिकोण से अनुक्रमण कवरेज अधूरा है।
- ऑपरेटर बदल सकते हैं या परिणाम प्रकारों में अलग तरह से व्यवहार कर सकते हैं।
- एक स्निपेट वर्तमान पृष्ठ से मेल नहीं खा सकता।
- स्थान, भाषा, उपकरण, और समय परिणामों को प्रभावित करते हैं।
- बार-बार समान क्वेरियां ओवरलैपिंग URLs उत्पन्न कर सकती हैं।
- एक सार्वजनिक परिणाम में अभी भी सामग्री हो सकती है जो एकत्र नहीं की जानी चाहिए या पुनर्वितरित नहीं की जानी चाहिए।
क्वेरी सेटिंग्स को लॉग करें और विफलताओं की समीक्षा को खाली परिणाम सेट से अलग करें। एक अनुरोध त्रुटि अनजान होती है; एक खाली सफल प्रतिक्रिया का मतलब है कि उस नमूना क्वेरी के लिए कोई परिणाम नहीं लौटाए गए।
निष्कर्ष
Google डोर्किंग तब सबसे उपयोगी होती है जब यह उबाऊ हो: एक दस्तावेजित शोध प्रश्न, परीक्षण किए गए ऑपरेटरों का एक छोटा सेट, एक सार्वजनिक डेटा सीमा, और एक समीक्षा योग्य निर्यात। स्क्रेपलेस गूगल सर्च एपीआई दोहराने की क्षमता और संरचित आउटपुट जोड़ता है बिना शोधकर्ता की जिम्मेदारी को बदलते हुए स्रोतों की पुष्टि करने और पहुंच सीमाओं का सम्मान करने के लिए।
गूगल सर्च एपीआई से शुरू करें, प्राइसिंग पेज पर वर्तमान खाता दरें रखें, और इसे शेड्यूल करने से पहले प्रत्येक ऑपरेटर को लाइव टेस्ट करें।
खोज डेटा सेवाओं की समकक्ष तुलना के लिए, गूगल सर्च एपीआई गाइड पढ़ें।
सार्वजनिक खोज को एक समीक्षा योग्य डेटा सेट में बदलें
नैतिक शोध और डेटा-पाइपलाइन पैटर्न के लिए स्क्रेपलेस समुदाय में शामिल हों: डिस्कॉर्ड · टेलेग्राम。
app.scrapeless.com पर एक मुफ्त खाता बनाएं, एक स्वीकृत सार्वजनिक क्वेरी चलाएं, और दायरा बढ़ाने से पहले निर्यातित URLs की समीक्षा करें।
सामान्य प्रश्न
प्रश्न: क्या गूगल डोर्किंग अवैध है?
खोज ऑपरेटर सामान्य खोज विशेषताएँ हैं। वैधता और नीति अनुपालन इस पर निर्भर करते हैं कि आप किसका लक्ष्य बनाते हैं, आप इसे कैसे एक्सेस करते हैं, आप क्या एकत्र करते हैं, और आप इसे कैसे उपयोग करते हैं। यह गाइड सार्वजनिक व्यावसायिक जानकारी पर प्राधिकृत शोध तक सीमित है।
प्रश्न: व्यावसायिक शोध के लिए कौन से गूगल ऑपरेटर उपयोगी हैं?
उद्धृत वाक्यांश, site:, filetype:, माइनस साइन के साथ अपवाद, और सावधानीपूर्वक परीक्षण किए गए OR क्वेरी कई मूल्य निर्धारण, खरीद, रिपोर्ट, साथी, और सामग्री ऑडिट वर्कफ़्लोज़ को कवर करते हैं।
प्रश्न: क्या site:example.com हर अनुक्रमित पृष्ठ को दिखाता है?
नहीं। गूगल के अनुसार site: परिणाम आवश्यक रूप से पूर्ण नहीं होते। जब आपको उस साइट के लिए प्राधिकृत अनुक्रमण निदान की आवश्यकता हो, जिसे आप नियंत्रित करते हैं, तो सर्च कंसोल या पहले-पार्टी साइट इन्वेंट्री का उपयोग करें।
प्रश्न: क्या मैं गूगल डोर्क क्वेरी को ऑटोमेट कर सकता हूं?
हाँ। गूगल सर्च एपीआई स्वीकृत क्वेरियों को लगातार मार्केट सेटिंग्स के साथ चलाने और संरचित रिकॉर्ड लौटाने में सक्षम है। पृष्ठन को सीमित करें, URLs को डिडुप्लिकेट करें, टाइमस्टैम्प को बनाए रखें, और उन पर कार्य करने से पहले परिणाम की समीक्षा करें।
प्रश्न: ऑटोमेटेड डोर्क लिस्ट में कभी क्या शामिल नहीं होना चाहिए?
क्रेडेंशियल्स, रहस्य, निजी व्यक्तिगत डेटा, उजागर प्रशासनिक सिस्टम, गोपनीय दस्तावेज़, या किसी भी स्रोत को लक्षित न करें जिसे आप एक्सेस करने के लिए अधिकृत नहीं हैं। यदि संवेदनशील सामग्री अप्रत्याशित रूप से प्रकट होती है, तो रुकें और जिम्मेदार प्रकटीकरण का उपयोग करें।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



