Quay lại blog

Google Dorking cho Nghiên cứu Doanh nghiệp: Các toán tử, Ví dụ, và Tự động hóa API

Olivia Patel
Olivia Patel

Senior Cybersecurity Analyst

16-Sep-2026

TL;DR:

  • Google dorking có nghĩa là soạn thảo các thuật ngữ tìm kiếm với các toán tử để thu hẹp kết quả công khai. Cụm từ nghe có vẻ đối kháng, nhưng kỹ thuật tương tự cũng hữu ích cho nghiên cứu thị trường, đấu thầu, kiểm toán nội dung và khám phá tài liệu công khai.
  • Bắt đầu với một câu hỏi kinh doanh, không phải là một đống toán tử. site:, filetype:, các cụm từ được trích dẫn, và các loại trừ thường hữu ích nhất khi chúng thể hiện một quy tắc bao gồm hoặc loại trừ rõ ràng.
  • Coi kết quả như những đầu mối, không phải là một cơ sở dữ liệu hoàn chỉnh. Các toán tử tìm kiếm bị hạn chế bởi hành vi chỉ mục và thu hồi; ngay cả một truy vấn site: cũng không phải là báo cáo chỉ mục đầy đủ.
  • Giữ ranh giới trắng. Tìm kiếm thông tin doanh nghiệp công khai. Đừng nhắm mục tiêu vào thông tin xác thực, dữ liệu cá nhân riêng tư, bề mặt admin bị lộ, hoặc tài liệu mà bạn không được phép truy cập.
  • Scrapeless Google Search API có thể tự động hóa các bộ truy vấn có thể lặp lại. Lưu truy vấn, thị trường, thời gian, URL nguồn, tiêu đề, đoạn trích, và vị trí; sau đó giảm trùng lặp theo URL chuẩn hóa.

Google Dorking là gì?

Google dorking là thực hành kết hợp một truy vấn Google bình thường với các toán tử tìm kiếm hạn chế tập kết quả. Nó cũng được gọi là tìm kiếm Google nâng cao.

Kỹ thuật này không nhất thiết là một hoạt động bảo mật. Một nhà nghiên cứu có thể sử dụng nó để tìm các trang giá cả công khai, tài liệu đấu thầu, báo cáo hàng năm, danh bạ đối tác, cập nhật chính sách, hoặc nội dung được xuất bản dưới một phần cụ thể của một trang web.

Toán tử chỉ là một bộ lọc. Quyền truy cập và ý định vẫn quan trọng. Một kết quả xuất hiện trong công cụ tìm kiếm không cấp phép truy cập vào một hệ thống riêng tư, tránh một kiểm soát, thu thập dữ liệu hạn chế, hoặc phát hành lại tài liệu bản quyền.

Bảng Cheat Cho Toán Tử Trong Nghiên Cứu Kinh Doanh

Hành vi của các toán tử có thể thay đổi, vì vậy hãy kiểm tra truy vấn chính xác trước khi tự động hóa nó. Hướng dẫn chỉnh sửa tìm kiếm chính thức của Google tài liệu về dấu ngoặc kép, các loại trừ, và site:. Google Search Central riêng biệt tài liệu nhiều toán tử hữu ích cho chủ sở hữu trang web.

Toán tử hoặc mẫu Mục đích Ví dụ kinh doanh
"exact phrase" Yêu cầu một cụm từ "request for proposal" logistics
site:example.com Hạn chế kết quả đến một miền hoặc tiền tố site:vendor.example pricing
filetype:pdf Ưu tiên một loại tệp filetype:pdf "annual report" robotics
-term Loại trừ một từ "partner program" -jobs
OR Chấp nhận một trong hai thuật ngữ "case study" (retail OR ecommerce)
site:example.com/path/ Hạn chế đến một tiền tố URL site:example.com/resources/ "market report"

Sử dụng dấu ngoặc đơn một cách thận trọng và kiểm tra kết quả trực tiếp. Các công cụ tìm kiếm diễn giải truy vấn của con người, không phải một ngôn ngữ truy vấn cơ sở dữ liệu nghiêm ngặt.

Tài liệu tham khảo toán tử Google Search Central bao gồm site:filetype: trong số các toán tử được sử dụng để gỡ lỗi. Hướng dẫn của nó là quan trọng: các toán tử phụ thuộc vào giới hạn chỉ mục và thu hồi, vì vậy chúng không thể thay thế cho Search Console hoặc một danh mục trang của bên thứ nhất.

Ranh Giới Mũ Trắng

Hướng dẫn này dành cho nghiên cứu doanh nghiệp công khai.

Những mục tiêu tốt bao gồm:

  • các trang sản phẩm, giá cả, đối tác, và tài liệu công khai;
  • các RFP công khai, tài liệu chính sách, báo cáo, và hồ sơ;
  • các trang sự kiện, địa điểm, và danh bạ công khai;
  • các trang công khai của công ty cho việc kiểm toán nội dung và chỉ mục;
  • những đề cập công khai cần thiết cho phân tích cạnh tranh hoặc thị trường.

Đừng thiết kế các truy vấn để tìm kiếm mật khẩu, mã API, hồ sơ cá nhân, xuất khẩu bí mật, sao lưu bị lộ, camera riêng tư, bảng đăng nhập để xâm nhập, hoặc tài liệu nhạy cảm khác. Nếu một kết quả công khai có vẻ như tiết lộ một bí mật hoặc hồ sơ riêng tư, hãy dừng thu thập và theo dõi quy trình công bố có trách nhiệm của tổ chức bị ảnh hưởng.

Cũng hãy tôn trọng các chỉ thị của robot khi áp dụng, điều khoản trang web, bản quyền, luật về quyền riêng tư, và giới hạn tỷ lệ. Khám phá tìm kiếm không xóa bỏ các nghĩa vụ liên quan sau đó.

Ví Dụ Nghiên Cứu Kinh Doanh

Tìm Các Trang Giá Cả và Đóng Gói Công Khai

Sử dụng một hạn chế miền khi bạn đã biết nhà cung cấp:

site:vendor.example (pricing OR plans OR enterprise)

Truy vấn này có thể tiết lộ giá cả hiện tại, so sánh, và các trang doanh nghiệp. Nó không chứng minh rằng mọi kế hoạch đều được chỉ mục hoặc rằng một đoạn trích đã lưu lại phản ánh trang trực tiếp. Mở kết quả và ghi lại thời gian quan sát.

Khám Phá Các RFP và Tài Liệu Đấu Thầu Công Khai

Kết hợp loại tài liệu với một cụm từ chính xác và thuật ngữ ngành:

filetype:pdf "request for proposal" "data platform"

Thêm một khu vực, loại tổ chức, hoặc cụm từ ngày để thu hẹp tập hợp. Xác minh tổ chức phát hành, thời hạn, và phiên bản tài liệu trên miền nguồn trước khi thêm một đầu mối vào pipeline.

Lập Bản Đồ Các Hệ Sinh Thái Đối Tác và Tích Hợp

Tìm kiếm các khu vực đối tác hoặc tích hợp công khai của nhà cung cấp:

site:vendor.example (partners OR integrations) -jobs

Việc loại trừ loại bỏ một nguồn thông thường của các trang tuyển dụng không liên quan. Chuẩn hóa tên đối tác sau khi thu thập; một lưới logo và một danh sách thị trường có thể đề cập đến cùng một công ty.

Kiểm tra Phần Nội Dung Công Khai

Giới hạn truy vấn trong một đường dẫn:

site:example.com/resources/ "web scraping"

Điều này hữu ích để phát hiện các URL phần nào mà Google có thể phục vụ cho một chủ đề. Đây không phải là một số liệu đầy đủ. Tài liệu site: cho các nhà khai thác của Google cảnh báo rằng các kết quả có thể bỏ qua các URL đã lập chỉ mục và truy vấn site: trần không được xếp hạng như một truy vấn bình thường.

Theo dõi Cập nhật Chính sách Công hoặc Tuân thủ

Tìm kiếm ngôn ngữ chính sách chính xác trên một miền có thẩm quyền:

site:regulator.example filetype:pdf "effective date" "data processing"

Giữ lại URL nguồn và ngày xuất bản hoặc sửa đổi. Một đoạn văn kết quả tìm kiếm không phải là văn bản pháp lý.

Soạn thảo Truy vấn Hệ thống

Bắt đầu với một bảng nghiên cứu.

Thành phần Câu hỏi Ví dụ
Chủ đề Thực thể hoặc thị trường nào nằm trong phạm vi? robot kho
Bằng chứng Tài liệu công khai nào sẽ trả lời câu hỏi? báo cáo hàng năm
Ranh giới nguồn Những miền hoặc phần nào có thẩm quyền? miền cơ quan quản lý hoặc nhà cung cấp
Định dạng Loại tài liệu nào hữu ích? PDF
Loại trừ Điều gì tạo ra tiếng ồn có thể đoán trước? công việc, sự nghiệp
Thị trường Bối cảnh quốc gia/ngôn ngữ nào quan trọng? Mỹ, Tiếng Anh

Sau đó, xây dựng truy vấn hẹp nhất mà vẫn để lại không gian cho khám phá. Thêm mọi nhà khai thác cùng một lúc có thể che giấu các kết quả hữu ích và khiến việc gỡ lỗi trở nên không thể.

Giữ một hồ sơ truy vấn với mục đích dễ đọc, chủ sở hữu, ngày xem xét và lớp mục tiêu được phép. Hồ sơ đó trở nên đặc biệt quan trọng khi các truy vấn được lên lịch thông qua API.

Scrapeless Google Search API biến một truy vấn thành các bản ghi tìm kiếm có cấu trúc. API hữu ích khi một nhóm nghiên cứu cần các cài đặt lặp lại, phân trang, loại bỏ trùng lặp và xuất thay vì sao chép và dán thủ công.

Mã bên dưới thực hiện một tập hợp các truy vấn doanh nghiệp công khai được phép, theo dõi các độ lệch kết quả đã giới hạn, chuẩn hóa các URL và viết một tệp CSV.

Điều kiện tiên quyết: các yêu cầu sống cần một khóa API Scrapeless trong SCRAPELESS_API_KEY. Xem xét mọi truy vấn cho phạm vi và ủy quyền trước khi thêm nó vào danh sách cho phép.

python Copy
import csv
import os
from datetime import datetime, timezone
from urllib.parse import urlsplit, urlunsplit

import requests

API_URL = "https://api.scrapeless.com/api/v1/scraper/request"
QUERIES = [
    'filetype:pdf "request for proposal" "data platform"',
    'site:example.com/resources/ "market report"',
]


def canonical_url(raw: str) -> str:
    parts = urlsplit(raw)
    host = (parts.hostname or "").lower()
    if host.startswith("www."):
        host = host[4:]
    netloc = host
    if parts.port:
        netloc = f"{host}:{parts.port}"
    path = parts.path.rstrip("/") or "/"
    return urlunsplit((parts.scheme.lower(), netloc, path, parts.query, ""))


def organic_results(payload: dict) -> list[dict]:
    if isinstance(payload.get("organic_results"), list):
        return payload["organic_results"]
    data = payload.get("data", {})
    if isinstance(data, dict) and isinstance(data.get("organic_results"), list):
        return data["organic_results"]
    return []


def search(query: str, start: int) -> dict:
    response = requests.post(
        API_URL,
        headers={
            "x-api-token": os.environ["SCRAPELESS_API_KEY"],
            "Content-Type": "application/json",
        },
        json={
            "actor": "scraper.google.search",
            "input": {
                "q": query,
                "gl": "us",
                "hl": "en",
                "google_domain": "google.com",
                "start": start,
            },
        },
        timeout=60,
    )
    response.raise_for_status()
    return response.json()


def collect(queries: list[str], offsets=(0, 10)) -> list[dict]:
    observed_at = datetime.now(timezone.utc).isoformat()
    rows_by_url = {}
    for query in queries:
        for start in offsets:
            payload = search(query, start)
            for fallback, item in enumerate(organic_results(payload), start=start + 1):
                raw_url = item.get("link") or item.get("url") or ""
                if not raw_url.startswith(("http://", "https://")):
                    continue
                url = canonical_url(raw_url)
                candidate = {
                    "observed_at": observed_at,
                    "query": query,
                    "position": item.get("position", fallback),
                    "title": item.get("title", ""),
                    "snippet": item.get("snippet", ""),
                    "url": url,
                }
                previous = rows_by_url.get(url)
                if previous is None or candidate["position"] < previous["position"]:
                    rows_by_url[url] = candidate
    return sorted(rows_by_url.values(), key=lambda row: (row["query"], row["position"]))


def write_csv(rows: list[dict], path="business_research.csv") -> None:
    fields = ["observed_at", "query", "position", "title", "snippet", "url"]
    with open(path, "w", newline="", encoding="utf-8") as handle:
        writer = csv.DictWriter(handle, fieldnames=fields)
        writer.writeheader()
        writer.writerows(rows)


if __name__ == "__main__":
    write_csv(collect(QUERIES))

Mã giữ đoạn ra khỏi khóa loại bỏ trùng lặp nhưng vẫn giữ chuỗi truy vấn vì các tham số truy vấn có thể xác định các nguồn công khai khác nhau. Tùy thuộc vào mục tiêu nghiên cứu, bạn cũng có thể loại bỏ các tham số theo dõi đã biết như thẻ UTM.

Tài liệu Google Search API là nguồn thông tin chính xác cho các trường yêu cầu hiện tại. Kiểm tra một yêu cầu và kiểm tra phản hồi thực tế của nó trước khi hoàn thiện bộ phân tích.

Phân trang, Loại bỏ Trùng lặp và Xem xét

Phân trang mở rộng mẫu; nó không tạo ra một cơ sở dữ liệu web đầy đủ. Giới hạn các độ lệch theo từng truy vấn và ghi lại độ sâu đó trong cấu hình công việc.

Loại bỏ trùng lặp ở nhiều cấp độ:

  • URL chính xác;
  • các biến thể tham số theo dõi đã biết;
  • kiểm tra tài liệu sau khi tải xuống, khi việc thu thập được ủy quyền;
  • tổ chức và tiêu đề đã chuẩn hóa trong quá trình phân tích.

Không hợp nhất chỉ dựa trên tiêu đề. Các tổ chức khác nhau thường công bố các tài liệu có tên là “Báo cáo Hàng năm” hoặc “Yêu cầu Đề xuất.”

Thêm một hàng đợi xem xét thủ công trước khi một kết quả trở thành khách hàng tiềm năng, mục tuân thủ hoặc tuyên bố cạnh tranh. Các đoạn tìm kiếm có thể cắt ngắn ngữ cảnh, ngày có thể đề cập đến các ví dụ và PDF có thể bị thay thế.

Bắt đầu Thu thập Dữ liệu với Scrapeless

Nâng cao quy trình thu thập dữ liệu và tự động hóa của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phíkhông cần thẻ tín dụng.

Nhận tín dụng miễn phí của bạn ngay bây giờ trong Scrapeless Dashboard.

Giới hạn Hoạt động

Các nhà khai thác tìm kiếm là những công cụ khám phá, không phải là đảm bảo.

  • Phạm vi lập chỉ mục không đầy đủ từ quan điểm của một truy vấn bên ngoài.
  • Các nhà khai thác có thể thay đổi hoặc hành xử khác nhau giữa các loại kết quả.
  • Một đoạn có thể không khớp với trang hiện tại.
  • Địa điểm, ngôn ngữ, thiết bị và thời gian ảnh hưởng đến kết quả.
  • Các truy vấn tương đương lặp lại có thể tạo ra các URL trùng lặp.
  • Một kết quả công khai có thể vẫn chứa tài liệu không nên được thu thập hoặc phân phối lại.

Ghi lại cài đặt truy vấn và xem xét các lỗi tách biệt với các tập kết quả rỗng. Một lỗi yêu cầu có nghĩa là không xác định; một phản hồi thành công rỗng có nghĩa là không có kết quả nào được trả về cho truy vấn mẫu đó.

Kết luận

Google dorking sẽ hữu ích nhất khi nó nhàm chán: một câu hỏi nghiên cứu được tài liệu hóa, một tập hợp nhỏ các toán tử đã được thử nghiệm, một ranh giới dữ liệu công khai, và một xuất khẩu có thể xem xét. Scrapeless Google Search API thêm tính lặp lại và đầu ra có cấu trúc mà không làm thay đổi trách nhiệm của nhà nghiên cứu trong việc xác minh nguồn và tôn trọng các ranh giới truy cập.

Bắt đầu với Google Search API, giữ thông tin tài khoản hiện tại trên trang giá, và thử nghiệm từng toán tử trực tiếp trước khi lên lịch cho nó.

Để có sự so sánh bổ sung về các dịch vụ dữ liệu tìm kiếm, đọc hướng dẫn Google Search API.


Biến Tìm Kiếm Công Khai Thành Một Tập Dữ Liệu Có Thể Xem Xét

Tham gia cộng đồng Scrapeless để nghiên cứu có đạo đức và các mẫu đường ống dữ liệu: Discord · Telegram.

Tạo tài khoản miễn phí tại app.scrapeless.com, thực hiện một truy vấn công khai đã được phê duyệt, và xem xét các URL xuất khẩu trước khi mở rộng phạm vi.


FAQ

Q: Google dorking có bất hợp pháp không?

Các toán tử tìm kiếm là các tính năng tìm kiếm thông thường. Tính hợp pháp và tuân thủ chính sách phụ thuộc vào những gì bạn nhắm đến, cách bạn truy cập, những gì bạn thu thập, và cách bạn sử dụng chúng. Hướng dẫn này chỉ giới hạn cho nghiên cứu được ủy quyền về thông tin doanh nghiệp công khai.

Q: Các toán tử Google nào hữu ích cho nghiên cứu doanh nghiệp?

Các cụm từ được trích dẫn, site:, filetype:, loại trừ với dấu trừ, và các truy vấn OR đã được thử nghiệm cẩn thận bao gồm nhiều quy trình về giá cả, mua sắm, báo cáo, đối tác, và kiểm toán nội dung.

Q: site:example.com có hiển thị mọi trang đã được lập chỉ mục không?

Không. Google cho biết rằng site: kết quả không nhất thiết phải đầy đủ. Sử dụng Search Console hoặc kiểm kê trang của bên thứ nhất khi bạn cần chẩn đoán lập chỉ mục có thẩm quyền cho một trang web bạn kiểm soát.

Q: Tôi có thể tự động hóa các truy vấn Google dork không?

Có. Một Google Search API có thể chạy các truy vấn đã được phê duyệt với các thiết lập thị trường nhất quán và trả về các hồ sơ có cấu trúc. Hạn chế phân trang, loại bỏ URL trùng lặp, giữ nguyên dấu thời gian, và xem xét kết quả trước khi hành động dựa trên chúng.

Q: Điều gì không bao giờ nên được đưa vào danh sách dork tự động?

Không nhắm đến thông tin xác thực, bí mật, dữ liệu cá nhân riêng tư, hệ thống quản trị bị lộ, tài liệu mật, hoặc bất kỳ nguồn nào bạn không được phép truy cập. Dừng lại và sử dụng thông báo có trách nhiệm nếu tài liệu nhạy cảm xuất hiện một cách bất ngờ.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục