Cách sử dụng Toán tử Tìm kiếm Google: Hướng dẫn Chi tiết từ SerpApi
Advanced Data Extraction Specialist
TL;DR:
- Các toán tử tìm kiếm của Google thu hẹp một truy vấn bằng cụm từ, trang web, loại tệp, loại trừ hoặc ngày tháng trước khi bất kỳ kết quả nào đến được trình phân tích.
- Deep SerpApi gửi biểu thức toán tử bên trong
qvà giữ ngôn ngữ, quốc gia và miền Google trong các trường đầu vào riêng biệt. - Diễn viên Tìm kiếm Google trả về các phần SERP đã phân tích như
organic_results, vì vậy một ống dẫn có thể lưu trữ thứ hạng, tiêu đề, liên kết và đoạn trích mà không cần phân tích HTML của trang kết quả. - Toán tử
site:hữu ích cho việc phát hiện và gỡ lỗi, nhưng Google nói rằng các kết quả của nó không phải là báo cáo chỉ số đầy đủ.
Một toán tử tìm kiếm là một phần nhỏ của cú pháp truy vấn nhưng có ảnh hưởng to lớn. Dấu ngoặc kép có thể bảo tồn một cụm từ. Dấu trừ có thể loại bỏ một nghĩa không mong muốn. site: có thể giới hạn việc phát hiện đến một miền. filetype: có thể kéo nghiên cứu về phía các báo cáo thay vì các trang tiếp thị.
Mô hình API hữu ích là bảo tồn truy vấn đó chính xác, gửi nó đến một diễn viên tìm kiếm, và nhận các bản ghi kết quả có cấu trúc. Hướng dẫn này chỉ ra cách thiết kế các truy vấn toán tử và chạy chúng thông qua Scrapeless Deep SerpApi mà không biến mã thành một trình phân tích URL Google tự xây dựng.
Những gì các toán tử tìm kiếm của Google làm
Các toán tử tìm kiếm của Google là các token hoặc dấu câu làm tinh chỉnh những kết quả mà một truy vấn yêu cầu Google trả về. Tài liệu trợ giúp tinh chỉnh tìm kiếm của Google ghi lại các dạng chính mà người dùng tương tác: cụm từ có dấu ngoặc kép, loại trừ thuật ngữ với dấu trừ, site:, filetype:, và các giới hạn ngày tháng before: và after:.
Cú pháp rất ngắn gọn, nhưng khoảng cách có ý nghĩa. site:example.com là một toán tử. site: example.com không phải là cùng một biểu thức vì toán hạng bị tách rời khỏi toán tử.
| Mục tiêu | Mẫu truy vấn | Ví dụ |
|---|---|---|
| Cụm từ chính xác | "phrase" |
"agentic retrieval" |
| Loại trừ một nghĩa | -term |
jaguar speed -car |
| Giới hạn một miền hoặc tiền tố | site:domain |
site:docs.python.org asyncio |
| Giới hạn một loại tệp | filetype:extension |
zero trust filetype:pdf |
| Giới hạn theo ngày cập nhật | after:date before:date |
AI policy after:2025 before:2027 |
Các toán tử có thể được kết hợp. Bắt đầu với câu hỏi nghiên cứu, sau đó thêm số lượng ràng buộc nhỏ nhất cần thiết để loại bỏ tiếng ồn.
Các công thức tìm kiếm tương ứng với các công việc nghiên cứu thực tế
Tìm tài liệu chính
Sử dụng một sự hạn chế miền cộng thêm một khái niệm chính xác:
site:developers.google.com/search "search operators"
Điều này hoạt động tốt khi tổ chức có nhiều tài sản và một truy vấn từ khóa bình thường trả về bình luận trước tài liệu nguồn.
Xác định các báo cáo công khai
Kết hợp một miền đáng tin cậy, một loại tệp, và một cụm từ:
site:nist.gov filetype:pdf "AI risk management"
Toán tử này thu hẹp việc phát hiện. Nó không chứng minh rằng mọi kết quả đều hiện tại, có thẩm quyền cho câu hỏi cụ thể, hoặc an toàn để tái sử dụng. Những kiểm tra đó vẫn thuộc về quy trình nghiên cứu.
Loại trừ một nghĩa mơ hồ
Sử dụng dấu trừ ngay trước thuật ngữ không mong muốn:
python concurrency -snake
Các loại trừ tốt nhất nên được sử dụng sau khi kiểm tra tập kết quả đầu tiên. Loại bỏ một thuật ngữ rộng quá sớm có thể che giấu các trang hữu ích đề cập đến nó một cách tình cờ.
So sánh vật liệu bên trong một khoảng thời gian
Đặt cả hai giới hạn trong truy vấn:
browser automation after:2025 before:2027
Google mô tả những điều này như các bộ lọc cập nhật tài liệu. Xem các ngày như là các ràng buộc tìm kiếm, không phải là một sự thay thế cho việc đọc ngày công bố hoặc cập nhật trên trang nguồn.
Giới hạn quan trọng của site:
Toán tử site: quý giá cho việc phát hiện nguồn, kiểm tra spam, và các câu hỏi như “Những trang nào dưới tiền tố này có thể xuất hiện cho thuật ngữ này?” Nó không phải là một danh sách toàn diện các URL đã được lập chỉ mục.
Tài liệu dành riêng cho site: của Google nói rằng danh sách kết quả không nhất thiết là đầy đủ và một truy vấn site:example.com trống không xếp hạng các kết quả một cách bình thường. Đối với việc chẩn đoán lập chỉ mục, Google khuyên nên sử dụng Công cụ Kiểm tra URL trong Search Console hơn các số liệu toán tử. Tham khảo rộng hơn tài liệu tham khảo toán tử Search Central cũng lưu ý đến các giới hạn lập chỉ mục và truy xuất.
Điều đó thay đổi cách mà một ống dẫn tự động nên gán nhãn dữ liệu. Lưu trữ “các kết quả được trả về cho truy vấn này vào thời điểm này,” không phải là “tất cả các trang đã được lập chỉ mục trên miền.”
Bắt đầu thu thập dữ liệu với Scrapeless
Tăng cường quy trình thu thập dữ liệu và tự động hóa web của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.Nhận tín dụng miễn phí của bạn ngay bây giờ trong Bảng điều khiển Scrapeless.
Cách Deep SerpApi xử lý các truy vấn toán tử
Scrapeless cho phép tìm kiếm Google thông qua scraper.google.search actor. Yêu cầu sử dụng một điểm cuối và tách biệt truy vấn tự do khỏi các điều khiển địa phương:
| Trường | Mục đích |
|---|---|
actor |
Chọn scraper.google.search |
input.q |
Mang theo từ khóa và toán tử tìm kiếm đúng như một chuỗi truy vấn |
input.gl |
Chọn ngữ cảnh quốc gia |
input.hl |
Chọn ngôn ngữ kết quả |
input.google_domain |
Chọn miền Google |
Việc tách biệt này hữu ích cho việc thử nghiệm. Truy vấn với cùng một toán tử có thể được thực hiện với một quốc gia hoặc ngôn ngữ khác mà không cần viết lại biểu thức tìm kiếm.
Trang sản phẩm Deep SerpApi mô tả bề mặt tìm kiếm được quản lý, và hướng dẫn nhanh Deep SerpApi tài liệu hóa actor, điểm cuối, tiêu đề xác thực và hình dạng đầu vào.
Gửi yêu cầu đã xác thực
Xuất một khóa thực trong shell trước khi chạy yêu cầu. Cuộc gọi trực tiếp dưới đây được bảo vệ bằng thông tin xác thực; điểm cuối, tiêu đề, cú pháp JSON và trình phân tích cú pháp đã được xác minh cục bộ, nhưng không có phản hồi dịch vụ thành công nào được tuyên bố mà không có khóa.
bash
curl -sS -X POST https://api.scrapeless.com/api/v1/scraper/request \
-H 'Content-Type: application/json' \
-H "x-api-token: $SCRAPELESS_API_KEY" \
-d '{
"actor": "scraper.google.search",
"input": {
"q": "site:nist.gov filetype:pdf \"AI risk management\"",
"gl": "us",
"hl": "en",
"google_domain": "google.com"
}
}'
Biểu thức toán tử vẫn ở q. Không chèn khoảng trắng sau site: hoặc filetype:. JSON và khách hàng HTTP xử lý mã hóa vận chuyển, vì vậy ứng dụng không cần phải nối một URL tìm kiếm Google.
Đọc phản hồi có cấu trúc
Phản hồi tìm kiếm web thông thường đặt các phần kết quả đã phân tích ở cấp độ chính. Mẫu này chỉ hiển thị hình dạng chính; các giá trị thì chỉ mang tính minh họa.
json
{
"search_information": {},
"organic_results": [
{
"position": 1,
"title": "Illustrative report title",
"link": "https://example.org/report.pdf",
"snippet": "Illustrative result snippet"
}
],
"related_searches": [],
"pagination": {},
"metadata": {}
}
Các mô-đun kết quả khác nhau theo truy vấn. Mã nên đọc phần mà nó đã yêu cầu và đối xử với các phần tùy chọn vắng mặt như là vắng mặt, không phải là JSON sai cấu trúc.
Dưới đây là một khách hàng Python nhỏ giữ tách biệt thiết kế truy vấn và xử lý phản hồi:
python
import json
import os
import urllib.request
ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
def google_search(query: str, country: str = "us", language: str = "en") -> dict:
body = json.dumps({
"actor": "scraper.google.search",
"input": {
"q": query,
"gl": country,
"hl": language,
"google_domain": "google.com",
},
}).encode()
request = urllib.request.Request(
ENDPOINT,
data=body,
headers={
"Content-Type": "application/json",
"x-api-token": os.environ["SCRAPELESS_API_KEY"],
},
)
with urllib.request.urlopen(request) as response:
return json.loads(response.read())
serp = google_search('site:nist.gov filetype:pdf "AI risk management"')
for row in serp.get("organic_results") or []:
print(row.get("position"), row.get("title"), row.get("link"))
Khối Python này vượt qua biên dịch cú pháp cục bộ. Cuộc gọi mạng vẫn là một yêu cầu có nhãn vì môi trường này không có khóa API Scrapeless.
Xây dựng một pipeline toán tử có thể tái sử dụng
Một quy trình sản xuất nên lưu trữ nhiều hơn các liên kết đã trả về. Giữ đủ ngữ cảnh yêu cầu để giải thích từng hàng sau đó:
- chuỗi
qchính xác, bao gồm các toán tử; - quốc gia, ngôn ngữ và miền Google;
- dấu thời gian;
- vị trí, tiêu đề, liên kết và đoạn đã trả về;
- mô-đun nguồn, chẳng hạn như kết quả tự nhiên;
- một URL mục tiêu được chuẩn hóa cho việc loại bỏ trùng lặp;
- câu hỏi nghiên cứu đã thúc đẩy truy vấn.
Điều này biến việc lấy SERP thành một tập dữ liệu có thể kiểm toán. Khi kết quả khác nhau, nhóm có thể so sánh truy vấn và địa phương trước khi trách móc trình phân tích cú pháp.
Hướng dẫn về Scraper API actor giải thích cách mà các actor tìm kiếm phù hợp với các actor được quản lý khác. Xem lại giá cả trước khi chọn tần suất lấy dữ liệu và phạm vi địa lý.
Những sai lầm thường gặp của toán tử
Tách biệt toán hạng
site: example.com và filetype: pdf tách biệt giá trị. Giữ toán hạng bên cạnh dấu hai chấm.
Xem một số lượng kết quả như một số lượng chỉ mục
Một tập kết quả site: là một mẫu kết quả tìm kiếm dưới các ràng buộc thu hồi. Nó không phải là một xuất chỉ mục.
Kết hợp địa phương vào truy vấn
Không thêm lời văn như “kết quả từ Mỹ bằng tiếng Anh” khi gl và hl có thể diễn đạt các điều khiển đó trực tiếp. Giữ q tập trung vào mục đích thông tin.
Giả định mỗi truy vấn trả về các mô-đun giống nhau
Web, địa phương, hình ảnh và các chế độ tìm kiếm khác có các phần phản hồi khác nhau. Phân tích hình dạng tài liệu của chế độ đã chọn và giữ các trường tùy chọn là nullable.
Kết luận
Các toán tử tìm kiếm cải thiện truy vấn trước khi việc thu thập bắt đầu. Deep SerpApi bảo tồn biểu thức đó trong q, thêm các trường địa phương rõ ràng, và trả về dữ liệu SERP đã phân tích có thể được xếp hạng, lưu trữ và kiểm toán. Mô hình đáng tin cậy là mẫu truy vấn, các điều khiển địa phương, phản hồi có cấu trúc và giới hạn trung thực về những gì tập hợp kết quả đại diện.
Sẵn sàng xây dựng một pipeline tìm kiếm dựa trên toán tử?
Tham gia cộng đồng của chúng tôi để nhận một kế hoạch miễn phí và kết nối với các nhà phát triển đang xây dựng các tập dữ liệu tìm kiếm có cấu trúc: Discord · Telegram.
Đăng ký tại app.scrapeless.com và biến các truy vấn chính xác thành các bản ghi SERP có cấu trúc.
Câu hỏi thường gặp
H: Những toán tử tìm kiếm Google hữu ích nhất là gì?
Dấu ngoặc kép, loại trừ dấu trừ, site:, filetype:, before:, và after: bao phủ nhiều nhiệm vụ nghiên cứu. Chọn toán tử dựa trên độ ồn quan sát thấy trong tập kết quả ban đầu.
H: Có thể kết hợp các toán tử tìm kiếm trong một truy vấn không?
Có. Một truy vấn có thể kết hợp một cụm từ có dấu ngoặc kép, hạn chế miền, loại tệp, loại trừ, và giới hạn thời gian. Mỗi ràng buộc thêm vào sẽ giảm tập kết quả có thể có, vì vậy chỉ sử dụng những cái mà nhiệm vụ cần.
H: site: có hiển thị tất cả các trang mà Google đã lập chỉ mục không?
Không. Google cho biết rằng site: không nhất thiết phải đầy đủ. Sử dụng các công cụ Search Console để chẩn đoán chính xác về một trang web mà bạn kiểm soát.
H: Deep SerpApi có chấp nhận cú pháp toán tử nâng cao không?
Có. Đặt biểu thức toán tử đầy đủ trong trường q cho diễn viên Google Search. Giữ quốc gia, ngôn ngữ, và miền Google trong các trường riêng của chúng.
H: Deep SerpApi có yêu cầu cấu hình proxy không?
Không cần cấu hình proxy riêng biệt cho diễn viên quản lý. Thiết lập bối cảnh địa lý thông qua các trường yêu cầu được hỗ trợ như gl, và sử dụng dữ liệu trả về theo các quy tắc áp dụng.
H: Điều gì xảy ra khi Google thay đổi DOM của trang kết quả?
Diễn viên quản lý trả về các trường đã phân tích thay vì yêu cầu khách hàng duy trì trình phân tích DOM của trang kết quả. Mã downstream vẫn nên coi các mô-đun và trường tùy chọn là nullable vì thành phần kết quả thay đổi theo truy vấn.
H: API xử lý một WAF hoặc ma sát truy cập tìm kiếm như thế nào?
Dịch vụ quản lý xử lý lớp mạng và lớp trích xuất phía sau diễn viên. Khách hàng gửi yêu cầu đã được tài liệu hóa và xử lý phản hồi có cấu trúc; họ không nên yêu cầu quyền truy cập vượt quá dữ liệu công khai hoặc đã được ủy quyền.
H: Workflow này có thể chạy mà không cần một tác nhân AI không?
Có. Các script shell, công việc Python, bộ lập lịch, và pipeline dữ liệu có thể gọi cùng một điểm cuối trực tiếp. Một tác nhân AI là sự điều phối tùy chọn xung quanh công cụ tìm kiếm.
H: Có hợp pháp để thu thập kết quả tìm kiếm của Google không?
Tính hợp pháp phụ thuộc vào quyền tài phán, mục đích, hợp đồng, và dữ liệu liên quan. Chỉ thu thập dữ liệu công khai hoặc đã được ủy quyền, tối thiểu hóa thông tin lưu trữ, và thu thập ý kiến pháp lý cho các trường hợp sử dụng nhạy cảm hoặc có rủi ro cao.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.




