API Scraper Gemini: Ghi lại câu trả lời Google Gemini dưới dạng dữ liệu
Web Data Collection Specialist
Tóm tắt:
- Trình thu thập dữ liệu Gemini ghi lại câu trả lời của Google Gemini dưới dạng dữ liệu có cấu trúc. Gửi một yêu cầu đến
scraper.gemini; nhận lại văn bản câu trả lời cộng với các trích dẫn mà Gemini dựa vào. - Đây là một luồng bất đồng bộ gồm hai cuộc gọi. Gửi yêu cầu POST để tạo một nhiệm vụ, sau đó GET kết quả bằng
task_id— trong một lần chạy thực tế, câu trả lời đã quay lại trong khoảng 12 giây. - Các trích dẫn có cấu trúc, không phải được thu thập từ HTML. Mỗi trích dẫn chứa
title,url,website_name,snippet,favicon, và các đoạn văn được làm nổi bật mà Gemini đã sử dụng. - Địa phương hóa với mã quốc gia. Trường
countryđịnh hình câu trả lời cho một khu vực, giống như cách một người dùng ở đó sẽ thấy. - Đây là cách bạn theo dõi sự hiện diện của thương hiệu trong các câu trả lời AI. Hãy hỏi Gemini những câu hỏi mà khách hàng của bạn hỏi và đọc những nguồn mà nó trích dẫn.
- Miễn phí để bắt đầu. Các tài khoản Scrapeless mới bao gồm việc sử dụng miễn phí API của Scraper — đăng ký tại app.scrapeless.com.
Giới thiệu: đọc những gì Gemini thực sự trả lời
Các công cụ trả lời AI hiện đang ở giữa người dùng và web mở. Khi ai đó hỏi Google Gemini về "dịch vụ proxy tốt nhất" hoặc "những điều cần làm ở New York", câu trả lời — và các nguồn mà nó trích dẫn — định hình những gì người dùng đó tin tưởng trước khi họ nhấp vào bất cứ điều gì. Đối với việc theo dõi thương hiệu, nghiên cứu cạnh tranh, và tối ưu hóa công cụ trả lời, câu hỏi không còn là "tôi xếp hạng thế nào trên Google" mà là "Gemini nói gì, và ai là nguồn mà nó trích dẫn."
Trình thu thập Gemini Scrapeless trả lời điều đó một cách lập trình. Bạn gửi một yêu cầu đến tác tử scraper.gemini và nhận lại văn bản câu trả lời cộng với các trích dẫn có cấu trúc phía sau. Hướng dẫn này bao gồm hình thức yêu cầu, một lệnh curl đầu tiên, sơ đồ phản hồi, một tích hợp Python, và cách sử dụng nó — mỗi yêu cầu và phản hồi bên dưới đều được ghi lại từ API trực tiếp.
Những gì bạn có thể làm với nó
- Ghi lại văn bản câu trả lời của Gemini — phản hồi đầy đủ dưới dạng CommonMark-style Markdown, sẵn sàng để lưu trữ hoặc phân tích.
- Đọc các trích dẫn — các nguồn mà Gemini dựa vào để trả lời, mỗi nguồn có tiêu đề, URL và đoạn văn đã sử dụng.
- Theo dõi các đề cập đến thương hiệu trong các câu trả lời AI — hỏi những câu hỏi mà người mua của bạn hỏi và xem liệu bạn có xuất hiện hay không.
- Địa phương hóa theo khu vực — đặt
countryđể xem câu trả lời như một người dùng trong thị trường đó sẽ thấy. - Cung cấp một đường ống giám sát — chạy cùng một yêu cầu theo định kỳ và so sánh các nguồn theo thời gian.
Tại sao chọn Trình thu thập dữ liệu Gemini Scrapeless
Trình thu thập Gemini là một phần của dòng Trình thu thập Chat LLM Scrapeless, cách quản lý để đọc các câu trả lời của AI-engine dưới dạng dữ liệu. Đối với Gemini cụ thể, nó mang lại:
- Một hợp đồng yêu cầu đơn — gửi một yêu cầu, nhận câu trả lời và các trích dẫn của nó; không cần trình duyệt để điều khiển.
- Các trích dẫn có cấu trúc — nguồn trả về dưới dạng các trường, không phải là mã mà bạn phải phân tích.
- Proxy dân cư ở hơn 195 quốc gia — các câu trả lời được thu thập qua lối ra sạch sẽ, phù hợp với khu vực.
- Địa phương hóa theo quốc gia — một trường định hình câu trả lời cho một thị trường.
Nhận khóa API của bạn trong gói miễn phí tại app.scrapeless.com.
Các yêu cầu cần có
- Tài khoản Scrapeless và khóa API — đăng ký tại app.scrapeless.com
curlcho yêu cầu đầu tiên, và Python 3.10+ cho tích hợp- Kiến thức cơ bản về HTTP và JSON
Cách hoạt động của Trình thu thập dữ liệu Gemini
Luồng là hai cuộc gọi: tạo một nhiệm vụ, sau đó lấy kết quả của nó.
Tham số yêu cầu
| Trường | Vị trí | Ý nghĩa |
|---|---|---|
actor |
cấp độ cao nhất | scraper.gemini |
input.prompt |
đầu vào | câu hỏi để hỏi Gemini |
input.country |
đầu vào | mã quốc gia ISO để địa phương hóa câu trả lời |
Xác thực là tiêu đề x-api-token trên cả hai cuộc gọi.
Ghi nhanh với curl
Tạo nhiệm vụ:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.gemini",
"input": { "prompt": "Các điểm tham quan được khuyến nghị ở New York", "country": "US" }
}'
# { "status": "pending", "task_id": "3886db31-…" }
Sau đó lấy kết quả theo task_id:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
Bao bì phản hồi
Khi status là success, câu trả lời và các trích dẫn sẽ có trong task_result:
json
// mẫu minh họa — hình dạng trường là chính xác (ghi lại từ trực tiếp); giá trị được viết tắt
{
"status": "success",
"task_result": {
"prompt": "Các điểm tham quan được khuyến nghị ở New York",
"result_text": "Thành phố New York là một hỗn loạn đẹp đẽ của văn hóa, lịch sử…",
"citations": [
{
"title": "20 Điều tốt nhất để làm ở NYC",
"url": "https://example.com/nyc",
"website_name": "Du lịch Ví dụ",
"snippet": "Từ Tượng đài Tự do đến…",
"favicon": "https://example.com/favicon.ico",
"highlights": ["Tượng đài Tự do", "Công viên Trung tâm"]
}
]
}
}
}
Trong một lần chạy trực tiếp, điều này đã trả về trong khoảng 12 giây với 15 trích dẫn, mỗi trích dẫn mang theo sáu trường dữ liệu trên.
---
## Tích hợp API trong Python
Tạo tác vụ, kiểm tra cho đến khi nó hoàn thành và đọc câu trả lời:
```python
import os
import time
import requests
API_KEY = os.environ["SCRAPELESS_API_KEY"]
BASE = "https://api.scrapeless.com"
HEADERS = {"x-api-token": API_KEY, "Content-Type": "application/json"}
def ask_gemini(prompt: str, country: str = "US") -> dict:
created = requests.post(
f"{BASE}/api/v2/scraper/request",
headers=HEADERS,
json={"actor": "scraper.gemini", "input": {"prompt": prompt, "country": country}},
timeout=60,
)
task_id = created.json()["task_id"]
for _ in range(30):
time.sleep(3)
got = requests.get(f"{BASE}/api/v2/scraper/result/{task_id}", headers=HEADERS, timeout=60)
data = got.json()
if data.get("status") in ("success", "failed"):
return data
raise TimeoutError("kết quả chưa sẵn sàng đúng giờ")
result = ask_gemini("Những điểm tham quan được khuyến nghị ở New York")
answer = result["task_result"]
print(answer["result_text"])
for c in answer["citations"]:
print("-", c["website_name"], c["url"])
Lấy khóa API của bạn trên gói miễn phí: app.scrapeless.com
Cách tránh những vấn đề phổ biến
- Một trường không có mặt là null, không phải là lỗi. Không phải mọi câu trả lời đều có
highlightshoặcfavicon; coi mỗi trường trích dẫn là tùy chọn và bảo vệ cho sự vắng mặt của nó. - Lấy kết quả kịp thời. Kết quả được truy xuất bằng
task_id; kiểm tra ngay sau khi tạo tác vụ thay vì muộn hơn, và ưu tiên khoảng thời gian kiểm tra ngắn để đọc nó sau. - Ghim quốc gia theo thị trường bạn đang nghiên cứu. Trường
countrythay đổi câu trả lời; giữ cho nó cố định theo mỗi lần giám sát để kết quả có thể so sánh theo thời gian. - Câu trả lời khác nhau giữa các lần chạy. Cách diễn đạt của Gemini thay đổi từ lần này sang lần khác, hãy so sánh các nguồn trích dẫn theo thời gian, không phải là đoạn văn chính xác - cách mà các công cụ trả lời hiện lên các trang được mô tả trong hướng dẫn tính năng AI của Google cho web, và hợp đồng HTTP mà bạn gọi theo các tiêu chí ngữ nghĩa của HTTP.
Kết luận: thương hiệu của bạn, như Gemini nhìn thấy
Trình thu thập Gemini biến một câu trả lời AIl thành dữ liệu mà bạn có thể theo dõi: văn bản phản hồi và các nguồn chính xác phía sau nó, trong một quy trình gọi hai lần. Chạy các câu hỏi mà khách hàng của bạn hỏi, lưu trữ các trích dẫn và xem sự hiện diện của bạn trong các câu trả lời của Gemini thay đổi theo thời gian. Kết hợp nó với các công cụ khác trong dòng Universal Scraping API, tìm hiểu về tại sao các công cụ trả lời đã thay đổi tìm kiếm, và tài liệu bao gồm mọi trường.
Sẵn sàng xây dựng hệ thống dữ liệu do AI cung cấp?
Tham gia cộng đồng của chúng tôi để nhận gói miễn phí và kết nối với các nhà phát triển theo dõi phản hồi AI: Discord · Telegram.
Đăng ký tại app.scrapeless.com để sử dụng API Scraper miễn phí, và xem giá cả cho quy mô.
Câu hỏi thường gặp
Q: Trình thu thập Gemini trả về cái gì?
Văn bản câu trả lời dưới dạng Markdown (result_text) cộng với một mảng citations - mỗi trích dẫn có title, url, website_name, snippet, favicon, và các highlights mà Gemini đã sử dụng. Trong một lần chạy trực tiếp, một câu hỏi đã trả về 15 trích dẫn.
Q: Nó có đồng bộ không?
Không. Bạn POST câu hỏi để tạo một tác vụ và GET kết quả bằng task_id. Trong một lần chạy trực tiếp, câu trả lời đã sẵn sàng trong khoảng 12 giây.
Q: Tôi có thể địa phương hóa câu trả lời không?
Có - đặt input.country thành một mã ISO. Câu trả lời được hình thành theo thị trường đó, vì vậy hãy giữ cố định khi bạn so sánh kết quả qua thời gian.
Q: Tại sao các câu trả lời thay đổi giữa các lần chạy?
Các câu trả lời sinh sinh thay đổi trong cách diễn đạt từ lần này sang lần khác. Để giám sát, hãy theo dõi các nguồn trích dẫn và xem thương hiệu của bạn có xuất hiện không, không phải đoạn văn chính xác.
Q: Tôi có cần một proxy không?
Không. Việc thoát được xử lý bên trong diễn viên thông qua các địa chỉ IP dân cư; bạn chỉ cần gửi câu hỏi và quốc gia.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



