🎯 Trình duyệt đám mây tùy chỉnh, chống phát hiện được hỗ trợ bởi Chromium tự phát triển, thiết kế dành cho trình thu thập dữ liệu webtác nhân AI. 👉Dùng thử ngay
Quay lại blog

API trích xuất Perplexity: Ghi lại các câu trả lời AI được trích dẫn dưới dạng dữ liệu.

Alex Johnson
Alex Johnson

Senior Web Scraping Engineer

08-Jul-2026

Tóm tắt:

  • Trình thu thập dữ liệu Perplexity lấy câu trả lời của Perplexity cùng với các nguồn web. Gửi một câu hỏi tới scraper.perplexity; nhận về văn bản câu trả lời, các kết quả web mà nó đã trích dẫn, gợi ý tiếp theo và bất kỳ phương tiện nào.
  • Đây là một quy trình bất đồng bộ hai cuộc gọi. Gửi yêu cầu POST để tạo một nhiệm vụ, sau đó GET kết quả bằng task_id — trong phiên chạy trực tiếp, câu trả lời được trả về sau khoảng 12 giây.
  • Các nguồn web được cung cấp dưới dạng danh sách có cấu trúc. Mỗi mục web_results có một name, một url, và đoạn snippet mà Perplexity đã sử dụng — không cần phân tích HTML.
  • Bạn cũng nhận được các yêu cầu tiếp theo. Các câu hỏi tiếp theo mà Perplexity gợi ý được trả về trong related_prompt, hữu ích cho việc lập bản đồ một chủ đề.
  • Bật tìm kiếm web theo yêu cầu. Đặt web_search: true để nhận được câu trả lời có căn cứ, được trích dẫn thay vì chỉ là phản hồi từ mô hình.
  • Miễn phí khi bắt đầu. Các tài khoản Scrapeless mới bao gồm việc sử dụng API Scraper miễn phí — đăng ký tại app.scrapeless.com.

Giới thiệu: đọc câu trả lời của Perplexity và các nguồn của nó

Perplexity đã xây dựng danh tiếng của mình dựa trên những câu trả lời đã được trích dẫn: hỏi một câu hỏi, nhận phản hồi tổng hợp với các trang web mà nó đã trích dẫn được liệt kê bên cạnh. Đối với bất kỳ ai theo dõi cách thương hiệu của họ xuất hiện trong các câu trả lời của AI, danh sách trích dẫn đó là giải thưởng — nó là tương đương hiện đại của một trang kết quả tìm kiếm, được quyết định bởi một công cụ trả lời chứ không phải mười liên kết màu xanh.

Trình thu thập dữ liệu Perplexity của Scrapeless đọc toàn bộ đối tượng đó như một dữ liệu. Bạn gửi một yêu cầu tới tác nhân scraper.perplexity và nhận về văn bản câu trả lời, các nguồn web đằng sau nó, các câu hỏi tiếp theo mà Perplexity gợi ý, và bất kỳ phương tiện nào mà nó đã hiển thị. Hướng dẫn này đề cập đến hình dạng yêu cầu, một curl đầu tiên, cấu trúc phản hồi, tích hợp Python và cách sử dụng — mỗi yêu cầu và phản hồi bên dưới đều được lưu lại từ API trực tiếp.


Bạn có thể làm gì với nó

  • Bắt văn bản câu trả lời của Perplexity — phản hồi tổng hợp đầy đủ dưới dạng CommonMark-style Markdown.
  • Đọc các nguồn web — các trang mà Perplexity đã trích dẫn, mỗi trang có tên, URL và đoạn trích.
  • Lập bản đồ một chủ đề với các câu hỏi tiếp theo — các gợi ý trong related_prompt cho thấy cuộc trò chuyện tiếp theo sẽ đi đâu.
  • Theo dõi sự hiện diện thương hiệu trong các câu trả lời AI — chạy các câu hỏi của người mua và xem tên miền nào mà Perplexity trích dẫn.
  • Địa phương hóa theo khu vực — đặt country để xem câu trả lời như một người dùng ở thị trường đó.

Tại sao chọn Trình thu thập dữ liệu Perplexity Scrapeless

Trình thu thập dữ liệu Perplexity là một phần của dòng Trình thu thập Chat LLM Scrapeless, cách quản lý để đọc các câu trả lời của công cụ AI dưới dạng dữ liệu. Đối với Perplexity cụ thể, nó mang lại:

  • Hợp đồng yêu cầu đơn lẻ — gửi một câu hỏi, nhận câu trả lời, nguồn, và gợi ý tiếp theo; không cần trình duyệt để điều khiển.
  • Kết quả web có cấu trúc — các nguồn trở lại dưới dạng các trường, không phải mã để phân tích.
  • Proxy dân cư ở 195+ quốc gia — câu trả lời được lấy qua egress sạch, phù hợp với khu vực.
  • Tìm kiếm web như một cờ — một trường xác định câu trả lời có căn cứ và đã trích dẫn so với chỉ là phản hồi từ mô hình.

Nhận khóa API của bạn ở gói miễn phí tại app.scrapeless.com.


Các yêu cầu

  • Một tài khoản Scrapeless và khóa API — đăng ký tại app.scrapeless.com
  • curl cho yêu cầu đầu tiên, và Python 3.10+ cho tích hợp
  • Kiến thức cơ bản về HTTP và JSON

Cách hoạt động của Trình thu thập dữ liệu Perplexity

Quy trình là hai cuộc gọi: tạo một nhiệm vụ, sau đó lấy kết quả của nó.

Tham số yêu cầu

Trường Nơi Ý nghĩa
actor cấp cao nhất scraper.perplexity
input.prompt đầu vào câu hỏi để hỏi Perplexity
input.country đầu vào mã quốc gia ISO để định vị hóa câu trả lời
input.web_search đầu vào true cho câu trả lời có căn cứ, đã được trích dẫn

Xác thực là tiêu đề x-api-token trên cả hai cuộc gọi.

Bắt nhanh bằng curl

Tạo nhiệm vụ:

bash Copy
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "actor": "scraper.perplexity",
    "input": { "prompt": "Những điểm thu hút nổi bật ở New York", "country": "US", "web_search": true }
  }'
# { "status": "pending", "task_id": "504f46ef-…" }

Sau đó lấy kết quả bằng task_id:

bash Copy
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
  -H "x-api-token: ${SCRAPELESS_API_KEY}"

Bao bì phản hồi

Khi statussuccess, câu trả lời và các nguồn của nó ở trong task_result:

json Copy
// mẫu minh họa - hình dạng trường là chính xác (đã được lưu lại trực tiếp); giá trị đã được rút ngắn
{
  "status": "success",
  "task_result": {
    "prompt": "Những điểm thu hút nổi bật ở New York",
    "result_text": "Dưới đây là một số điểm thu hút không thể bỏ qua ở Thành phố New York...",
    "web_results": [
      { "name": "20 điểm tốt nhất để tham quan ở NYC", "url": "https://example.com/nyc", "snippet": "Từ Tượng Nữ thần Tự do đến..." }
    ],
    "related_prompt": [
"Chú ý đến lịch sử và kiến trúc trong chuyến đi hai ngày",
" Tôi đang du lịch với bọn trẻ trong ba ngày"
Có — đặt `input.country` thành mã ISO, và giữ nó cố định khi so sánh kết quả theo thời gian.

**H: Tôi có cần một proxy không?**
Không. Việc xuất dữ liệu được xử lý bên trong diễn viên thông qua địa chỉ IP dân cư; bạn chỉ cần gửi lời nhắc, quốc gia và cờ `web_search`.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục