返回博客
困惑度抓取API:将引用的AI答案捕获为数据
Alex Johnson
Senior Web Scraping Engineer
08-Jul-2026
TL;DR:
- Perplexity Scraper 捕获了 Perplexity 的回答及其网页来源。 向
scraper.perplexity发送提示;返回回答文本、引用的网页结果、后续建议和任何媒体。 - 这是一个两次调用的异步流程。 POST 提示以创建任务,然后通过
task_idGET 结果——在一次实时运行中,答案大约在 12 秒内返回。 - 网页来源以结构化列表的形式呈现。 每个
web_results条目都有一个name、一个url和 Perplexity 引用的snippet——无需进行 HTML 解析。 - 您还可以获得后续提示。 Perplexity 建议的下一个问题在
related_prompt中返回,便于主题映射。 - 根据请求启用网络搜索。 设置
web_search: true以获取带有引用的确切答案,而不是仅由模型生成的回复。 - 免费开始。 新的 Scrapeless 账户包括免费 Scraper API 使用权限——在 app.scrapeless.com 注册。
介绍:阅读 Perplexity 的回答及其来源
Perplexity 以引用的答案而闻名:提问,获得一个合成的回复,同时列出其引用的网页。对于任何跟踪品牌在 AI 回答中出现情况的人来说,那个引用列表就是奖励——它是现代搜索结果页面的等价物,由回答引擎决定,而不是十个蓝色链接。
Scrapeless Perplexity Scraper 将整个对象作为数据读取。您向 scraper.perplexity 发送提示并返回回答文本、背后的网页来源、Perplexity 建议的后续问题和任何出现的媒体。本指南涵盖了请求格式、第一次 curl、响应架构、Python 集成以及如何使用它——下面的每个请求和响应都记录了实时 API。
您可以用它做什么
- 捕获 Perplexity 的回答文本——完整的合成回复以 CommonMark 样式 Markdown 格式。
- 阅读网页来源——Perplexity 引用的页面,每个页面都有名称、URL 和摘录。
- 通过后续提示映射主题——
related_prompt建议显示对话接下来的方向。 - 跟踪 AI 回答中的品牌可见性——运行买家问题,查看 Perplexity 引用的域名。
- 按地区本地化——设置
country以查看该市场用户会得到的答案。
为什么选择 Scrapeless Perplexity Scraper
Perplexity Scraper 是 Scrapeless LLM Chat Scraper 系列的一部分,是将 AI 引擎答案作为数据读取的托管方式。具体针对 Perplexity,它带来了:
- 单个请求合约——发送提示,获取答案、来源和后续内容;无需浏览器操作。
- 结构化网页结果——来源作为字段返回,而不是需解析的标记。
- 195+ 国家中的住宅代理——答案通过干净、适合地区的出口获取。
- 网络搜索作为标志——一个字段决定是基于事实和引用的答案还是仅由模型生成的答案。
在免费计划中获取您的 API 密钥,访问 app.scrapeless.com。
先决条件
- 一个 Scrapeless 账户和 API 密钥——在 app.scrapeless.com 注册
- 第一个请求需要
curl,集成需要 Python 3.10+ - 对 HTTP 和 JSON 有基本了解
Perplexity Scraper 的工作原理
流程为两个调用:创建任务,然后获取其结果。
请求参数
| 字段 | 位置 | 含义 |
|---|---|---|
actor |
顶级 | scraper.perplexity |
input.prompt |
输入 | 要询问 Perplexity 的问题 |
input.country |
输入 | 本地化答案的 ISO 国家代码 |
input.web_search |
输入 | true 以获取基于事实的、引用的答案 |
身份验证是两个调用中的 x-api-token 头。
使用 curl 快速捕获
创建任务:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.perplexity",
"input": { "prompt": "纽约的推荐景点", "country": "US", "web_search": true }
}'
# { "status": "pending", "task_id": "504f46ef-…" }
然后通过 task_id 获取结果:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
响应封装
一旦 status 为 success,答案及其来源在 task_result 中:
json
// 示例样本——字段形式完全相同(实时捕获);值略缩写
{
"status": "success",
"task_result": {
"prompt": "纽约的推荐景点",
"result_text": "以下是在纽约市的一些必看景点……",
"web_results": [
{ "name": "纽约市最佳20个活动", "url": "https://example.com/nyc", "snippet": "从自由女神像到……" }
],
"related_prompt": [
"专注于历史和建筑的两天旅行",
"我和孩子们旅行三天"
是的 - 将 `input.country` 设置为 ISO 代码,并在比较结果时保持固定。
**问:我需要代理吗?**
不需要。通过住宅 IP 在内部处理流出;您只需发送提示、国家和 `web_search` 标志。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。
最受欢迎的文章
目录



