🎯 一款可定制、具备反检测功能的云浏览器,由自主研发的 Chromium驱动,专为网页爬虫AI 代理设计。👉立即试用
返回博客

困惑度抓取API:将引用的AI答案捕获为数据

Alex Johnson
Alex Johnson

Senior Web Scraping Engineer

08-Jul-2026

TL;DR:

  • Perplexity Scraper 捕获了 Perplexity 的回答及其网页来源。scraper.perplexity 发送提示;返回回答文本、引用的网页结果、后续建议和任何媒体。
  • 这是一个两次调用的异步流程。 POST 提示以创建任务,然后通过 task_id GET 结果——在一次实时运行中,答案大约在 12 秒内返回。
  • 网页来源以结构化列表的形式呈现。 每个 web_results 条目都有一个 name、一个 url 和 Perplexity 引用的 snippet——无需进行 HTML 解析。
  • 您还可以获得后续提示。 Perplexity 建议的下一个问题在 related_prompt 中返回,便于主题映射。
  • 根据请求启用网络搜索。 设置 web_search: true 以获取带有引用的确切答案,而不是仅由模型生成的回复。
  • 免费开始。 新的 Scrapeless 账户包括免费 Scraper API 使用权限——在 app.scrapeless.com 注册。

介绍:阅读 Perplexity 的回答及其来源

Perplexity 以引用的答案而闻名:提问,获得一个合成的回复,同时列出其引用的网页。对于任何跟踪品牌在 AI 回答中出现情况的人来说,那个引用列表就是奖励——它是现代搜索结果页面的等价物,由回答引擎决定,而不是十个蓝色链接。

Scrapeless Perplexity Scraper 将整个对象作为数据读取。您向 scraper.perplexity 发送提示并返回回答文本、背后的网页来源、Perplexity 建议的后续问题和任何出现的媒体。本指南涵盖了请求格式、第一次 curl、响应架构、Python 集成以及如何使用它——下面的每个请求和响应都记录了实时 API。


您可以用它做什么

  • 捕获 Perplexity 的回答文本——完整的合成回复以 CommonMark 样式 Markdown 格式。
  • 阅读网页来源——Perplexity 引用的页面,每个页面都有名称、URL 和摘录。
  • 通过后续提示映射主题——related_prompt 建议显示对话接下来的方向。
  • 跟踪 AI 回答中的品牌可见性——运行买家问题,查看 Perplexity 引用的域名。
  • 按地区本地化——设置 country 以查看该市场用户会得到的答案。

为什么选择 Scrapeless Perplexity Scraper

Perplexity Scraper 是 Scrapeless LLM Chat Scraper 系列的一部分,是将 AI 引擎答案作为数据读取的托管方式。具体针对 Perplexity,它带来了:

  • 单个请求合约——发送提示,获取答案、来源和后续内容;无需浏览器操作。
  • 结构化网页结果——来源作为字段返回,而不是需解析的标记。
  • 195+ 国家中的住宅代理——答案通过干净、适合地区的出口获取。
  • 网络搜索作为标志——一个字段决定是基于事实和引用的答案还是仅由模型生成的答案。

在免费计划中获取您的 API 密钥,访问 app.scrapeless.com


先决条件

  • 一个 Scrapeless 账户和 API 密钥——在 app.scrapeless.com 注册
  • 第一个请求需要 curl,集成需要 Python 3.10+
  • 对 HTTP 和 JSON 有基本了解

Perplexity Scraper 的工作原理

流程为两个调用:创建任务,然后获取其结果。

请求参数

字段 位置 含义
actor 顶级 scraper.perplexity
input.prompt 输入 要询问 Perplexity 的问题
input.country 输入 本地化答案的 ISO 国家代码
input.web_search 输入 true 以获取基于事实的、引用的答案

身份验证是两个调用中的 x-api-token 头。

使用 curl 快速捕获

创建任务:

bash Copy
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "actor": "scraper.perplexity",
    "input": { "prompt": "纽约的推荐景点", "country": "US", "web_search": true }
  }'
# { "status": "pending", "task_id": "504f46ef-…" }

然后通过 task_id 获取结果:

bash Copy
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
  -H "x-api-token: ${SCRAPELESS_API_KEY}"

响应封装

一旦 statussuccess,答案及其来源在 task_result 中:

json Copy
// 示例样本——字段形式完全相同(实时捕获);值略缩写
{
  "status": "success",
  "task_result": {
    "prompt": "纽约的推荐景点",
    "result_text": "以下是在纽约市的一些必看景点……",
    "web_results": [
      { "name": "纽约市最佳20个活动", "url": "https://example.com/nyc", "snippet": "从自由女神像到……" }
    ],
    "related_prompt": [
"专注于历史和建筑的两天旅行",
"我和孩子们旅行三天"
是的 - 将 `input.country` 设置为 ISO 代码,并在比较结果时保持固定。

**问:我需要代理吗?**
不需要。通过住宅 IP 在内部处理流出;您只需发送提示、国家和 `web_search` 标志。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录