パープレキシティスクレイパーAPI:引用されたAI回答をデータとしてキャプチャする
Senior Web Scraping Engineer
TL;DR:
- Perplexity ScraperはPerplexityの答えとそのウェブソースをキャプチャします。
scraper.perplexityにプロンプトを送信し、回答テキスト、引用されたウェブ結果、フォローアップ提案、およびメディアを取得します。 - 非同期の二回呼び出しフローです。 プロンプトをPOSTしてタスクを作成し、
task_idで結果をGETします — 実行中は約12秒で答えが返ってきました。 - ウェブソースは構造化されたリストとして返されます。 各
web_resultsエントリにはname、url、およびPerplexityが引き出したsnippetが含まれており、HTML解析は不要です。 - フォローアッププロンプトも取得できます。 Perplexityが提案する次の質問は
related_promptに返され、トピックのマッピングに便利です。 - リクエストごとにウェブ検索をオンにします。 地に根ざした引用付きの答えを得るには、
web_search: trueを設定します。 - 無料で開始できます。 新しいScrapelessアカウントには無料のScraper APIの利用が含まれています — app.scrapeless.comでサインアップしてください。
はじめに:Perplexityの回答とそのソースを読む
Perplexityは引用された回答で評判を築きました:質問を投げかけ、引用元のウェブページが一覧表示された合成された返答を得る。AIの回答で自社ブランドがどのように表示されるかを追跡している人にとって、その引用リストは非常に価値があります — 検索結果ページの現代版であり、10個の青いリンクではなく、回答エンジンによって決定されます。
Scrapeless Perplexity Scraperは、その全体のオブジェクトをデータとして読み取ります。scraper.perplexityアクターにプロンプトを送信し、回答テキスト、背後にあるウェブソース、Perplexityが提案するフォローアップ質問、および表示されるメディアを取得します。このガイドでは、リクエストの形状、最初のcurl、応答スキーマ、Python統合、およびその使用方法をカバーします — 以下のすべてのリクエストと応答はライブAPIに対してキャプチャされました。
できること
- Perplexityの回答テキストをキャプチャ — 完全な合成された返答としてCommonMarkスタイルのMarkdown形式で。
- ウェブソースを読む — Perplexityが引用したページ、それぞれに名前、URL、スニペットが含まれています。
- フォローアップでトピックをマッピング —
related_promptの提案は会話が次にどこへ行くかを示します。 - AIの回答におけるブランド可視性を追跡 — 購入者の質問を実行し、Perplexityが引用するドメインを確認します。
- 地域によってローカライズ —
countryを設定して、その市場のユーザーが見るように回答を表示させます。
Scrapeless Perplexity Scraperの特長
Perplexity Scraperは、AIエンジンの回答をデータとして読むための管理された方法であるScrapeless LLM Chat Scraperラインの一部です。Perplexityに特化して、以下を提供します:
- 単一のリクエスト契約 — プロンプトを送信し、回答、ソース、フォローアップを得る; ブラウザドライブは不要。
- 構造化されたウェブ結果 — ソースはフィールドとして返され、解析用のマークアップはありません。
- 195以上の国における住宅プロキシ — クリーンで地域に適した出口を通じて回答が取得されます。
- フラグとしてのウェブ検索 — 一つのフィールドが地に根ざした引用付きとモデルのみを決定します。
app.scrapeless.comで無料プランのAPIキーを取得してください。
前提条件
- ScrapelessアカウントとAPIキー — app.scrapeless.comでサインアップ
- 最初のリクエストには
curl、統合にはPython 3.10+が必要 - HTTPとJSONの基本的な知識
Perplexity Scraperの動作
フローは二回の呼び出しです:タスクを作成し、その結果を取得します。
リクエストパラメータ
| フィールド | 場所 | 意味 |
|---|---|---|
actor |
トップレベル | scraper.perplexity |
input.prompt |
入力 | Perplexityに尋ねる質問 |
input.country |
入力 | 回答をローカライズするISO国コード |
input.web_search |
入力 | 地に根ざした引用付きの回答を得るためにtrue |
認証は両呼び出しでのx-api-tokenヘッダーです。
curlでの簡単キャプチャ
タスクを作成:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.perplexity",
"input": { "prompt": "New Yorkのおすすめ観光地", "country": "US", "web_search": true }
}'
# { "status": "pending", "task_id": "504f46ef-…" }
次に、task_idで結果を取得:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
応答エンベロープ
statusがsuccessになると、回答とそのソースがtask_resultに入ります:
json
// 説明用サンプル — フィールド形状は正確(ライブキャプチャ); 値は省略
{
"status": "success",
"task_result": {
"prompt": "New Yorkのおすすめ観光地",
"result_text": "ニューヨーク市の必見観光地は以下の通りです…",
"web_results": [
{ "name": "ニューヨーク市でのベスト20のアクティビティ", "url": "https://example.com/nyc", "snippet": "自由の女神から…" }
],
"related_prompt": [
"歴史と建築に焦点を当てた2日間の旅行",
"私は子供たちと一緒に3日間旅行しています"
はい — `input.country`をISOコードに設定し、結果を時間にわたって比較する際に固定してください。
**Q: プロキシは必要ですか?**
いいえ。出口はアクター内で住宅IPを通じて処理されます。送信するのはプロンプト、国、および`web_search`フラグだけです。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



