परिप्रेक्ष्य स्क्रैपर एपीआई: उद्धृत एआई उत्तरों को डेटा के रूप में कैप्चर करें
Senior Web Scraping Engineer
TL;DR:
- Perplexity स्क्रैपर Perplexity के उत्तर को इसके वेब स्रोतों के साथ कैद करता है।
scraper.perplexityको एक प्रॉम्प्ट भेजें; उत्तर पाठ, इसके द्वारा उद्धृत वेब परिणाम, फॉलो-अप सुझाव, और कोई भी मीडिया प्राप्त करें। - यह एक द्वि-कालीन असिंक्रोनस फ़्लो है। काम बनाने के लिए प्रॉम्प्ट को POST करें, फिर
task_idद्वारा परिणाम GET करें — एक वास्तविक दौड़ में उत्तर लगभग 12 सेकंड में वापस आया। - वेब स्रोत एक संरचित सूची के रूप में आते हैं। प्रत्येक
web_resultsप्रविष्टि में एकname, एकurl, और वहsnippetहोता है जिसे Perplexity ने लिया — कोई HTML पार्सिंग नहीं। - आप फॉलो-अप प्रॉम्प्ट भी प्राप्त करते हैं। Perplexity के सुझावित अगले प्रश्न
related_promptमें वापस आते हैं, जो किसी विषय को मानचित्रित करने के लिए उपयोगी हैं। - प्रत्येक अनुरोध के अनुसार वेब खोज चालू करें। ग्राउंडेड, उद्धृत उत्तर पाने के लिए
web_search: trueसेट करें, न कि केवल मॉडल का उत्तर। - शुरू करने के लिए मुफ़्त है। नए Scrapeless खातों में मुफ़्त Scraper API उपयोग शामिल है — app.scrapeless.com पर साइन अप करें।
परिचय: Perplexity का उत्तर और उसके स्रोत पढ़ें
Perplexity ने उद्धृत उत्तरों पर अपनी प्रतिष्ठा बनाई है: एक प्रश्न पूछें, एक संश्लेषित उत्तर प्राप्त करें जिसमें उन वेब पृष्ठों की सूची हो जिनसे उसने लिया है। जो कोई भी देख रहा है कि उनका ब्रांड AI उत्तरों में कैसे प्रदर्शित होता है, वह उद्धरण सूची पुरस्कार है — यह एक खोज परिणाम पृष्ठ के समान है, जो एक उत्तर इंजन द्वारा निर्णयित होता है न कि दस नीले लिंक द्वारा।
Scrapeless Perplexity स्क्रैपर उस पूरे ऑब्जेक्ट को डेटा के रूप में पढ़ता है। आप scraper.perplexity अभिनेता को एक प्रॉम्प्ट भेजते हैं और उत्तर पाठ, उसके पीछे के वेब स्रोत, Perplexity द्वारा सुझाए गए फॉलो-अप प्रश्न, और कोई मीडिया जो वह सामने लाता है, वापस प्राप्त करते हैं। यह गाइड अनुरोध का आकार, एक पहला curl, प्रतिक्रिया खाका, एक पायथन एकीकरण, और इसका उपयोग कैसे करें को कवर करती है — नीचे प्रत्येक अनुरोध और प्रतिक्रिया लाइव API के खिलाफ कैद की गई थी।
आप इसके साथ क्या कर सकते हैं
- Perplexity का उत्तर पाठ कैद करें — पूरा संशSynthesized उत्तर CommonMark-शैली Markdown के रूप में।
- वेब स्रोत पढ़ें — वे पृष्ठ जिन्हें Perplexity ने उद्धृत किया है, प्रत्येक के साथ एक नाम, URL, और स्निपेट।
- फॉलो-अप के साथ एक विषय मानचित्रित करें —
related_promptसुझाव दिखाते हैं कि बातचीत कहाँ जाती है। - AI उत्तरों में ब्रांड दृश्यता को ट्रैक करें — खरीदार प्रश्न चलाएँ और देखें कि Perplexity कौन से डोमेन cites करता है।
- क्षेत्र के अनुसार स्थानीयकरण करें — उत्तर देखने के लिए
countryसेट करें जैसे कि उस बाजार में उपयोगकर्ता होता।
Scrapeless Perplexity स्क्रैपर क्यों
Perplexity स्क्रैपर Scrapeless LLM चैट स्क्रैपर लाइन का हिस्सा है, जो AI-इंजन उत्तरों को डेटा के रूप में पढ़ने का प्रबंधित तरीका है। विशेष रूप से Perplexity के लिए, यह लाता है:
- एकल अनुरोध अनुबंध — एक प्रॉम्प्ट भेजें, उत्तर, स्रोत, और फॉलो-अप प्राप्त करें; चलाने के लिए कोई ब्राउज़र नहीं।
- संरचित वेब परिणाम — स्रोत क्षेत्र के रूप में वापस आते हैं, पार्स करने के लिए मार्कअप नहीं।
- 195+ देशों में आवासीय प्रॉक्सी — उत्तर साफ, क्षेत्र-उपयुक्त एग्रीज के माध्यम से प्राप्त होते हैं।
- एक ध्वज के रूप में वेब खोज — एक क्षेत्र ग्राउंडेड-और-उद्धृत बनाम केवल मॉडल के द्वारा निर्णयित करता है।
अपना API कुंजी मुफ्त योजना पर app.scrapeless.com पर प्राप्त करें।
पूर्वापेक्षाएँ
- एक Scrapeless खाता और API कुंजी — app.scrapeless.com पर साइन अप करें
- पहले अनुरोध के लिए
curl, और एकीकरण के लिए Python 3.10+ - HTTP और JSON के साथ मूल परिचितता
Perplexity स्क्रैपर कैसे काम करता है
प्रवाह दो कॉल हैं: एक कार्य बनाएं, फिर उसका परिणाम प्राप्त करें।
अनुरोध पैरामीटर
| फ़ील्ड | स्थान | अर्थ |
|---|---|---|
actor |
शीर्ष स्तर | scraper.perplexity |
input.prompt |
इनपुट | Perplexity से पूछने के लिए प्रश्न |
input.country |
इनपुट | उत्तर को स्थानीय बनाने के लिए ISO देश का कोड |
input.web_search |
इनपुट | ग्राउंडेड, उद्धृत उत्तर के लिए true |
प्रमाणन दोनों कॉलों पर x-api-token हेडर है।
कर्ल के साथ त्वरित कैप्चर
कार्य बनाएँ:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.perplexity",
"input": { "prompt": "Recommended attractions in New York", "country": "US", "web_search": true }
}'
# { "status": "pending", "task_id": "504f46ef-…" }
फिर task_id द्वारा परिणाम प्राप्त करें:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
प्रतिक्रिया लिफाफा
एक बार जब status success हो जाता है, उत्तर और इसके स्रोत task_result में होते हैं:
json
// चित्रात्मक उदाहरण — फ़ील्ड आकार सटीक है (सीधे कैद की गई); मान संक्षिप्त
{
"status": "success",
"task_result": {
"prompt": "Recommended attractions in New York",
"result_text": "Here are some must-see attractions in New York City…",
"web_results": [
{ "name": "20 Best Things to Do in NYC", "url": "https://example.com/nyc", "snippet": "From the Statue of Liberty to…" }
],
"related_prompt": [
// ...
]
}
}
"इतिहास और वास्तुकला पर ध्यान केंद्रित करें दो दिन की यात्रा के लिए", "मैं अपने बच्चों के साथ तीन दिनों तक यात्रा कर रहा हूँ"
हाँ - input.country को एक ISO कोड पर सेट करें, और समय के साथ परिणामों की तुलना करते समय इसे स्थिर रखें।
प्रश्न: क्या मुझे प्रॉक्सी की आवश्यकता है?
नहीं। आउटगोइंग ट्रैफ़िक अभिनेता के अंदर आवासीय आईपी द्वारा संभाला जाता है; आपको केवल प्रॉम्प्ट, देश और web_search ध्वज भेजना है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



