ChatGPT स्क्रैपर API: उत्तरों और उद्धरण साक्ष्यों को कैप्चर करें
Advanced Data Extraction Specialist
TL;DR:
- एक ChatGPT उत्तर स्नैपशॉट चुने गए परिस्थितियों के तहत एक अवलोकन को रिकॉर्ड करता है। प्राप्त उत्तर के साथ प्रॉम्प्ट, देश और खोज सेटिंग्स को सहेजें।
- उत्तर संग्रह और वेबपृष्ठ निष्कर्षण विभिन्न समस्याओं को हल करते हैं। एक उत्तर में उद्धरण यह प्रमाणित नहीं करता है कि उद्धृत पृष्ठ हर वाक्य का समर्थन करता है।
- ChatGPT स्क्रैपर API एक कार्य जीवनचक्र का उपयोग करता है। कार्य बनाएँ, उसके पहचानकर्ता को बनाए रखें, और पूर्ण परिणाम को अलग से पढ़ें।
- अलाभ प्रकट करने वाले क्षेत्रों की आवश्यक हैंडलिंग। निगरानी तालिका में कम करने से पहले कच्चे पेलोड को संरक्षित करें।
- शुरू करने के लिए स्वतंत्र। नए Scrapeless खातों में मुफ्त स्क्रैपिंग ब्राउज़र रUNTIME शामिल है — app.scrapeless.com पर साइन अप करें।
परिचय: दृश्यता मापने से पहले उत्तर कैप्चर करें
एक ब्रांड-दृश्यता अवलोकन को वास्तव में वापस की गई उत्तर की आवश्यकता होती है, न कि किसी मॉडल की मेमोरी से पुनर्निर्मित उत्तर। संग्रह के प्रॉम्प्ट और परिस्थितियाँ उस अवलोकन का हिस्सा हैं। एक बदला हुआ प्रॉम्प्ट अनुशंसा और उससे जुड़े स्रोतों दोनों को बदल सकता है।
एक ChatGPT स्क्रैपर API उत्तर दिखाने को डेटा के रूप में संग्रहित करता है। यह एक भाषा मॉडल से पृष्ठों की एक सूची पर जाने और उनके सामग्री को निकालने के लिए नहीं पूछता है। यदि आपका लक्ष्य यही है, तो एक वेबसाइट स्क्रैपर बनाने में मदद करने के लिए ChatGPT का उपयोग करने के लिए कार्यप्रवाह एक अलग अधिग्रहण समस्या को कवर करता है। समान मॉडल नाम दोनों में प्रकट होने पर भी इन दो डेटा सेट को अलग रखें।
यह गाइड वर्तमान Scrapeless कार्य इंटरफ़ेस के चारों ओर एक उत्तर आर्काइव बनाता है। आर्काइव मूल प्रतिक्रिया बाइट्स को संरक्षित करता है, फिर उत्तर और उद्धरण क्षेत्रों का निरीक्षण करता है। यह GEO अनुसंधान टीम को एक उचित अवलोकन इकाई देता है बिना एक उत्तर को एक सार्वभौमिक रैंकिंग के रूप में मानकर।
ChatGPT उत्तर आर्काइव का समर्थन क्या कर सकता है?
एक उत्तर आर्काइव नियंत्रित प्रॉम्प्ट सेट और संग्रह की परिस्थितियों के बीच तुलना का समर्थन करता है। इसका पहला कार्य साक्ष्य को संरक्षित करना है; स्कोरिंग बाद में आती है।
- ब्रांड उल्लेख समीक्षा। जांचें कि क्या एक उत्तर किसी उत्पाद का उल्लेख करता है, और एक अस्पष्ट उपस्ट्रिंग की गिनती करने के बजाय संबंधित अनुच्छेद को बनाए रखें।
- उद्धरण सूची। स्रोत URLs को स्रोत शीर्षकों से अलग से स्टोर करें ताकि एक नामांकित पृष्ठ गलती से एक नए स्रोत में न बदल जाए।
- संदेश विश्लेषण। समान प्रश्न शब्दावली के तहत अनुशंसा के लिए दिए गए कारणों की तुलना करें।
- क्षेत्रीय अवलोकन। संग्रह सेटिंग के रूप में देश को दर्ज करें, जबकि यह पहचानते हुए कि केवल देश हर व्यक्तिगत उपयोगकर्ता सत्र को पुन: उत्पन्न नहीं करता है।
- सामग्री योजना। नए लेख को कौन से साक्ष्य प्रदान करने चाहिए, यह तय करने से पहले उत्तरों में कौन से प्रश्न और स्रोत प्रकार प्रकट होते हैं, इसका निरीक्षण करें।
सार्वजनिक HTTP मानकों के बारे में एक प्रॉम्प्ट एक उपयोगी प्रारंभिक उदाहरण है क्योंकि विषय में स्थिर संदर्भ दस्तावेज हैं। व्यावसायिक अनुशंसा प्रॉम्प्ट उत्तर हैंडलिंग काम करने के बाद आ सकते हैं।
Scrapeless ChatGPT अभिनेता का उपयोग क्यों करें?
Scrapeless ChatGPT अभिनेता उत्तर पाठ और संबंधित स्रोत जानकारी को एक प्रलेखित इंटरफेस के माध्यम से प्रकट करता है। अभिनेता पहचानकर्ता scraper.chatgpt है; वर्तमान ChatGPT उत्तर कैप्चर अनुबंध इसके इनपुट और प्रतिक्रिया क्षेत्रों का वर्णन करता है। यह अभिनेता AI स्क्रैपर उत्पाद होम के तहत है न कि एक अलग उत्पाद मार्ग के तहत।
प्रबंधित इंटरफेस क्लाइंट में चैट-इंटरफेस के चयनकर्ताओं को बनाए रखने की आवश्यकता को हटा देता है। यह सभी उत्तर गुणों को अनिवार्य नहीं बनाता, मॉडल भिन्नता को समाप्त नहीं करता या उद्धरणों को प्रमाणित तथ्यों में नहीं बदलता। ये जिम्मेदारियाँ उत्तर का उपभोग करने वाले अनुप्रयोग पर बनी रहती हैं।
Scrapeless की कीमतें के लिए वर्तमान व्यावसायिक शर्तों की जांच करें इससे पहले कि आप प्रॉम्प्ट संग्रह का विस्तार करें। यह उदाहरण जानबूझकर खरीद डेटा को निष्क्रिय करता है और उत्तर-प्रति-उत्साह का कोई वादा नहीं करता है।
उत्तर संग्रह के लिए पूर्वापेक्षाएँ
Python 3.12, Requests 2.34.2 का उपयोग करें, और ChatGPT अभिनेता तक पहुंच के साथ एक Scrapeless खाता बनाएं। SCRAPELESS_API_KEY को स्थानीय रूप से कॉन्फ़िगर करें; प्रॉम्प्ट, स्रोत फ़ाइलों या सहेजे गए प्रतिक्रिया मेटाडेटा में क्रेडेंशियल न डालें।
प्रमाणित कार्य निर्माण और परिणाम पुनर्प्राप्ति के लिए उस कुंजी की आवश्यकता होती है। उदाहरण को वर्तमान अनुबंध के खिलाफ सिंटेक्स-चेक किया गया है, लेकिन वास्तविक सत्यापन की प्रतीक्षा में प्रमाणित उत्तर कैप्चर लम्बित है जहां क्रेडेंशियल उपलब्ध नहीं हैं। नीचे कोई भी नमूना उत्तर पूर्ण API परिणाम के रूप में प्रस्तुत नहीं किया गया है।
अपने सक्रिय वर्चुअल वातावरण के भीतर HTTP क्लाइंट इंस्टॉल करें:
bash
python -m pip install requests==2.34.2
एक कार्य बनाएँ जिसमें स्पष्ट उत्तर सेटिंग्स हों
टास्क निर्माण एक अभिनेता का नाम और इनपुट ऑब्जेक्ट को वर्तमान अनुरोध अंतिम बिंदु पर भेजता है। prompt और country चैटजीपीटी अभिनेता द्वारा आवश्यक हैं; वैकल्पिक बूलियन्स को स्पष्ट होना चाहिए जब डेटासेट उन पर निर्भर करता हो।
| सेटिंग | उदाहरण विकल्प | क्यों बनाए रखें |
|---|---|---|
prompt |
सार्वजनिक HTTP स्रोतों के बारे में एक प्रश्न | वास्तव में पूछे गए प्रश्न को परिभाषित करता है |
country |
US |
क्षेत्रीय संग्रह की स्थिति को रिकॉर्ड करता है |
web_search |
true |
खोज समृद्धि के लिए अनुरोध करता है; लौटाए गए साक्ष्य का निरीक्षण करें |
shopping |
false |
इस उदाहरण को उत्तर और स्रोत जानकारी पर केंद्रित रखता है |
अंतिम बिंदु POST /api/v2/scraper/request और GET /api/v2/scraper/result/{task_id} हैं। यह न मानें कि एक पुराना सिंगल-कॉल उदाहरण उसी जीवनचक्र का उपयोग करता है। टास्क-निर्माण प्रतिक्रिया पूरा उत्तर नहीं है।
अनुरोध सफलता और एप्लीकेशन पूर्णता के बीच का भेद HTTP प्रतिक्रिया अर्थशास्त्र में भी प्रकट होता है: एक HTTP स्थिति विनिमय का वर्णन करती है, जबकि टास्क की स्थिति कार्य का वर्णन करती है।
Scrapeless के साथ स्क्रैपिंग शुरू करें
Scrapeless के साथ अपने वेब स्क्रैपिंग और स्वचालन कार्यप्रवाह को बढ़ावा दें!
आज ही साइन अप करें और $5 का मुफ्त क्रेडिट प्राप्त करें — क्रेडिट कार्ड की आवश्यकता नहीं।अपना मुफ्त क्रेडिट तुरंत Scrapeless डैशबोर्ड में.claim करें।
क्षेत्र देखने से पहले मूल प्रतिक्रिया बनाए रखें
एक उत्तर संग्राहक को इसे अधिक संकीर्ण स्कीमा में पार्स करने से पहले मूल प्रतिक्रिया को सहेजना चाहिए। जब कोई सेवा अप्रत्याशित लिफाफा लौटाती है या कोई शर्ती क्षेत्र बदलता है, तो यह साक्ष्य को बनाए रखता है।
निम्नलिखित पूर्ण स्क्रिप्ट को chatgpt_capture.py के रूप में सहेजें। नोट: यह ब्लॉक एक वास्तविक API कुंजी की आवश्यकता है और सत्यापित लाइव सत्यापन के लिए लंबित है। सबसे पहले इसे TASK_ID के बिना चलाएँ ताकि एक टास्क बनाया जा सके। निर्माण प्रतिक्रिया को बनाए रखें और इसे बिना के रूप में उपयोग करें TASK_ID जब आप बाद में उसी स्क्रिप्ट का उपयोग करके उस टास्क के परिणाम को पढ़ते हैं।
python
import json
import os
from datetime import datetime, timezone
from pathlib import Path
import requests
root = Path('answer-evidence')
root.mkdir(exist_ok=True)
task_id = os.environ.get('TASK_ID')
headers = {'x-api-token': os.environ['SCRAPELESS_API_KEY']}
settings = {
'prompt': 'Which public sources explain HTTP semantics?',
'country': 'US', 'web_search': True, 'shopping': False
}
if task_id:
response = requests.get(
f'https://api.scrapeless.com/api/v2/scraper/result/{task_id}',
headers=headers, timeout=60)
name = 'result'
else:
response = requests.post(
'https://api.scrapeless.com/api/v2/scraper/request',
headers=headers,
json={'actor': 'scraper.chatgpt', 'input': settings}, timeout=60)
name = 'creation'
# Keep the original bytes, including unsuccessful responses.
stamp = datetime.now(timezone.utc).strftime('%Y%m%dT%H%M%S%fZ')
path = root / f'{name}-{stamp}'
path.with_suffix('.body').write_bytes(response.content)
path.with_suffix('.meta.json').write_text(json.dumps({
'task_id': task_id, 'settings': settings if not task_id else None,
'http_status': response.status_code, 'captured_at': stamp
}, indent=2))
response.raise_for_status()
data = response.json()
if not task_id:
print(json.dumps(data, indent=2))
print('Keep the returned task identifier; set TASK_ID for result retrieval.')
else:
status = data.get('status')
print(json.dumps({'task_id': task_id, 'status': status}))
if status == 'success':
payload = data.get('task_result')
if not isinstance(payload, dict):
raise ValueError('Successful task has no object payload')
if not isinstance(payload.get('result_text'), str):
raise ValueError('Answer text missing; inspect saved raw body')
print(json.dumps({
'answer_characters': len(payload['result_text']),
'citation_field_present': 'content_references' in payload,
'citation_field_type': type(payload.get('content_references')).__name__
}))
स्क्रिप्ट प्रति आवाहन एक अनुरोध बनाता है। यह यह नहीं वादा करता कि टास्क अनुरोध समय सीमा के भीतर समाप्त होता है। इसके पहचानकर्ता क्षेत्र को अनुमानित करने के बजाय सहेजे गए निर्माण लिफाफे का निरीक्षण करें, फिर उस विशेष टास्क को परिणाम अंत बिंदु के माध्यम से पढ़ें।
एक परिणाम जिसमें pending या running है, अधूरा है। एक परिणाम जिसमें failed है, एक विफल प्रेक्षण है, खाली उत्तर नहीं है। success पर, task_result का निरीक्षण करें और अपने अपने संग्रह में पूर्ण परिणामों को तुरंत संग्रहीत करें। टास्क जीवनचक्र स्थिति राज्यों को परिभाषित करता है; इस डिजाइन के लिए एक निश्चित प्रतिधारण वादा अनिवार्य नहीं है।
उद्धरण साक्ष्य को बिना अधिक किए पढ़ें
उद्धरण साक्ष्य उन स्रोतों को रिकॉर्ड करता है जो एक उत्तर के साथ उजागर होते हैं; यह उत्तर की सत्यता को सत्यापित नहीं करता। लौटाया गया URL एक स्रोत लिंक, एक पूरक लिंक या खोज समृद्धि से संबंधित प्रविष्टि हो सकता है। इन श्रेणियों को अलग रखें।
| अभिनेता क्षेत्र | व्याख्या | एप्लिकेशन हैंडलिंग |
|---|---|---|
result_text |
मार्कडाउन उत्तर पाठ | स्वीकार किए गए उत्तर अवलोकन के लिए आवश्यक |
model |
लौटाया गया मॉडल पहचानकर्ता | प्राप्त मान को स्टोर करें; इसे हार्ड-कोड न करें |
web_search |
लौटाया गया खोज-समृद्धि झंडा | अनुरोधित सेटिंग के साथ तुलना करें |
content_references |
उत्तर श्रेय जानकारी, जब उपलब्ध हो | प्रविष्टियों को संरक्षित करें और अनुपस्थित को खाली से अलग करें |
search_result |
खोज-संबंधित प्रविष्टियाँ | जब उपस्थित हो तब शीर्षक, स्निपेट, श्रेय और URL रखें |
links |
पूरक लिंक | हर लिंक को उत्तर उद्धरण के रूप में स्वचालित रूप से नहीं गिनें |
ये दस्तावेजीकृत क्षेत्र के अर्थ हैं, कोई प्रमाणित प्रतिक्रिया उदाहरण नहीं। एक JSON ऑब्जेक्ट सिंटैक्स में मान्य हो सकता है जबकि आपको आवश्यक उत्तर गायब हो; JSON डेटा प्रारूप सिंटैक्स को परिभाषित करता है, कार्य की पूर्णता को नहीं।
उतर आवश्यक गुणों को JSON स्कीमा प्रतिबंधों के साथ अलग से मान्य करें, प्रतिक्रिया से मीट्रिक निकालने से पहले।
एक संग्रह को मूल अनुरोध, टास्क परिणाम और किसी भी व्युत्पन्न स्कोर से जोड़ना चाहिए। वह संबंध डेटा उत्पत्ति का व्यावहारिक मूल्य है। अवलोकन के साथ स्रोत साक्ष्य को स्टोर करें, और स्कोरिंग नियम में बाद में किए गए बदलावों को स्वतंत्र रूप से ट्रेस किया जा सके।
नियंत्रित अवलोकन तालिका बनाएं
एक उपयोगी अवलोकन तालिका उत्तरों को एक स्थिर प्रॉम्प्ट पहचानकर्ता और संग्रहण परिस्थितियों के अनुसार समूहित करती है। इसे कच्चे प्रमाण के लिए एक संकेतक बनाए रखना चाहिए, बजाय उस प्रमाण को एकल दृश्यता स्कोर के साथ प्रतिस्थापित करने के।
prompt_id, सटीक प्रॉम्प्ट पाठ, देश, अनुरोध विकल्प, कार्य पहचानकर्ता, कब्जा करने का समय, कार्य स्थिति और कच्चे परिणाम स्थान को बनाए रखें। ब्रांड उल्लेख और उद्धरण यूआरएल व्युत्पन्न तालिकाओं में डालें। यह आपको संस्थाओं के मिलान के नियमों को बदलने देता है बिना एक अलग उत्तर एकत्र किए जो केवल एक पार्सर की मरम्मत करने के लिए हो।
उत्तर की तुलना केवल तब करें जब प्रश्न और सेटिंग्स तुलना का समर्थन करती हों। एक उत्तर से अनुपस्थित उत्पाद उन परिस्थितियों के तहत एक अवलोकित अनुपस्थिति है; यह प्रमाण नहीं है कि मॉडल कभी उत्पाद की सिफारिश नहीं करता है। इसके विपरीत, एक उत्तर में दिखाई देने वाला उद्धरण यूआरएल सवालों के बीच निरंतर दृश्यता का प्रमाण नहीं है।
सार्वजनिक दृश्यता डेटासेट के लिए खाता इतिहास, निजी वार्तालाप निर्यात या गोपनीय प्रॉम्प्ट एकत्र करने से बचें। यदि कोई टीम सदस्य गलती से ग्राहक जानकारी डालता है तो संग्रहीत प्रॉम्प्ट सामग्री को न्यूनतम करें। आर्काइव में सार्वजनिक अनुसंधान प्रश्न होना चाहिए, न कि असंबंधित व्यक्तिगत संदर्भ।
निष्कर्ष: अवलोकन को बनाए रखें, फिर इसे स्कोर करें
जब ग्राहक अनुरोध स्थितियों, पूर्ण उत्तर और स्रोत सिद्धांत को एक साथ रखता है, तो ChatGPT स्क्रैपर API दृश्यता अनुसंधान के लिए उपयोगी हो जाता है। कार्य जीवनचक्र अवलोकन प्रदान करता है; अनुप्रयोग स्वीकृति नियमों और विश्लेषण को प्रदान करता है।
एक छोटे अनुमोदित प्रॉम्प्ट सेट के साथ प्रारंभ करें। पहले प्रमाणित परिणामों की जांच करें, उनके वास्तविक लिफाफों का मैप बनाएं, और चार्ट बनाने से पहले गुम फील्ड हैंडलिंग को परिभाषित करें। आर्काइव तब उन तुलना का समर्थन कर सकती है जिनके पूर्वधारणाएं स्पष्ट रहती हैं।
क्या आप अपने AI-संचालित डेटा पाइपलाइन के निर्माण के लिए तैयार हैं?
हमारे समुदाय में शामिल हों एक मुफ्त योजना का दावा करने और डेवलपर्स से जुड़ने के लिए जो वेब-डेटा पाइपलाइन बना रहे हैं: Discord · Telegram।
app.scrapeless.com पर साइन अप करें मुफ्त स्क्रैपिंग ब्राउज़र रनटाइम के लिए और ऊपर दिए गए पैटर्न को अपने सार्वजनिक डेटा वर्कफ़्लो के लिए अनुकूलित करें।
सामान्य प्रश्न
प्रश्न: क्या ChatGPT स्क्रैपर API हर उद्धृत वेबपृष्ठ को निकालता है?
नहीं। ChatGPT स्क्रैपर API उत्तर सतह और संबंधित स्रोत जानकारी को एकत्र करता है। उद्धृत वेबपृष्ठों को लाना और मान्य करना एक अलग कार्यप्रवाह है।
प्रश्न: क्या ChatGPT उत्तर एकत्र करना कानूनी है?
अनुमत दायरा संबंधित शर्तों, पहुंच की स्थितियों, अधिकारों और अधिकार क्षेत्र पर निर्भर करता है। अनुमोदित सार्वजनिक डेटा अनुसंधान प्रॉम्प्ट्स का उपयोग करें और उत्पादन संग्रह नीति के लिए कानूनी समीक्षा प्राप्त करें; सार्वजनिक दृश्यता अकेले कोई व्यापक अनुमति नहीं है।
प्रश्न: क्या Python क्लाइंट को अपना प्रॉक्सी चाहिए?
प्रबंधित अभिनेता इसके API के पीछे अधिग्रहण करता है। क्लाइंट दस्तावेजित country पैरामीटर सेट करता है; इस उदाहरण में यह एक अलग ब्राउज़र प्रॉक्सी कॉन्फ़िगर नहीं करता है।
प्रश्न: क्या एक अधूरी या विफल कार्य रिपोर्ट में क्या अर्थ होना चाहिए?
एक अधूरी या विफल कार्य एक अपूर्ण अवलोकन है। इसकी स्थिति और साक्ष्य को स्वीकार किए गए उत्तरों से अलग रखें; इसे बिना उल्लेखों के एक सफल उत्तर के रूप में स्कोर न करें।
प्रश्न: क्या खाली उद्धरण सूची एक वैध परिणाम हो सकती है?
खाली उद्धरण सूची बिना उत्तर पाठ को व्यावहारिक रूप से बेकार किये बिना हो सकती है। रिकॉर्ड करें कि फील्ड अनुपस्थित, शून्य या खाली सूची थी, और वास्तविक परिणाम अनुबंध की समीक्षा करने से पहले उन अवस्थाओं को समान मानने से बचें।
प्रश्न: क्या उत्तर संग्रह बिना एआई एजेंट के चल सकता है?
हाँ। अनुरोध क्लाइंट सीधे दस्तावेजित कार्य अंतिम बिंदुओं से बात करता है। उस क्लाइंट को संचालित करने के लिए कोई एजेंट ढांचा या उत्पन्न स्क्रैपिंग कोड की आवश्यकता नहीं है।
प्रश्न: समानांतर प्रॉम्प्ट संग्रह कैसे शुरू होना चाहिए?
एक कार्य से शुरू करें जिसके पूर्ण जीवनचक्र और आउटपुट की जांच की गई है। बाद में खाते की दस्तावेजित क्षमता और एक सीमित संग्रह योजना लागू करें; यह मार्गदर्शिका कोई सार्वभौमिक थ्रूपुट सीमा प्रदान नहीं करती है।
स्क्रैपलेस में, हम केवल सार्वजनिक रूप से उपलब्ध डेटा का उपयोग करते हैं, जबकि लागू कानूनों, विनियमों और वेबसाइट गोपनीयता नीतियों का सख्ती से अनुपालन करते हैं। इस ब्लॉग में सामग्री केवल प्रदर्शन उद्देश्यों के लिए है और इसमें कोई अवैध या उल्लंघन करने वाली गतिविधियों को शामिल नहीं किया गया है। हम इस ब्लॉग या तृतीय-पक्ष लिंक से जानकारी के उपयोग के लिए सभी देयता को कोई गारंटी नहीं देते हैं और सभी देयता का खुलासा करते हैं। किसी भी स्क्रैपिंग गतिविधियों में संलग्न होने से पहले, अपने कानूनी सलाहकार से परामर्श करें और लक्ष्य वेबसाइट की सेवा की शर्तों की समीक्षा करें या आवश्यक अनुमतियाँ प्राप्त करें।



