API do Scraper Perplexity: Capture Respostas de IA Citadas como Dados
Senior Web Scraping Engineer
TL;DR:
- O Scraper do Perplexity captura a resposta do Perplexity com suas fontes da web. Envie um prompt para
scraper.perplexity; receba de volta o texto da resposta, os resultados da web que ele citou, sugestões de perguntas de acompanhamento e qualquer mídia. - É um fluxo assíncrono de duas chamadas. POST o prompt para criar uma tarefa, depois GET o resultado pelo
task_id— em uma execução ao vivo, a resposta voltou em cerca de 12 segundos. - As fontes da web vêm como uma lista estruturada. Cada entrada de
web_resultstem umname, umurle osnippetde onde o Perplexity se baseou — sem análise de HTML. - Você também recebe os prompts de acompanhamento. As perguntas sugeridas a seguir pelo Perplexity são retornadas em
related_prompt, útil para mapear um tópico. - Ative a pesquisa na web por solicitação. Defina
web_search: truepara obter a resposta fundamentada e citada em vez de uma resposta apenas do modelo. - Grátis para começar. Novas contas do Scrapeless incluem uso gratuito da API Scraper — inscreva-se em app.scrapeless.com.
Introdução: leia a resposta do Perplexity e suas fontes
O Perplexity construiu sua reputação em respostas citadas: faça uma pergunta, obtenha uma resposta sintetizada com as páginas da web que ele usou listadas ao lado. Para quem está acompanhando como sua marca aparece nas respostas de IA, essa lista de citações é o prêmio — é o equivalente moderno de uma página de resultados de busca, decidida por um motor de respostas em vez de dez links azuis.
O Scraper de Perplexidade do Scrapeless lê todo esse objeto como dados. Você envia um prompt para o ator scraper.perplexity e recebe de volta o texto da resposta, as fontes da web por trás dela, as perguntas de acompanhamento que o Perplexity sugere e qualquer mídia que ele encontrou. Este guia cobre a forma do pedido, um primeiro curl, o esquema de resposta, uma integração em Python e como usá-la — cada pedido e resposta abaixo foi capturado contra a API ao vivo.
O que você pode fazer com isso
- Capturar o texto da resposta do Perplexity — a resposta completa sintetizada em Markdown estilo CommonMark.
- Ler as fontes da web — as páginas citadas pelo Perplexity, cada uma com um nome, URL e snippet.
- Mapear um tópico com perguntas de acompanhamento — as sugestões
related_promptmostram para onde a conversa vai a seguir. - Rastrear a visibilidade da marca nas respostas de IA — faça perguntas de compradores e veja quais domínios o Perplexity cita.
- Localizar por região — defina
countrypara ver a resposta como um usuário naquele mercado veria.
Por que o Scraper do Perplexity do Scrapeless
O Scraper do Perplexity faz parte da linha de Scrapers de Chat LLM do Scrapeless, a maneira gerenciada de ler respostas de motores de IA como dados. Para o Perplexity especificamente, ele traz:
- Um contrato de solicitação único — envie um prompt, obtenha a resposta, fontes e acompanhamentos; sem navegador a ser acionado.
- Resultados da web estruturados — as fontes retornam como campos, não como marcação a ser analisada.
- Proxies residenciais em mais de 195 países — as respostas são obtidas através de egressos limpos e apropriados à região.
- Pesquisa na web como uma flag — um campo decide resposta fundamentada e citada vs. respostas apenas do modelo.
Obtenha sua chave da API no plano gratuito em app.scrapeless.com.
Pré-requisitos
- Uma conta do Scrapeless e chave da API — inscreva-se em app.scrapeless.com
curlpara o primeiro pedido e Python 3.10+ para a integração- Familiaridade básica com HTTP e JSON
Como funciona o Scraper do Perplexity
O fluxo é de duas chamadas: crie uma tarefa, depois busque seu resultado.
Parâmetros da solicitação
| Campo | Onde | Significado |
|---|---|---|
actor |
nível superior | scraper.perplexity |
input.prompt |
entrada | a pergunta a ser feita ao Perplexity |
input.country |
entrada | código de país ISO para localizar a resposta |
input.web_search |
entrada | true para uma resposta fundamentada e citada |
A autenticação é o cabeçalho x-api-token em ambas as chamadas.
Captura rápida com curl
Crie a tarefa:
bash
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"actor": "scraper.perplexity",
"input": { "prompt": "Atrações recomendadas em Nova Iorque", "country": "US", "web_search": true }
}'
# { "status": "pending", "task_id": "504f46ef-…" }
Então busque o resultado pelo task_id:
bash
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
-H "x-api-token: ${SCRAPELESS_API_KEY}"
Envelope de resposta
Uma vez que o status é success, a resposta e suas fontes estão em task_result:
json
// amostra ilustrativa — a forma do campo é exata (capturada ao vivo); valores abreviados
{
"status": "success",
"task_result": {
"prompt": "Atrações recomendadas em Nova Iorque",
"result_text": "Aqui estão algumas atrações imperdíveis na cidade de Nova Iorque…",
"web_results": [
{ "name": "20 Melhores Coisas para Fazer em NYC", "url": "https://example.com/nyc", "snippet": "Desde a Estátua da Liberdade até…" }
],
"related_prompt": [
"Foque na história e arquitetura para uma viagem de dois dias",
"Estou viajando com meus filhos por três dias"
Sim — defina `input.country` para um código ISO e mantenha-o fixo ao comparar resultados ao longo do tempo.
**P: Preciso de um proxy?**
Não. A saída é gerida dentro do ator através de IPs residenciais; você só envia o prompt, o país e a flag `web_search`.
Na Scorretless, acessamos apenas dados disponíveis ao público, enquanto cumprem estritamente as leis, regulamentos e políticas de privacidade do site aplicáveis. O conteúdo deste blog é apenas para fins de demonstração e não envolve atividades ilegais ou infratoras. Não temos garantias e negamos toda a responsabilidade pelo uso de informações deste blog ou links de terceiros. Antes de se envolver em qualquer atividade de raspagem, consulte seu consultor jurídico e revise os termos de serviço do site de destino ou obtenha as permissões necessárias.



