De volta ao blog

Como Lidar com Páginas Protegidas por DataDome para Dados da Web Públicos

Ethan Brown
Ethan Brown

Advanced Bot Mitigation Engineer

12-Aug-2026

TL;DR:

  • Páginas protegidas pelo DataDome podem retornar um bloqueio, CAPTCHA, Verificação de Dispositivo ou conteúdo comum. Classifique a representação antes da extração.
  • Um 403 ou lista vazia é um sintoma. Registre a URL final, status, tipo de conteúdo, título, marcadores de desafio, localidade e o campo público necessário.
  • A consistência do navegador e da sessão importa. JavaScript, cookies, origem da rede, impressão digital e sequência de navegação podem afetar o que o site retorna.
  • Use um fluxo de trabalho de página pública delimitada. Aqueça a origem aprovada quando necessário, carregue o alvo na mesma sessão de navegador em nuvem e aceite apenas páginas que satisfaçam um contrato de conteúdo.
  • Não prometa uma solução universal. Pare em CAPTCHA, login, dados privados ou qualquer limite de acesso que o projeto não esteja autorizado a cruzar.

O DataDome pode proteger páginas HTML, aplicações de página única e as APIs que essas páginas chamam. Um scraper pode receber um 403, uma resposta de desafio ou uma página com aparência comum cuja lista esperada nunca carrega.

O fluxo de trabalho seguro é diagnóstico. Identifique qual representação chegou, mantenha a sessão do navegador aprovada consistente e analise os dados apenas depois que a página de destino passe pelas verificações de identidade e de campo.

Como o DataDome Afeta a Página

O DataDome combina integrações do lado do servidor com lógica do lado do navegador. Sua documentação da Tag JavaScript afirma que a tag ajuda a coletar sinais, gerenciar o estado da sessão e exibir páginas de resposta quando chamadas Fetch ou XMLHttpRequest são bloqueadas.

O DataDome também documenta Verificação de Dispositivo, um processo de verificação automatizado que pode permitir conteúdo comum, bloquear o cliente ou apresentar um desafio adicional.

Esses mecanismos explicam possíveis tipos de resposta. Eles não revelam por que um cliente recebeu uma resposta. Geografia, estado do navegador, histórico de tráfego, política do site, estado da aplicação e regras personalizadas podem todos contribuir.

Sintomas, Possíveis Causas e Verificações

Sintoma Possível explicação Primeira verificação
HTTP 403 com HTML Representação de bloqueio ou desafio Tipo de conteúdo, título, marcador do corpo, URL final
HTTP 403 com JSON API protegida retornou dados alternativos Esquema da resposta e recurso solicitado
CAPTCHA ou slider aparece Desafio interativo foi apresentado Pare a interação automatizada e revise o escopo
Status normal com lista vazia Falha na renderização do cliente ou uma chamada de API foi bloqueada Registro de rede e marcador de lista necessário
Direto HTTP falha, navegador funciona O estado do JavaScript ou do navegador afeta o conteúdo Compare a URL final, cookies e marcador renderizado
A primeira página funciona, a próxima falha Sessão ou sequência afeta a representação Mantenha a navegação em um contexto
Dados de mercado errados aparecem Localização ou idioma difere Identifique geografia e localidade necessárias

Não infira uma causa específica a partir de uma única linha. Registre evidências suficientes para comparar mudanças controladas.

Sinais para Manter Consistentes

Origem da rede

Uma rota residencial pode alinhar a localização aparente com o conjunto de dados. O alvo ainda pode avaliar a reputação da rede e o histórico de solicitações. Um proxy muda a origem da rede, não a execução do navegador.

HTTP e TLS

Métodos, cabeçalhos, redirecionamentos e negociação de conteúdo afetam a solicitação. A especificação semântica do HTTP define esses campos. A especificação do TLS 1.3 define o handshake de transporte seguro.

Copiar um cabeçalho de um navegador não reproduz o transporte, tempo de execução e sessão circundantes.

JavaScript e impressão digital

O navegador executa os scripts do site e expõe características de tempo de execução. A integração do lado do navegador do DataDome pode observar a consistência do navegador e do dispositivo. Mantenha a configuração da impressão digital estável dentro do trabalho delimitado.

Cookies e cadeia de sessão

O DataDome documenta um cookie utilizado por sua tag JavaScript e páginas de resposta. Não classifique ou edite manualmente esse estado. Preserve o contexto do navegador para que o site possa gerenciar seus próprios cookies através da navegação pública aprovada.

O fluxo de trabalho público pode começar na origem e prosseguir para uma página de listagem ou de detalhes. Preserve essa sequência quando for necessário. Mantenha o tráfego proporcional e comece com baixa concorrência.

Escolha a Rota de Aquisição

Rota Apropriado quando Condição de aceitação
HTTP Direto Campos públicos necessários existem na resposta inicial Marcador necessário e identidade da página correspondem
Navegador local Interação aprovada necessita de JavaScript Campos renderizados e página canônica passam
Navegador de Scraping Sem Scraping A equipe precisa de renderização gerida em nuvem, geografia e continuidade de sessão Host aprovado, localidade e campos passam
API público suportado O site oferece um contrato adequado O esquema de autorização e resposta correspondem

Comece com a rota mais simples permitida. Mova-se para um navegador apenas quando a página provar que JavaScript ou continuidade é necessário.

Scrapeless Scraping Browser fornece renderização JavaScript do lado da nuvem, roteamento de localização, configuração de impressões digitais e sessões de navegador persistentes. O quickstart do Scraping Browser documenta a duração da sessão e os parâmetros do país do proxy.

Um Fluxo de Trabalho de Web Scraping DataDome Limitado

Um fluxo de trabalho defensável separa a aquisição da extração.

Passo 1 — Defina o contrato de conteúdo

Registre o alvo HTTPS aprovado, o host final esperado, locale, padrão canônico e um seletor de dados públicos necessário. Decida quais campos o conjunto de dados precisa e quais estão fora do escopo.

Passo 2 — Aqueça a origem pública quando necessário

Carregue a origem pública do site no mesmo contexto do navegador antes do alvo aprovado quando isso corresponder ao caminho de navegação comum. Não envie credenciais ou respostas de desafio.

Passo 3 — Carregue o alvo e aguarde um marcador de negócios

Navegue com um tempo limite limitado e aguarde um campo estável, como um ID de item público, cabeçalho ou marco de lista de resultados. Evite nomes de classes gerados quando funções semânticas ou atributos estruturados existirem.

Passo 4 — Verifique a identidade da página

Compare a URL solicitada, URL final, nome do host, título, URL canônica e locale. Uma página de desafio pode retornar um status de transporte normal, portanto, o marcador de negócios requerido permanece obrigatório.

Passo 5 — Descubra a fonte de dados estável

Inspecione o DOM renderizado e a atividade da Rede do navegador autorizado. Prefira campos JSON públicos estáveis ou elementos DOM semânticos. Não exporte cookies sensíveis ou estado de autorização para outro cliente.

Passo 6 — Extraia e classifique

Mapeie campos aprovados em um esquema restrito. Marque cada página como aceita, ausência de conteúdo, página inesperada, revisão de política ou erro de rede antes do armazenamento.

Obtenha sua chave de API no plano gratuito: app.scrapeless.com

O Contrato de Saída

Um registro aceito deve preservar o contexto de origem e validação.

Campo Propósito
requested_url Entrada aprovada
final_url Detecta redirecionamentos e páginas alternativas
canonical_url Confirma a identidade da página
locale Confirma a representação do mercado
observed_at Suporta análise de desvio de origem
validation_state Mantém páginas inesperadas fora dos dados
required_marker_found Impõe aceitação de conteúdo
data Contém apenas campos públicos aprovados

Mantenha documentos de desafio e shells vazios fora do conjunto de dados de negócios. Armazene uma pequena impressão digital diagnóstica separadamente quando a análise operacional exigir.

Solução de Problemas em Páginas Protegidas pelo DataDome

Observação Inspecionar Mudança controlada Condição de aprovação
Resposta 403 Corpo, tipo de conteúdo, URL final Mude para o navegador apenas se o escopo permitir Página pública comum passa
CAPTCHA ou slider Marcador de desafio e política Pare a interação Rota não desafiadora aprovada está disponível
Página correta, lista vazia Atividade de rede e seletor Corrija um problema de renderização ou seletor Marcador de lista necessário aparece
Homepage funciona, detalhe não Cookies de sessão e sequência Mantenha um contexto de navegador Marcador de detalhe passa
Idioma ou moeda errados Geografia e idioma Fixe o mercado aprovado Locale corresponde ao contrato
Resultados variam entre execuções Desvio de origem ou markup randomizado Use localizadores semânticos e IDs estáveis Campos necessários permanecem completos
JSON direto difere da página Autorização ou filtragem da interface do usuário Trate a página visível como fonte do registro Conjunto de dados corresponde à representação definida

Mude uma variável de cada vez. Se a rota, país, perfil do navegador, seletor e alvo mudarem todos, o teste não pode isolar a causa.

Escale Sem Perder Observabilidade

Teste cada modelo público necessário antes de aumentar o tráfego. Comece com três ou menos trabalhadores por host e registre estado de aceitação, duração, locale e modelo de origem.

Escale apenas quando as regras publicadas do site, a autorização do projeto e os resultados de pequenas execuções apoiarem isso. Use verificações de qualidade por modelo para que uma nova representação de desafio não possa se tornar dados válidos.
O guia de melhores práticas do Navegador de Scraping Sem Resíduos cobre escolhas gerais de sessão e renderização para fluxos de trabalho de produção.

Conclusão: Faça da Validação de Conteúdo o Portão

O scraping da web com DataDome deve começar com o diagnóstico de representação, não com mudanças de seletor. Preserve a sessão do navegador aprovada, valide o host e os campos públicos necessários e analise apenas páginas aceitas.

Nenhum navegador ou proxy garante acesso a todas as páginas. Mantenha uma API suportada ou uma rota HTTP direta onde funcione, use renderização em nuvem onde a página pública exigir, e pare em desafios e controles de acesso fora do escopo aprovado.


Junte-se à comunidade Scrapeless para discutir aquisição e validação de páginas públicas: Discord · Telegram.

Revise os preços do Scrapeless, e inscreva-se em app.scrapeless.com para um tempo de execução gratuito do Navegador de Scraping.


FAQ

Q: É legal fazer scraping em um site protegido pelo DataDome?

O scraping pode ser legal para dados públicos ou autorizados, mas as leis, contratos e fatos variam, então revise os termos do site e obtenha aconselhamento jurídico para o projeto.

Q: O DataDome sempre retorna um 403?

As integrações do DataDome podem retornar diferentes representações de bloqueio, desafio, Verificação de Dispositivo ou conteúdo comum, então inspecione o status, corpo, URL final e marcadores de página juntos.

Q: Você precisa de um proxy residencial?

Um proxy residencial pode fornecer uma origem geográfica aprovada, mas o estado do JavaScript, do navegador, cookies, consistência de impressão digital e autorização permanecem requisitos separados.

Q: O que um fluxo de trabalho automatizado deve fazer com um CAPTCHA ou slider?

O fluxo de trabalho deve classificar o CAPTCHA ou slider como uma página inesperada e parar, em vez de automatizar a interação.

Q: Como você deve lidar com a rotação do DOM?

Verifique novamente a página aprovada, prefira localizadores semânticos ou campos estruturados estáveis, e exija um marcador comercial antes de aceitar a saída.

Q: Quanta concorrência o scraper deve usar?

Comece com três ou menos trabalhadores por host e aumente apenas quando as regras do site, a autorização do projeto e a estabilidade observada suportarem isso.

Q: Este fluxo de trabalho pode ser executado sem um agente de IA?

Sim, a configuração de sessão limitada, navegação, validação, extração e classificação são operações determinísticas do navegador.

Na Scorretless, acessamos apenas dados disponíveis ao público, enquanto cumprem estritamente as leis, regulamentos e políticas de privacidade do site aplicáveis. O conteúdo deste blog é apenas para fins de demonstração e não envolve atividades ilegais ou infratoras. Não temos garantias e negamos toda a responsabilidade pelo uso de informações deste blog ou links de terceiros. Antes de se envolver em qualquer atividade de raspagem, consulte seu consultor jurídico e revise os termos de serviço do site de destino ou obtenha as permissões necessárias.

Artigos mais populares

Catálogo