O que é o Common Crawl?
A API Universal de Extração sem Raspagem recupera páginas da web públicas atuais que podem complementar conjuntos de dados da web arquivados em pesquisas e pipelines de dados.
TL;DR
- O Common Crawl é um repositório aberto de dados de rastreamento da web. A organização sem fins lucrativos Common Crawl Foundation publica grandes capturas que pesquisadores e desenvolvedores podem acessar sem construir um rastreador em escala da web.
- O corpus contém várias representações. WARC contém registros brutos de rastreamento, WAT contém metadados derivados e WET contém texto extraído.
- Um índice deve vir antes de um grande download. Os índices CDXJ e URL columnar ajudam os usuários a localizar registros e estimar o escopo antes de ler arquivos de arquivo.
- Um rastreamento é uma amostra, não uma cópia completa da web. A política de descoberta, regras de robôs, temporização do rastreamento, falhas, duplicados e identificação de língua afetam o que aparece.
- O acesso aberto não remove as obrigações a jusante. Os usuários ainda precisam avaliar privacidade, direitos autorais, conteúdo sensível e adequação para o uso planejado.
Common Crawl Definido
O Common Crawl é um projeto sem fins lucrativos que rastreia páginas da web publicamente acessíveis e publica os arquivos resultantes e conjuntos de dados derivados. O Visão geral da Common Crawl Foundation descreve a organização, sua história de coleta e os formatos que fornece. O corpus é utilizado em pesquisas sobre a web, análise de linguagem, experimentos de busca, estudos arquivísticos e pipelines de dados de aprendizado de máquina.
O projeto reduz uma barreira cara: coletar uma amostra ampla da web. Um usuário pode consultar índices, selecionar registros e processar respostas arquivadas sem operar a frota original de rastreamento. O Common Crawl não transforma esses registros em um conjunto de dados pronto para tarefa. Limpeza, deduplicação, identificação de língua, filtragem de qualidade, revisão de segurança e análise legal permanecem como trabalho a jusante.
Cada rastreamento nomeado é uma captura com limites de tempo e sua própria cobertura. Uma página pode estar ausente porque o rastreador não a descobriu, as regras de robôs bloquearam o acesso, o host estava indisponível, o pedido falhou, a URL foi despriorizada ou o conteúdo apareceu após o rastreamento. A presença também tem limites: uma resposta arquivada pode ser um redirecionamento, página de erro, tela de consentimento ou renderização parcial em vez do conteúdo que uma pessoa esperava.
O Common Crawl é, portanto, melhor compreendido como infraestrutura de coleta e um corpus histórico. Ele fornece material bruto e derivado, além de índices. Ele não certifica precisão, representatividade, direitos ou adequação para um modelo ou análise específica. Essas questões pertencem ao usuário que seleciona e transforma os dados.
Como os Dados do Common Crawl são Organizados
O processo de rastreamento descobre URLs, busca respostas e escreve registros em arquivos de arquivo. O Common Crawl identifica seu rastreador como CCBot e publica informações sobre seu comportamento. Os sites podem expressar regras de rastreamento através do robots.txt, cuja sintaxe padrão é definida pelo Protocolo de Exclusão de Robôs.Uma regra afeta o acesso do rastreador; ela não torna o restante da web invisível ou concede uma licença para uso a jusante.
Os arquivos WARC preservam registros brutos de rastreamento. Eles podem conter pedidos HTTP, respostas e metadados de rastreamento. Esta camada é a mais próxima do que o rastreador recebeu e é útil quando cabeçalhos, status, bytes de carga ou tipo de conteúdo são importantes. Os arquivos são comprimidos e particionados, portanto, ler um rastreamento inteiro sem restringir o escopo é caro e desnecessário para a maioria dos projetos.
Os arquivos WAT contêm metadados derivados dos registros brutos, incluindo informações como cabeçalhos e links descobertos. Os arquivos WET contêm texto extraído, que é conveniente para análise de linguagem e texto, mas omite muito da estrutura original. O guia de dados do Common Crawl explica esses formatos e a diferença entre dados brutos, metadados e texto extraído.
Os índices mapeiam URLs e registros de rastreamento para locais no arquivo. Um fluxo de trabalho direcionado consulta um índice, recebe campos como o nome do arquivo de arquivo, deslocamento de bytes e comprimento do registro, e solicita apenas a faixa necessária. Isso é mais rápido e mais barato do que baixar todos os WARC. Projetos analíticos também podem usar o Índice de URL Columnar para filtragem em massa entre domínios, códigos de status, tipos de mídia ou partições de rastreamento.
WARC, WAT, WET e Dados de Índice
Escolher a representação mais leve que preserve as evidências necessárias mantém o trabalho do Common Crawl compreensível e consciente de custos.
| Dimensão | Significado primário | Erro comum |
|---|---|---|
| WARC | Registros brutos de pedidos, respostas e rastreamento. | Usá-lo para cada tarefa apenas de texto sem primeiro restringir URLs. |
| WAT | Metadados derivados como cabeçalhos e informações de link. | Supor que metadados contêm o corpo completo da página. |
| WET | Texto extraído para processamento de texto. | Tratar o texto extraído como uma cópia fiel de layout, tabelas ou scripts. |
| Índice CDXJ | Consulta de URL e localização de arquivo para registros individuais. | Confundir um acerto de índice com prova de que a resposta arquivada é útil. |
| Índice de URL Columnar | Filtragem analítica em massa em um formato columnar. | Escaneando mais partições e colunas do que a pergunta exige. |
Para que o Common Crawl é usado
O corpus suporta projetos que se beneficiam de uma ampla cobertura da web, desde que as escolhas de amostragem e transformação permaneçam visíveis.
Pesquisa web e de linguagem
Pesquisadores medem links, domínios, idiomas, templates e mudanças de conteúdo em grandes amostras.
Busca e recuperação de informações
Equipes constroem índices, experimentos de classificação, coleções de documentos e benchmarks de recuperação a partir de registros selecionados.
Corpora de aprendizado de máquina
Textos filtrados ou subconjuntos multimodais podem suportar pré-treinamento e avaliação após revisão de direitos, qualidade, segurança e duplicação.
Comparação histórica
Crawls sucessivos podem mostrar como um domínio, tópico ou tecnologia web mudou, embora a cobertura do crawl deva ser controlada.
Um Fluxo de Trabalho Prático do Common Crawl
Escreva a pergunta de pesquisa antes de escolher um crawl. Um estudo de língua atual pode precisar da partição mais recente disponível. Uma análise histórica precisa de janelas de tempo comparáveis. Uma auditoria de domínio pode precisar apenas de uma pequena lista de prefixes de URL. A pergunta determina quais IDs de crawl, índices, tipos de arquivo e campos pertencem ao escopo.
Consultando o índice e salvando os parâmetros da consulta. Registre a coleção de crawl, padrão de URL, modo de correspondência, filtros de status, tipos de mídia e qualquer deduplicação aplicada às linhas do índice. Revise uma amostra de resultados antes de iniciar um trabalho em massa. Um índice pode apontar para páginas de login, redirecionamentos, respostas de erro ou subdomínios irrelevantes que compartilham um nome.
Recupere intervalos de bytes para registros WARC selecionados quando a evidência bruta for importante. Verifique a URI alvo do WARC, status da resposta, tipo de conteúdo, horário de captura e carga útil antes da análise. Para análise de texto apenas, compare uma amostra de saída WET com os registros brutos correspondentes para entender o que a etapa de extração removeu ou alterou.
Crie um manifesto de conjunto de dados derivado. Liste IDs de crawl de entrada, versões de código, filtros, listas de bloqueio, modelos de linguagem, limiares de qualidade, método de deduplicação e esquema de saída. Preserve ponteiros de nível de registro de volta para as localizações do WARC quando a política permitir. Essa linhagem permite que outro revisor reconstrua por que um documento entrou ou saiu do conjunto final.
Limites de Cobertura e Qualidade de Dados
O Common Crawl não pode capturar toda a web. A web pública muda continuamente, a descoberta de URLs é desigual e os hosts aplicam diferentes políticas de acesso. Sites grandes podem dominar uma amostra por meio de calendários, parâmetros, espelhos ou páginas geradas. Sites pequenos podem ter poucos links de entrada e receber menos cobertura. Contagens de páginas não se traduzem diretamente em conteúdo representativo.
Renderização é outro limite. Uma resposta de crawler pode conter o HTML inicial em vez da página final que um navegador cria após a execução do JavaScript. A extração WET pode, portanto, estar vazia ou incompleta para interfaces renderizadas pelo cliente. Um navegador atual ou serviço de renderização pode fornecer uma comparação, mas a nova captura não deve ser substituída silenciosamente pela evidência arquivada.
Pipelines de texto podem amplificar ruídos. Navegação, avisos de cookies, cópias extraídas, páginas geradas por máquina, spam e templates repetidos podem sobreviver à extração. Identificadores de linguagem podem classificar erroneamente registros curtos ou de linguagem mista. Filtros de qualidade podem melhorar médias enquanto removem dialetos, troca de código ou idiomas de baixo recurso. Publique estatísticas de nível de fatia e exemplos amostrados.
Disponibilidade aberta não é uma declaração de permissão universal. Um usuário a jusante deve avaliar dados pessoais, obras protegidas por direitos autorais, conteúdo sensível, restrições contratuais e o propósito do processamento. Solicitações de exclusão e remoção também precisam de um caminho documentado em qualquer conjunto de dados derivado. A política de coleta do Common Crawl não substitui a própria revisão legal e ética do usuário.
Como Validar um Conjunto de Dados do Common Crawl
Reportar cobertura por domínio, idioma, tempo, status da resposta, tipo de mídia e concentração de fontes. Inclua a consulta do índice e os identificadores de crawl para que a amostra possa ser reproduzida. Se a análise comparar crawls, normalize para mudanças na descoberta e volume de captura antes de interpretar o movimento do conteúdo como uma mudança na própria web.
Meça duplicatas em vários níveis: carga útil exata, texto normalizado, template e documento quase duplicado. Mantenha a regra e o limiar ao lado do resultado. Um domínio com muitos URLs espelhados pode dominar contagens de outra forma. Ao mesmo tempo, textos legais ou navegação repetidos podem ser melhor removidos no nível de segmento do que descartando a página inteira.
Audite a qualidade da extração com registros pareados. Compare textos WET com cargas úteis WARC selecionadas, verificando títulos, texto principal, tabelas, codificação e boilerplate. Para páginas com muito JavaScript, documente que o arquivo contém apenas a resposta obtida. Não preencha textos renderizados ausentes com suposições.
Acompanhe a proveniência através de cada transformação. Uma linha final deve ser rastreável para um ID de crawl, nome do arquivo WARC, deslocamento, URI alvo, horário de captura e versão de transformação quando viável. Quando um registro é removido, registre a regra e as liberações derivadas afetadas. Isso torna o conjunto de dados sustentável em vez de uma exportação pontual.
Conclusão
O Common Crawl é uma infraestrutura aberta para trabalhar com dados web arquivados. Ele publica grandes coleções de crawls, registros WARC brutos, arquivos derivados WAT e WET e índices que possibilitam acesso direcionado. O projeto livra os usuários de operar um crawler em escala web, mas não entrega um conjunto de dados de pesquisa ou treinamento acabado.
Trabalho útil começa com uma pergunta estreita, uma consulta de índice e um manifesto reproduzível. Cobertura, renderização, duplicação, direitos e qualidade de extração devem ser medidos em vez de assumidos. Quando páginas atuais são adicionadas para comparação, mantenha seu método de aquisição e tempo separados do arquivo.
Pronto para Comparar Dados da Web Arquivados e Atuais?
Use a API de Rastreamento Universal Scrapeless para aquisição de páginas atuais permitidas enquanto retém os ponteiros de registro do Common Crawl e os carimbos de data/hora no mesmo modelo de evidência.
Inscreva-se hoje e ganhe $5 em crédito gratuito — sem cartão de crédito necessário.
Reclame seu crédito de $5 →Perguntas Frequentes
O Common Crawl é um mecanismo de busca?
Não. O Common Crawl publica arquivos de rastreamento da web e índices. Os usuários constroem suas próprias consultas, análises, índices de busca ou conjuntos de dados derivados daqueles materiais.
Qual é a diferença entre WARC e WET?
WARC preserva registros de rastreamento brutos e cargas úteis HTTP. WET contém texto extraído em formato simples, que é mais fácil para processamento de texto, mas perde a estrutura da página e outros detalhes da resposta.
Todo site está incluído no Common Crawl?
Não. Cada rastreamento é uma amostra moldada por descoberta, priorização, regras de robôs, tempo, disponibilidade do host e resultados de solicitações.
Os dados do Common Crawl podem ser usados para treinamento de IA?
Pode ser uma entrada para um pipeline de dados de treinamento, mas os usuários ainda devem filtrar qualidade e segurança, medir duplicação e cobertura, e avaliar direitos, privacidade e uso permitido.
Por que consultar o índice do Common Crawl primeiro?
O índice identifica quais registros correspondem ao alvo e onde eles estão localizados nos arquivos de arquivo, permitindo solicitações de intervalo direcionadas em vez de baixar grandes coleções sem direção.