¿Qué es Common Crawl? Formatos de datos, índices y usos

¿Qué es Common Crawl?

La API de raspado universal sin desperdicios recupera páginas web públicas actuales que pueden complementar conjuntos de datos web archivados en investigaciones y tuberías de datos.

Resumen

  • Common Crawl es un repositorio abierto de datos de rastreo web. La organización sin fines de lucro Common Crawl Foundation publica grandes capturas a las que los investigadores y desarrolladores pueden acceder sin construir un rastreador a escala web.
  • El corpus contiene varias representaciones. WARC contiene registros de rastreo en bruto, WAT contiene metadatos derivados, y WET contiene texto plano extraído.
  • Un índice debe venir antes de una descarga grande. Los índices de URL CDXJ y columnar ayudan a los usuarios a localizar registros y estimar el alcance antes de leer archivos de archivo.
  • Un rastreo es una muestra, no una copia completa de la web. La política de descubrimiento, las reglas de robots, el tiempo de rastreo, los fallos, los duplicados y la identificación del lenguaje afectan lo que aparece.
  • El acceso abierto no elimina las obligaciones aguas abajo. Los usuarios aún deben evaluar la privacidad, los derechos de autor, el contenido sensible y la idoneidad para el uso planeado.

Common Crawl Definido

Common Crawl es un proyecto sin fines de lucro que rastrea páginas web de acceso público y publica los archivos resultantes y conjuntos de datos derivados. El Resumen de la Fundación Common Crawl describe la organización, su historia de colección y los formatos que proporciona. El corpus se utiliza en investigaciones web, análisis de lenguaje, experimentos de búsqueda, estudios de archivo y tuberías de datos de aprendizaje automático.

El proyecto reduce una barrera costosa: recopilar una amplia muestra de la web. Un usuario puede consultar índices, seleccionar registros y procesar respuestas archivadas sin operar la flota de rastreo original. Common Crawl no convierte esos registros en un conjunto de datos listo para la tarea. La limpieza, la deduplicación, la identificación del lenguaje, el filtrado de calidad, la revisión de seguridad y el análisis legal siguen siendo trabajos aguas abajo.

Cada rastreo nombrado es una captura limitada en el tiempo con su propia cobertura. Una página puede estar ausente porque el rastreador no la descubrió, las reglas de robots bloquearon el acceso, el host no estaba disponible, la solicitud falló, la URL fue despriorizada o el contenido apareció después del rastreo. La presencia también tiene límites: una respuesta archivada puede ser una redirección, una página de error, una pantalla de consentimiento o un renderizado parcial en lugar del contenido que una persona esperaba.

Por lo tanto, Common Crawl se comprende mejor como infraestructura de colección y un corpus histórico. Proporciona material en bruto y derivado más índices. No certifica la precisión, la representatividad, los derechos o la idoneidad para un modelo o análisis particular. Esas preguntas pertenecen al usuario que selecciona y transforma los datos.

Cómo se organiza el dato de Common Crawl

El proceso de rastreo descubre URL, obtiene respuestas y escribe registros en archivos de archivo. Common Crawl identifica su rastreador como CCBot y publica información sobre su comportamiento. Los sitios pueden expresar reglas de rastreo a través de robots.txt, cuya sintaxis estándar está definida por el Protocolo de Exclusión de Robots.Una regla afecta el acceso del rastreador; no hace que el resto de la web sea invisible ni otorga una licencia para el uso aguas abajo.

Los archivos WARC preservan registros de rastreo en bruto. Pueden contener solicitudes HTTP, respuestas y metadatos de rastreo. Esta capa está más cerca de lo que recibió el rastreador y es útil cuando importan encabezados, estado, bytes de carga o tipo de contenido. Los archivos están comprimidos y particionados, por lo que leer un rastreo completo sin reducir el alcance es costoso y innecesario para la mayoría de los proyectos.

Los archivos WAT contienen metadatos derivados de los registros en bruto, incluyendo información como encabezados y enlaces descubiertos. Los archivos WET contienen texto plano extraído, que es conveniente para el análisis de lenguaje y texto, pero omite gran parte de la estructura original. La guía de datos de Common Crawl explica estos formatos y la diferencia entre datos en bruto, metadatos y texto extraído.

Los índices mapean URL y registros de rastreo a ubicaciones en el archivo. Un flujo de trabajo dirigido consulta un índice, recibe campos como el nombre del archivo de archivo, el desplazamiento en bytes y la longitud del registro, y luego solicita solo el rango necesario. Esto es más rápido y barato que descargar cada WARC. Los proyectos analíticos también pueden usar el Índice de URL columnar para filtrado masivo a través de dominios, códigos de estado, tipos de medios o particiones de rastreo.

WARC, WAT, WET e Índice de Datos

Elegir la representación más ligera que preserve la evidencia requerida mantiene el trabajo de Common Crawl comprensible y consciente de los costos.

DimensiónSignificado primarioError común
WARCRegistros de solicitudes, respuestas y rastreo en bruto.Usarlo para cada tarea solo de texto sin primero reducir las URL.
WATMetadatos derivados como encabezados e información de enlaces.Suponer que los metadatos contienen el cuerpo completo de la página.
WETTexto plano extraído para procesamiento de texto.Tratar el texto extraído como una copia fiel del diseño, tablas o scripts.
Índice CDXJBúsqueda de URL y ubicación de archivo para registros individuales.Confundir un acierto de índice con prueba de que la respuesta archivada es útil.
Índice de URL columnarFiltrado analítico a granel en un formato columnar.Escaneando más particiones y columnas de las que requiere la pregunta.

Para qué se utiliza Common Crawl

El corpus apoya proyectos que se benefician de una amplia cobertura web, siempre que las elecciones de muestreo y transformación se mantengan visibles.

Investigación web y de lenguas

Los investigadores miden enlaces, dominios, idiomas, plantillas y cambios de contenido a través de grandes muestras.

Búsqueda y recuperación de información

Los equipos construyen índices, experimentos de clasificación, colecciones de documentos y puntos de referencia de recuperación a partir de registros seleccionados.

Corpora de aprendizaje automático

El texto filtrado o subconjuntos multimodales pueden apoyar el preentrenamiento y la evaluación después de la revisión de derechos, calidad, seguridad y duplicación.

Comparación histórica

Los rastreos sucesivos pueden mostrar cómo un dominio, tema o tecnología web ha cambiado, aunque la cobertura del rastreo debe ser controlada.

Un flujo de trabajo práctico de Common Crawl

Escribe la pregunta de investigación antes de elegir un rastreo. Un estudio de idioma actual puede necesitar la partición más reciente disponible. Un análisis histórico necesita ventanas de tiempo comparables. Una auditoría de dominio puede necesitar solo una pequeña lista de prefijos de URL. La pregunta determina qué IDs de rastreo, índices, tipos de archivo y campos pertenecen al alcance.

Consulta el índice y guarda los parámetros de la consulta. Registra la colección de rastreo, el patrón de URL, el modo de coincidencia, los filtros de estado, los tipos de medios y cualquier deduplicación aplicada a las filas del índice. Revisa una muestra de aciertos antes de lanzar un trabajo a granel. Un índice puede apuntar a páginas de inicio de sesión, redirecciones, respuestas de error o subdominios irrelevantes que compartan un nombre.

Recupera rangos de bytes para registros WARC seleccionados cuando la evidencia en crudo importa. Verifica el URI de destino WARC, el estado de la respuesta, el tipo de contenido, el tiempo de captura y la carga útil antes de analizar. Para análisis solo de texto, compara una muestra de salida WET con los registros en crudo correspondientes para entender qué eliminó o cambió la etapa de extracción.

Crea un manifiesto de conjunto de datos derivado. Enumera los IDs de rastreo de entrada, versiones de código, filtros, listas de bloqueo, modelos de lenguaje, umbrales de calidad, método de deduplicación y esquema de salida. Preserva los punteros a nivel de registro de vuelta a las ubicaciones WARC cuando la política lo permita. Esa línea permite a otro revisor reconstruir por qué un documento entró o salió del conjunto final.

Cobertura y límites de calidad de datos

Common Crawl no puede capturar toda la web. La web pública cambia continuamente, el descubrimiento de URL es desigual y los hosts aplican diferentes políticas de acceso. Los sitios web grandes pueden dominar una muestra a través de calendarios, parámetros, espejos o páginas generadas. Los sitios pequeños pueden tener pocos enlaces entrantes y recibir menos cobertura. Los conteos de páginas no se traducen directamente en contenido representativo.

El renderizado es otro límite. Una respuesta de un rastreador puede contener el HTML inicial en lugar de la página final que un navegador crea después de ejecutar JavaScript. La extracción WET puede, por lo tanto, estar vacía o incompleta para interfaces renderizadas por clientes. Un navegador actual o servicio de renderizado puede proporcionar una comparación, pero la nueva captura no debe ser sustituida silenciosamente por la evidencia archivada.

Las tuberías de texto pueden amplificar el ruido. La navegación, los avisos de cookies, las copias raspadas, las páginas generadas por máquinas, el spam y las plantillas repetidas pueden sobrevivir a la extracción. Los identificadores de idioma pueden clasificar incorrectamente registros cortos o de múltiples idiomas. Los filtros de calidad pueden mejorar los promedios al eliminar dialectos, cambios de código o lenguas de pocos recursos. Publica estadísticas a nivel de cortes y ejemplos muestreados.

La disponibilidad abierta no es una declaración de permiso universal. Un usuario a nivel inferior debe evaluar datos personales, obras con derechos de autor, contenido sensible, restricciones contractuales y la finalidad del procesamiento. Las solicitudes de exclusión y eliminación también necesitan un camino documentado en cualquier conjunto de datos derivado. La política de colección de Common Crawl no reemplaza la revisión legal y ética del usuario.

Cómo validar un conjunto de datos de Common Crawl

Informa la cobertura por dominio, idioma, tiempo, estado de respuesta, tipo de medio y concentración de fuentes. Incluye la consulta del índice y los identificadores de rastreo para que la muestra pueda ser reproducida. Si el análisis compara rastreos, normaliza los cambios en el descubrimiento y el volumen de captura antes de interpretar el movimiento de contenido como un cambio en la web misma.

Mide duplicados en varios niveles: carga útil exacta, texto normalizado, plantilla y documento casi duplicado. Mantén la regla y el umbral junto al resultado. Un dominio con muchas URLs espejadas puede dominar los conteos de otra manera. Al mismo tiempo, el texto legal repetido o la navegación pueden ser mejor eliminados a nivel de segmento que descartando toda la página.

Audita la calidad de extracción con registros emparejados. Compara el texto WET contra cargas útiles WARC seleccionadas, verificando títulos, texto principal, tablas, codificación y boilerplate. Para páginas pesadas en JavaScript, documenta que el archivo contiene solo la respuesta obtenida. No llenes el texto renderizado faltante con suposiciones.

Rastrea la procedencia a través de cada transformación. Una fila final debe ser rastreable hasta un ID de rastreo, nombre de archivo WARC, desplazamiento, URI de destino, tiempo de captura y versión de transformación donde sea posible. Cuando un registro es eliminado, registra la regla y las versiones derivadas afectadas. Esto hace que el conjunto de datos sea mantenible en lugar de una exportación única.

Conclusión

Common Crawl es una infraestructura abierta para trabajar con datos web archivados. Publica grandes colecciones de rastreos, registros WARC en crudo, archivos WAT y WET derivados, e índices que hacen posible el acceso dirigido. El proyecto ahorra a los usuarios de operar un rastreador a escala web, pero no entrega un conjunto de datos de investigación o entrenamiento terminado.

El trabajo útil comienza con una pregunta estrecha, una consulta de índice y un manifiesto reproducible. La cobertura, el renderizado, la duplicación, los derechos y la calidad de extracción deben medirse en lugar de asumirse. Cuando se agregan páginas actuales para comparación, mantenga su método de adquisición y tiempo separados del archivo.

¿Listo para comparar datos web archivados y actuales?

Utilice la API de extracción universal Scrapeless para la adquisición de páginas actuales permitidas mientras retiene los punteros de registro de Common Crawl y las marcas de tiempo en el mismo modelo de evidencia.

Regístrese hoy y obtenga $5 en crédito gratissin tarjeta de crédito requerida.

Reclama tu crédito de $5 →

Preguntas frecuentes

¿Es Common Crawl un motor de búsqueda?

No. Common Crawl publica archivos de crawls web e índices. Los usuarios crean sus propias consultas, análisis, índices de búsqueda o conjuntos de datos derivados de esos materiales.

¿Cuál es la diferencia entre WARC y WET?

WARC preserva registros de crawl en crudo y cargas útiles de HTTP. WET contiene texto extraído sin formato, que es más fácil para el procesamiento de texto pero pierde la estructura de la página y otros detalles de respuesta.

¿Está incluido cada sitio web en Common Crawl?

No. Cada crawl es una muestra moldeada por el descubrimiento, la priorización, las reglas de robots, el tiempo, la disponibilidad del host y los resultados de solicitud.

¿Se puede usar la data de Common Crawl para entrenamiento de IA?

Puede ser una entrada para una tubería de datos de entrenamiento, pero los usuarios aún deben filtrar calidad y seguridad, medir duplicación y cobertura, y evaluar derechos, privacidad y uso permitido.

¿Por qué consultar primero el índice de Common Crawl?

El índice identifica qué registros coinciden con el objetivo y dónde se encuentran en los archivos de archivo, lo que permite solicitudes de rango específicas en lugar de descargar grandes colecciones a ciegas.

Referencias