Một Web Crawler là gì? Các loại, ứng dụng và giới hạn phạm vi

Một Web Crawler là gì?

Scrapeless Crawl cung cấp các tùy chọn thu thập trang web đệ quy và đầu ra trang cho quy trình công việc dữ liệu web.

Một web crawler là phần mềm hệ thống phát hiện và truy cập các tài nguyên web dưới một chính sách xác định. Nó có thể theo liên kết từ các trang hạt giống, sử dụng danh sách xuất bản và ghi lại những gì nó tìm thấy. Các công cụ tìm kiếm sử dụng crawlers, nhưng crawling cũng hỗ trợ kiểm toán trang web và các nhiệm vụ thu thập khác nhau.

Mục đích của crawler xác định ý nghĩa của các mục tiêu của nó. Một crawler tìm kiếm, một crawler di chuyển trang thuộc sở hữu và một crawler nghiên cứu tập trung có thể truy cập cùng một trang vì những lý do khác nhau. Định nghĩa mục đích và ranh giới phạm vi trước khi chọn một công cụ hoặc diễn giải kết quả của nó.

TL;DR

  • Crawlers xây dựng một danh sách tài nguyên quan sát được. Danh sách đó phụ thuộc vào các hạt giống và chính sách thu thập.
  • Xếp hạng tìm kiếm là một giai đoạn riêng biệt. Lấy một trang không đảm bảo sự bao gồm trong kết quả tìm kiếm.
  • Crawling có thể hỗ trợ nhiều nhiệm vụ có phạm vi khác nhau. Kiểm toán trang, di chuyển và nghiên cứu cho phép có các nhu cầu đầu ra khác nhau.
  • Các tuyên bố về phạm vi cần một bộ tham khảo. Một hàng đợi đã cạn không chứng minh rằng mọi trang đều có trong kết quả.

Điều gì làm cho phần mềm trở thành một Web Crawler

Một crawler truy cập có hệ thống vào các tài nguyên và thường phát hiện ra các tài nguyên bổ sung trong quá trình đó. Một công cụ lấy một trang web đã cung cấp có thể thực hiện một phần của việc crawl, nhưng việc phát hiện đệ quy và lập lịch phân biệt quy trình công việc crawling với tải xuống độc lập.

Định nghĩa web crawler miêu tả vai trò cơ bản. Một crawler có thể thu thập tài liệu để xử lý sau, ghi lại liên kết hoặc chuyển nội dung trang sang một giai đoạn khác. Từ này không ngụ ý một sản phẩm thương mại cụ thể hoặc một quy mô cụ thể.

“Spider” và “bot” cũng được sử dụng cho các crawler, mặc dù bot là một loại phần mềm tự động rộng hơn. Một số bot gửi biểu mẫu hoặc giám sát một điểm cuối cố định mà không thực hiện việc khám phá web. Nêu hành vi thực tế khi thảo luận về trách nhiệm của một hệ thống.

Kiến trúc crawling tách biệt việc khám phá và lập lịch với các sử dụng sau của nội dung đã tải xuống. Sự tách biệt đó hữu ích khi giải thích lý do tại sao một crawler có thể tạo ra một danh sách mà không cần trích xuất các trường kinh doanh mà một scraper cần.

Crawlers Tìm Kiếm và Chỉ Mục Tìm Kiếm

Crawlers tìm kiếm thu thập tài nguyên cho các hệ thống có thể sau này chỉ mục và xếp hạng nội dung của chúng. Crawling, xếp hạng và chỉ mục là các hoạt động khác nhau, ngay cả khi một dịch vụ thực hiện tất cả chúng.

Một crawler có thể phát hiện một URL và quyết định không lấy nó theo chính sách hiện tại của nó. Một tài liệu đã thu thập có thể không thích hợp cho việc chỉ mục hoặc có thể trùng lặp với một tài nguyên khác. Sự xuất hiện của nó trong kết quả tìm kiếm phụ thuộc vào các quyết định sau này ngoài thực tế rằng nó đã được truy cập.

Đối với chủ sở hữu trang, điều này có nghĩa là một mục nhật ký máy chủ từ một crawler là bằng chứng của một yêu cầu, không phải bằng chứng rằng trang đã vào một chỉ mục tìm kiếm. Sử dụng các công cụ kiểm tra của nền tảng tìm kiếm liên quan để đánh giá trạng thái sau đó thay vì suy diễn nó chỉ từ một lần truy cập.

Tương tự, một crawler danh sách riêng không cung cấp bằng chứng về phạm vi tìm kiếm của công cụ tìm kiếm. Nó có thể giúp xác định các liên kết hỏng hoặc các tài nguyên bị thiếu trong một phạm vi đã thống nhất, nhưng các quy tắc phát hiện và môi trường thực thi của nó khác với crawler của một nhà điều hành khác.

Giữ câu hỏi chính xác: URL có được phát hiện, lấy, kiểm tra, chỉ mục hay hiển thị cho một truy vấn không? Bằng chứng khác nhau trả lời mỗi câu hỏi. Kết hợp chúng dưới một nhãn “thành công crawl” duy nhất che giấu giai đoạn cần chú ý.

Crawlers Tập Trung, Duy Trì và Tăng Trưởng

Các loại crawler mô tả mục đích và chính sách thu thập hơn là các lớp sản phẩm phổ quát nghiêm ngặt. Một crawler tập trung ưu tiên các tài nguyên liên quan đến một chủ đề; một crawler trang web giữ vững trong một phạm vi trang web đã thống nhất; một crawler tăng trưởng thường xuyên truy cập lại các tài nguyên đã biết theo chính sách làm mới.

Mẫu CrawlerCâu hỏi chínhĐầu ra để xem xét
Thu thập tìm kiếmTài nguyên nào mà hệ thống tìm kiếm nên kiểm tra?Tài liệu và tín hiệu cho việc chỉ mục sau này.
Kiểm toán trang thuộc sở hữuĐiều gì có thể truy cập trong trang web đã được phê duyệt?Trạng thái URL, liên kết và thuộc tính trang.
Nghiên cứu tập trungTài nguyên nào được phép phù hợp với chủ đề?Tài liệu liên quan có ngữ cảnh nguồn.
Làm mới tăng trưởngTài nguyên nào đã biết cần một quan sát khác?Nội dung đã cập nhật và bằng chứng làm mới.

Các mẫu này có thể chồng chéo. Một bộ sưu tập tài liệu có thể giữ trong một trang web, ưu tiên các phần đã chọn và làm mới các tài nguyên đã biết sau đó. Chọn các điều khiển dựa trên những yêu cầu đó thay vì giả định một tên loại bao gồm mọi nhu cầu.

Một chính sách làm mới nên phản ánh mục đích. Các tài nguyên thường xuyên thay đổi và các trang tham khảo ổn định có thể cần xử lý khác nhau. Chính sách là lựa chọn của dự án và nên được biện minh bởi thông tin mà người dùng cần.

Các trình thu thập dữ liệu và trình trích xuất có trách nhiệm khác nhau

Một trình thu thập quyết định các tài nguyên nào sẽ ghé thăm, trong khi một trình trích xuất thông tin đã chọn từ các tài nguyên đó. Việc phân tách các vai trò giúp cả việc kiểm kê và hợp đồng dữ liệu dễ dàng hơn để kiểm tra.

Đối với một bộ sưu tập tin tức được phép, việc phát hiện có thể xác định các URL bài báo từ một phần đã được phê duyệt. Việc trích xuất sau đó có thể đọc tiêu đề và nội dung chính của từng bài báo. Sự thành công của trình thu thập thông tin là đạt được các tài liệu dự kiến; sự thành công của trình trích xuất là thu thập các trường cần thiết với nghĩa đúng.

The dòng chảy phát hiện và trích xuất tin tức minh họa rằng sự phân chia. Một trang có thể được truy cập trong khi một quy tắc trích xuất vẫn thất bại, vì vậy công việc nên giữ lại kết quả cho cả hai giai đoạn.

Một số công cụ được quản lý kết hợp các giai đoạn và trả về nội dung có thể đọc được hoặc đầu ra có cấu trúc cho mỗi URL đã truy cập. Sự tiện lợi đó không làm mất đi sự phân biệt. Xem lại kết quả từng trang và quyết định dữ liệu nào đủ điều kiện được chấp nhận cho nhiệm vụ.

Bộ sưu tập trang Crawl không cần thu thập mô tả các tùy chọn thu thập và xuất ra đệ quy. Giữ nguyên định nghĩa về phạm vi và xác thực các trường kinh doanh trong quy trình làm việc của riêng bạn, ngay cả khi việc phát hiện và truy xuất được cung cấp bởi một dịch vụ quản lý.

Trình thu thập thông tin HTTP và Kết xuất Trình duyệt

Một trình thu thập HTTP lấy nội dung phản hồi, trong khi một trình thu thập có khả năng trình duyệt có thể thực hiện các tập lệnh trang và kiểm tra tài liệu kết quả. Lớp thực thi đúng phụ thuộc vào nơi mà các liên kết hoặc thông tin cần thiết xuất hiện.

Một trang tài liệu tĩnh có thể hiển thị điều hướng của nó trong phản hồi ban đầu. Một danh mục được tạo ra bởi khách hàng có thể thêm liên kết sản phẩm chỉ sau khi JavaScript chạy. Do đó, một kho hàng chỉ HTTP có thể bỏ lỡ các liên kết hiển thị cho một người đang duyệt trang.

Việc trình bày nên là một sự lựa chọn có chủ đích. Nó có thể yêu cầu công việc mạng bổ sung và một môi trường trình duyệt xác định. Xác nhận xem nhiệm vụ có cần điều đó trước khi áp dụng việc thực thi trình duyệt cho mọi tài nguyên.

Trình duyệt Đại lý Không rác cung cấp một lớp trình duyệt đám mây cho các quy trình làm việc động. Một trình duyệt vẫn cần điều kiện sẵn sàng và quy tắc phạm vi; việc chạy các kịch bản không đảm bảo rằng mọi liên kết liên quan đều đã xuất hiện hoặc rằng mọi tài nguyên được phát hiện đều được phép.

So sánh Giá cả không chịu ảnh hưởng bởi việc thu thập dữ liệu chống lại mẫu thu thập. Một đánh giá hữu ích hỏi xem bao nhiêu thực thi tạo ra một danh mục có thể kiểm tra được, bao gồm các trang bị từ chối và các khoảng trống đã biết, thay vì chỉ đếm số yêu cầu.

Độ phủ, Trang mồ côi và Bẫy thu thập thông tin

Phạm vi quét là phần của tập hợp tài nguyên đã được xác định mà trình thu thập thông tin thành công kiểm tra. Nếu không có tập hợp tham chiếu hoặc phạm vi rõ ràng, “quét hoàn chỉnh” hầu như không có ý nghĩa trong hoạt động.

Phát hiện theo liên kết có thể bỏ lỡ một trang mồ côi mà không có tài nguyên nào đã truy cập liên kết tới. Một sơ đồ trang web hoặc xuất CMS đã sở hữu có thể cung cấp thêm các ứng cử viên, nhưng mỗi danh mục có thể có những thiếu sót hoặc mục đã lỗi thời riêng. So sánh những nguồn đó khi tính toàn vẹn là quan trọng.

Một trình thu thập thông tin cũng có thể phát hiện quá nhiều ứng viên có giá trị thấp. Lịch và bộ lọc có thể tạo ra một không gian URL lớn hoặc không giới hạn. Một danh sách các chuỗi riêng biệt không nhất thiết là một danh sách các trang hữu ích riêng biệt.

Xác định sự tương đương và loại trừ URL có ý nghĩa. Giữ các biến thể tách biệt khi chúng thay đổi thông tin mà nhiệm vụ cần. Tránh việc tự động hợp nhất tất cả các chuỗi truy vấn, vì một số truy vấn xác định nội dung khác nhau.

Báo cáo lý do dừng lại: đã hết công việc đủ điều kiện, ngân sách trang, ngân sách thời gian, hoặc một điều kiện đã thỏa thuận khác. Giữ cho các ứng viên đang chờ và bị loại có thể nhìn thấy. Một danh sách tồn kho dễ tin cậy hơn khi người vận hành có thể giải thích lý do một tài nguyên bị vắng mặt hơn là chỉ chỉ vào nhãn công việc đã hoàn thành.

Vận hành một Crawler một cách Có trách nhiệm

Hoạt động của crawler có trách nhiệm bắt đầu với một phạm vi được ủy quyền, tải trang hợp lý và một danh tính có thể được phối hợp với chủ sở hữu nguồn. Những kiểm soát này thuộc về thiết kế trước khi khối lượng tăng lên.

The Giao thức loại trừ robot truyền đạt sở thích thu thập thông tin đến các khách hàng tham gia. Nó không tạo ra quyền truy cập hoặc giải quyết việc tái sử dụng hợp pháp của nội dung. Xem xét các điều khoản và nghĩa vụ dữ liệu áp dụng một cách riêng biệt.

Quản lý tải trọng tổng hợp trên các công nhân và các điểm ra mạng. Cài đặt độ đồng thời của một trình thu thập thông tin nên phản ánh một thỏa thuận hoặc một chính sách vận hành hợp lý, không phải là công suất tối đa của hạ tầng. Giữ một kiểm soát dừng hiệu quả cho hành vi nguồn không lường trước.

Chỉ thu thập các đầu ra cần thiết cho nhiệm vụ. Một cuộc kiểm toán liên kết trên trang đã sở hữu có thể không cần giữ nguyên toàn bộ thân trang. Một tập tài liệu được phép có thể cần nội dung chính và bằng chứng nguồn trong khi loại trừ thông tin cá nhân không liên quan.

Gán một chủ sở hữu cho các công việc đang diễn ra. Chủ sở hữu nên biết những thay đổi nào cần một cuộc xem xét mới, cách thức điều tra các trang bị từ chối, và cách ghi nhận các quyết định thu thập. Cơ sở hạ tầng thiếu chủ sở hữu có thể tiếp tục hoạt động sau khi phạm vi ban đầu không còn chính xác.

Lựa chọn một Crawler cho một Kết quả Được Định nghĩa

Chọn một trình thu thập thông tin theo danh sách tồn kho và bằng chứng mà nó có thể sản xuất cho nhiệm vụ của bạn. Bắt đầu với các nguồn hạt giống đã được phê duyệt, kiểm soát phạm vi và hành vi hiển thị mà trang web yêu cầu.

Kiểm tra cách nó xử lý chuyển hướng, trùng lặp URL, tham số truy vấn và lỗi trang cá nhân. Xác nhận xem công cụ có báo cáo tài nguyên bị loại trừ và phân biệt việc hoàn thành công việc với thành công từng trang hay không. Một số liệu tóm tắt bóng bảy có thể che giấu thông tin cần thiết để xác minh độ bao phủ.

Đối với một quá trình di chuyển tài liệu minh họa, kết quả mong muốn có thể là một danh sách kiểm kê được đối chiếu với CMS và sitemap của trang. Đối với một bộ chủ đề, kết quả có thể là các tài liệu liên quan với việc chỉ định nguồn và các phần loại trừ đã biết. Cùng một trình thu thập dữ liệu có thể hỗ trợ cả hai chỉ nếu cấu hình của nó giữ lại những phân biệt liên quan.

Bắt đầu với một mẫu có giới hạn, kiểm tra kết quả và mở rộng phạm vi đã thỏa thuận sau khi các kiểm soát đã được hiểu. Giữ cho việc khám phá và diễn giải phía dưới đủ tách biệt đến mức có thể thay đổi cả hai mà không mất đi nguồn tài nguyên.

Kết luận

Một trình thu thập thông tin web một cách có hệ thống khám phá và truy cập tài nguyên theo chính sách. Giá trị của nó phụ thuộc vào việc danh sách tài nguyên thu được có hữu ích, có giới hạn và có thể giải thích cho nhiệm vụ hay không.

Xác định ý nghĩa của việc bao phủ, chọn lớp thực thi cần thiết và giữ lại lý do cho các tài nguyên bị loại trừ hoặc từ chối. Những quyết định đó cho phép một trình thu thập thông tin hỗ trợ các cuộc kiểm toán đáng tin cậy và quy trình dữ liệu mà không hàm ý rằng mỗi trang đã truy cập đều được lập chỉ mục hoặc mỗi trang web đều đã được tìm thấy.

Biến Phạm vi Được Phê duyệt thành Tài nguyên Có Thể Kiểm Tra

Đánh giá Thu thập Không Rác cho việc thu thập đệ quy với kỳ vọng bao phủ rõ ràng và xem xét từng trang.

Đăng ký hôm nay và nhận $5 tín dụng miễn phí — không yêu cầu thẻ tín dụng.

Nhận Tín dụng $5 Của Bạn →

Câu hỏi Thường gặp

Có phải bot nào cũng là trình thu thập thông tin web?

Không phải bot nào cũng là trình thu thập thông tin web. Một trình thu thập thông tin truy cập có hệ thống tài nguyên và thường phát hiện thêm các liên kết bổ sung. Các bot khác có thể thực hiện các tác vụ không liên quan như giám sát điểm cuối cố định hoặc tự động hóa biểu mẫu.

Việc thu thập có nghĩa là một trang được lập chỉ mục không?

Việc thu thập không có nghĩa là một trang được lập chỉ mục. Lấy nội dung cung cấp cho quá trình xử lý sau này, trong khi lập chỉ mục và phân loại liên quan đến các quyết định riêng biệt. Sử dụng chứng cứ phù hợp với trạng thái bạn muốn xác nhận.

Trình thu thập thông tin tập trung là gì?

Một trình thu thập thông tin tập trung ưu tiên các tài nguyên phù hợp với một chủ đề hoặc mục đích đã xác định. Chính sách liên quan của nó hình thành việc khám phá và lập lịch. Nó vẫn cần có phạm vi được ủy quyền, hoạt động có giới hạn và chứng cứ cho các tài liệu mà nó chấp nhận.

Làm thế nào một trình thu thập thông tin có thể tìm thấy các trang mồ côi?

Một trình thu thập thông tin có thể nhận các ứng viên trang mồ côi từ các danh sách tài nguyên bổ sung như sơ đồ trang web hoặc xuất CMS. Chỉ theo dõi liên kết không thể tìm thấy một tài nguyên không có đường đi có thể khám phá từ các hạt giống của nó.

Tài liệu tham khảo