Crawl Budget là gì?
Trình duyệt Scraping không có scrap rendery các trang công khai trong trình duyệt đám mây, giúp các nhóm SEO kỹ thuật so sánh danh sách URL đã khai báo với các liên kết chỉ xuất hiện sau khi JavaScript chạy.
TL;DR
- Crawl Budget có một định nghĩa hoạt động chính xác. Crawl budget là mức độ thực tế mà một hệ thống tìm kiếm có thể và sẵn lòng thực hiện để thu thập dữ liệu cho một trang trong một khoảng thời gian.
- Các khái niệm gần nhất phải được giữ tách biệt. Crawl budget không phải là một khoản chi phí cố định có thể được mua, và một crawl không phải là một đảm bảo chỉ mục.
- Chẩn đoán theo dõi chuỗi tìm kiếm. Xác định giai đoạn thất bại trước khi thay đổi nội dung, chỉ dẫn, hoặc mẫu.
- Bằng chứng sống quan trọng. Kiểm tra các URL đại diện và kết quả tìm kiếm thay vì coi danh sách kiểm tra như là bằng chứng.
- Công việc hữu ích kết thúc bằng một quyết định. Mỗi phát hiện kiểm toán nên nêu tên các trang bị ảnh hưởng, kết quả mong đợi, và phương pháp xác minh.
Định nghĩa và Phạm vi
Crawl budget là mức độ thực tế mà một hệ thống tìm kiếm có thể và sẵn lòng thực hiện để thu thập dữ liệu cho một trang trong một khoảng thời gian. Khái niệm này kết hợp năng lực crawl, bị giới hạn bởi sức khỏe máy chủ và tỷ lệ yêu cầu an toàn, với nhu cầu crawl, phản ánh mức độ mà các hệ thống tìm kiếm muốn truy cập lại các URL cụ thể. Nó quan trọng nhất trên các trang rất lớn, thay đổi nhanh chóng, hoặc khó kiểm soát. Một trang nhỏ ổn định với điều hướng sạch sẽ hiếm khi cần điều chỉnh crawl budget phức tạp.
Crawl budget không phải là một khoản chi phí cố định có thể được mua, và một crawl không phải là một đảm bảo chỉ mục. Các trình thu thập thông tin tìm kiếm lập lịch các URL dựa trên các liên kết đã phát hiện, hành vi trước đó, thay đổi nội dung, mức độ hữu ích cảm nhận được, sự trùng lặp, và độ nhạy cảm của máy chủ. Chặn các đường dẫn ngẫu nhiên có thể giảm số lần gọi mà không cải thiện việc khám phá các trang quan trọng. Mục tiêu hữu ích là giữ không gian URL có thể crawl tương thích với các trang có giá trị, khác biệt, và hiện tại.
Các trang lớn có thể tạo ra gần như vô số sự kết hợp thông qua các bộ lọc, lịch, tìm kiếm nội bộ, tham số phiên, và các liên kết bị sai cách. Các trình thu thập có thể tiêu tốn năng lực để lấy các bản sao, chuỗi chuyển hướng, kết quả trống, lỗi mềm, và các biến tham số có giá trị thấp trong khi các trang quan trọng vẫn nằm sâu hoặc liên kết yếu. Công việc crawl budget giảm thiểu sự lãng phí đó và củng cố các tín hiệu nhu cầu cho các trang quan trọng.
Tiêu chuẩn thực tế là bằng chứng. Một định nghĩa hữu ích cho bạn biết cái gì nên quan sát, cái gì khái niệm không kiểm soát, và hành động nào theo sau một phát hiện. Kỷ luật đó ngăn một nhóm biến một thuật ngữ SEO quen thuộc thành một nhãn không rõ ràng cho mọi vấn đề về hiển thị. Nó cũng làm cho công việc dễ dàng hơn khi chuyển giao giữa các nhóm biên tập, kỹ thuật, sản phẩm, và phân tích vì trạng thái mong đợi có thể được kiểm tra trên một URL thực tế hoặc tập hợp kết quả.
Hệ thống Hoạt động Như Thế Nào
Crawl Budget trở nên có thể hành động khi nó được tách thành các cơ chế có thể được kiểm tra độc lập. Mỗi cơ chế dưới đây để lại bằng chứng khác nhau, vì vậy một triệu chứng không nên được sử dụng để suy luận về toàn bộ hệ thống.
| Cơ chế | Cái gì cần kiểm tra |
|---|---|
| Năng lực crawl | Các máy chủ khỏe mạnh và phản ứng có thể chấp nhận nhiều hoạt động của trình thu thập mà không gây hại cho người dùng, trong khi lỗi và phản hồi chậm khuyến khích thận trọng. |
| Nhu cầu crawl | Các trang quan trọng, phổ biến, thay đổi và trước đây hữu ích thường là ứng viên mạnh mẽ hơn để truy cập lại so với các bản sao lâu đời. |
| Khám phá URL | Các liên kết, sơ đồ trang, chuyển hướng, nguồn cấp dữ liệu, và kiến thức lịch sử liên tục thêm các URL vào hàng đợi crawler. |
| Lịch trình kết quả | Trình thu thập chọn cái gì để lấy tiếp theo; các hệ thống chỉ mục sẽ quyết định sau đó rằng nội dung được lấy có thuộc vào chỉ mục hay không. |
Định nghĩa crawl-budget của Google định nghĩa crawl budget thông qua tỷ lệ crawl và nhu cầu crawl. Các quy tắc truy cập nên theo RFC 9309 Giao thức Loại trừ Robot, trong khi mã phản hồi, chuyển hướng, bộ nhớ đệm, và hành vi đại diện nên được đọc thông qua RFC 9110 ngữ nghĩa HTTP.
Các lớp này tương tác với nhau, nhưng chúng nên giữ tách biệt trong quá trình chẩn đoán. Bắt đầu với điểm sớm nhất mà trạng thái quan sát khác với trạng thái dự kiến. Một tối ưu hóa ở giai đoạn sau không thể sửa chữa một lỗi ở giai đoạn trước. Khi khiếm khuyết sớm nhất được sửa chữa, xác minh giai đoạn tiếp theo với bằng chứng mới thay vì giả định toàn bộ chuỗi giờ hoạt động.
Nơi Khái niệm Quan trọng trong Thực tế
Giá trị của crawl budget phụ thuộc vào trang web, loại trang, và quyết định đang được đưa ra. Các tình huống sau đây cho thấy cách mà cùng một nguyên tắc thay đổi khi bối cảnh hoạt động thay đổi.
Thương mại điện tử phân cấp
Ngăn chặn các bộ lọc và sự kết hợp trên các loại từ tạo ra một không gian crawl không xác định mà cạnh tranh với các danh mục và sản phẩm.
Lưu trữ nhà xuất bản
Quản lý lịch, giao điểm thẻ, phân trang, và lưu trữ lỗi thời trong khi giữ cho nội dung hiện tại và vĩnh cửu dễ tiếp cận.
Chợ
Ưu tiên các danh sách hoạt động và các danh mục hữu ích, và loại bỏ hàng tồn kho hết hạn hoặc trống một cách gọn gàng.
Di cư lớn
Thay thế các chuỗi chuyển hướng, cập nhật sơ đồ trang, và củng cố các liên kết nội bộ để trình thu thập dành ít thời gian hơn để phát hiện lại các đường dẫn đã lỗi thời.
Đừng biến những trường hợp sử dụng này thành một danh sách kiểm tra toàn cầu. Một trang biên tập nhỏ, một chợ với hàng triệu sự kết hợp có thể định tuyến, và một ứng dụng được khách hàng render phơi bày những rủi ro khác nhau. Mẫu các mẫu mang lại giá trị kinh doanh, sau đó mở rộng xem xét chỉ khi nguyên nhân gốc giống nhau xuất hiện trên toàn nhóm.
Sai lầm phổ biến và Chẩn đoán tốt hơn
Hầu hết các lỗi bắt đầu với một thuật ngữ đúng được áp dụng ở lớp sai. Phương thuốc là thay thế nhãn bằng một tuyên bố quan sát được: URL nào, phản hồi nào hoặc phần tử được hiển thị nào, truy vấn tìm kiếm nào, trạng thái mong đợi nào và trạng thái thực tế nào.
- Tối ưu hóa một trang web nhỏ quá sớm. Nếu các trang quan trọng đã được thu thập kịp thời, nỗ lực sẽ được tốt hơn khi tập trung vào chất lượng nội dung, liên kết nội bộ và đủ điều kiện chỉ mục.
- Chặn mà không xóa các nguồn phát hiện. Một tham số không cho phép có thể tiếp tục liên kết trên toàn trang web, khiến cho các trình thu thập thông tin nhận thức được một không gian URL lớn chưa được giải quyết. Sửa chữa việc sinh và các liên kết.
- Xử lý việc đưa vào sơ đồ trang web như là ưu tiên duy nhất. Một sơ đồ trang là một bề mặt khám phá và tuyên bố. Các liên kết nội bộ, chất lượng trang, độ tươi mới và các tín hiệu nhất quán vẫn quan trọng.
- Bỏ qua hành vi máy chủ. Phản hồi chậm, lỗi máy chủ lặp lại và chuỗi chuyển hướng tiêu tốn thời gian và có thể giảm khả năng thu thập dữ liệu an toàn.
Một quy trình làm việc thực tế
Một quy trình làm việc đáng tin cậy di chuyển từ định nghĩa sang bằng chứng đến một thay đổi có giới hạn. Nó tránh việc chỉnh sửa hàng loạt trước khi nhóm hiểu giai đoạn nào đã thất bại và nhóm URL nào bị ảnh hưởng.
- Bước 1. Đo lường số lượng và loại URL được hiển thị bởi các liên kết, sơ đồ trang, nguồn cấp dữ liệu và các tuyến ứng dụng.
- Bước 2. Phân đoạn các yêu cầu crawler theo mẫu, trạng thái, kiểu tham số và giá trị kinh doanh bằng cách sử dụng nhật ký máy chủ.
- Bước 3. Xác định không gian vô hạn, các bản sao, lỗi mềm, chuỗi chuyển hướng và các URL lỗi thời tiêu tốn yêu cầu.
- Bước 4. Ngừng tạo ra chất thải từ nguồn gốc và loại bỏ các liên kết nội bộ đến những biến thể không mong muốn.
- Bước 5. Củng cố các liên kết trực tiếp và tính nhất quán của sơ đồ trang cho các trang giá trị, đặc biệt là những trang mới hoặc thường xuyên thay đổi.
- Bước 6. Theo dõi các mẫu thu thập và phạm vi chỉ mục cùng nhau; sự cải thiện có nghĩa là các trang quan trọng được lấy và xử lý một cách đáng tin cậy hơn.
Bảo tồn trạng thái trước. Lưu lại các URL đại diện, bằng chứng đã được hiển thị, thành phần kết quả và khoảng thời gian đo lường đã biện minh cho sự thay đổi. Sau khi triển khai, chạy lại các kiểm tra tương tự trên cùng một phạm vi. Nếu hành vi mong đợi thay đổi nhưng kết quả tìm kiếm không thay đổi, giả thuyết kỹ thuật có thể đã đúng trong khi tác động kinh doanh rất nhỏ. Điều đó vẫn là bằng chứng hữu ích và nên thông báo cho ưu tiên tiếp theo.
Tự động hóa giúp thu thập, chuẩn hóa và so sánh. Việc xem xét của con người vẫn cần thiết cho mục đích trang, sự thật về nội dung, giá trị đối với khán giả và những đánh đổi giữa các tín hiệu cạnh tranh. Sử dụng máy móc để làm cho bằng chứng có thể lặp lại; giữ cho quyết định cuối cùng có trách nhiệm với một người hiểu rõ về trang web.
Ngân sách thu thập, Tốc độ thu thập và Lập chỉ mục Trả lời Các Câu hỏi Khác Nhau
Các thuật ngữ SEO liền kề thường chia sẻ dữ liệu trong khi kiểm soát các quyết định khác nhau. So sánh dưới đây là một ranh giới hoạt động cho các cuộc kiểm tra và tóm tắt nội dung.
| Kích thước | Khái niệm chính | Khái niệm liền kề |
|---|---|---|
| Câu hỏi | Bao nhiêu lần quét hữu ích có thể và nên xảy ra? | Cách nhanh chóng mà các yêu cầu đến hoặc liệu nội dung được lấy có được lưu trữ hay không |
| Bằng chứng chính | Nhật ký, danh sách URL, sức khỏe máy chủ và các đường dẫn phát hiện | Yêu cầu thời gian hoặc báo cáo chỉ mục |
| Trục chính | Giảm rác thải và củng cố các tín hiệu URL có giá trị | Khả năng phục vụ hoặc đủ điều kiện và chất lượng trang |
| Sự hiểu lầm phổ biến | Mỗi trang web đều cần tối ưu hóa quyết liệt. | Việc thu thập thông tin tự động tạo ra nhiều trang được lập chỉ mục hơn. |
Ranh giới hữu ích nhất khi nó thay đổi hành động tiếp theo. Nếu hai nhãn dẫn đến cùng một bằng chứng và giải quyết, sự phân biệt có thể chỉ mang tính học thuật cho nhiệm vụ đó. Nếu chúng yêu cầu những chủ sở hữu, công cụ hoặc xác minh khác nhau, hãy đặt tên cho các giai đoạn một cách rõ ràng. Từ vựng rõ ràng giảm bớt công việc bị trùng lặp và ngăn chặn một nhóm ăn mừng một chỉ số thuộc về phần khác của hệ thống.
Đo lường và Đánh giá
Đo lường trạng thái gần nhất với quyết định trước. Bằng chứng kỹ thuật có thể bao gồm hành vi phản hồi, chỉ thị, yếu tố được hiển thị, đường dẫn liên kết nội bộ, hoặc các nhóm URL. Bằng chứng tìm kiếm có thể bao gồm ấn tượng, loại kết quả, trang được chọn, đoạn trích, và nhóm truy vấn. Bằng chứng kinh doanh có thể bao gồm lượt truy cập đủ điều kiện, nhiệm vụ đã hoàn thành, đăng ký, khách hàng tiềm năng, hoặc doanh thu. Một bảng điều khiển hữu ích giữ cho những lớp này tách biệt để chuyển động trong một lớp không bị báo cáo sai là thành công trong lớp khác.
Sử dụng mẫu đại diện cho việc giám sát định kỳ và các kiểm kê đầy đủ cho các di chuyển, ra mắt mẫu, hoặc các sự cố có phạm vi rộng. Phân đoạn kết quả theo loại trang, khu vực, thiết bị, và ý định khi những kích thước đó thay đổi hành vi mong đợi. Trung bình có thể che giấu một mẫu bị hỏng bên trong tổng số trang web khỏe mạnh.
Chu kỳ xem xét nên theo rủi ro thay đổi. Kiểm tra lại sau khi định tuyến, hiển thị, siêu dữ liệu, mô hình nội dung, hoặc các bản phát hành điều hướng. Xem lại những giả định đối diện tìm kiếm khi thành phần kết quả thay đổi hoặc một cụm truy vấn bắt đầu chọn loại trang khác. Mục tiêu là tạo ra một vòng phản hồi ngắn giữa bằng chứng và quyền sở hữu, không phải là một dòng cảnh báo vĩnh viễn mà không có quyết định đi kèm.
Kết luận
Quản lý ngân sách thu thập rất có giá trị khi trang web tiết lộ nhiều URL hơn những gì hệ thống tìm kiếm có thể xử lý một cách hữu ích. Đo lường không gian URL thực và nhật ký thu thập, loại bỏ những đường dẫn vô tận hoặc trùng lặp tại nguồn gốc, giữ cho máy chủ khỏe mạnh, và làm cho các trang quý giá dễ dàng phát hiện. Đừng nhầm lẫn nhiều yêu cầu hơn với việc lập chỉ mục tốt hơn.
Đối với việc thực hiện, Tài liệu trình duyệt thu thập không rác giải thích bề mặt sản phẩm được hỗ trợ, trong khi tổng quan sản phẩm trình duyệt thu thập mô tả nơi nó phù hợp trong quy trình làm việc dữ liệu web. Giữ cho những sự thật sản phẩm đó tách biệt với đánh giá SEO: việc thu thập có thể cho thấy những gì tồn tại, nhưng một người xem xét vẫn quyết định ý nghĩa của bằng chứng.
Sẵn sàng xây dựng quy trình làm việc bằng chứng SEO có thể lặp lại?
Thu thập bằng chứng tìm kiếm công khai và trang với Scrapeless, bảo tồn những quan sát thô, và biến mỗi phát hiện thành một quyết định có thể xem xét.
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không yêu cầu thẻ tín dụng.
Nhận tín dụng $5 của bạn →Câu hỏi thường gặp
Ngân sách thu thập có ảnh hưởng đến mọi trang web không?
Ngân sách thu thập tồn tại cho mọi máy chủ có thể thu thập, nhưng việc quản lý chủ động chủ yếu quan trọng đối với các trang lớn, thay đổi nhanh, hoặc tiêu tốn tài nguyên kỹ thuật. Các trang nhỏ sạch sẽ hiếm khi đối mặt với một hạn chế ngân sách có ý nghĩa.
Bước tiếp theo đúng là kiểm tra trang hoặc nhóm truy vấn liên quan, xác định giai đoạn thất bại sớm nhất, và xác nhận một thay đổi giới hạn dựa trên cùng một bằng chứng.
Có thể một sơ đồ XML tăng ngân sách thu thập không?
Một sơ đồ giúp phát hiện và giao tiếp các URL ưa thích, nhưng nó không tạo ra một khoản cho phép đảm bảo. Giá trị của nó phụ thuộc vào việc liệt kê các trang hiện tại, chuẩn hóa, có thể lập chỉ mục một cách đồng nhất.
Bước tiếp theo đúng là kiểm tra trang hoặc nhóm truy vấn liên quan, xác định giai đoạn thất bại sớm nhất, và xác nhận một thay đổi giới hạn dựa trên cùng một bằng chứng.
Có robots.txt tiết kiệm ngân sách thu thập không?
Robots.txt có thể ngăn chặn việc truy cập các đường dẫn được phép, nhưng các URL bị chặn có thể vẫn được phát hiện. Sửa chữa mạnh hơn là ngừng tạo và liên kết các biến thể URL không mong muốn trong khi sử dụng quy tắc robots cho kiểm soát truy cập hợp lệ.
Bước tiếp theo đúng là kiểm tra trang hoặc nhóm truy vấn liên quan, xác định giai đoạn thất bại sớm nhất, và xác nhận một thay đổi giới hạn dựa trên cùng một bằng chứng.
Làm thế nào để đo lường sự lãng phí thu thập?
Sử dụng nhật ký máy chủ để nhóm các yêu cầu thu thập theo mẫu, tham số, trạng thái, chuyển hướng, và giá trị kinh doanh. So sánh hoạt động đó với kho hàng chuẩn ưa thích.
Bước tiếp theo đúng là kiểm tra trang hoặc nhóm truy vấn liên quan, xác định giai đoạn thất bại sớm nhất, và xác nhận một thay đổi giới hạn dựa trên cùng một bằng chứng.
Liệu máy chủ nhanh hơn có tăng cường thu thập không?
Hành vi phản hồi khỏe mạnh có thể hỗ trợ khả năng thu thập, nhưng hệ thống tìm kiếm vẫn quyết định nhu cầu. Việc giao hàng nhanh hơn không làm cho các URL bị trùng lặp hoặc có giá trị thấp đáng giá để lập chỉ mục.
Bước tiếp theo đúng là kiểm tra trang hoặc nhóm truy vấn liên quan, xác định giai đoạn thất bại sớm nhất, và xác nhận một thay đổi giới hạn dựa trên cùng một bằng chứng.