robots.txt là gì?
Scrapeless Crawl cung cấp các tính năng thu thập trang web mà nên được cấu hình trong phạm vi thu thập và sở thích trang web của mỗi dự án.
Robots.txt là một tệp văn bản tại gốc của một trang web, truyền đạt sở thích truy cập thu thập thông tin cho các trình thu thập thông tin tham gia. Nó sử dụng Giao thức Loại trừ Robot để gán danh tính của các trình thu thập thông tin với các quy tắc đường dẫn. Tệp này giúp quản lý các tài nguyên mà trình thu thập thông tin nên yêu cầu.
Robots.txt có giới hạn rõ ràng. Nó không xác thực người dùng, không giữ tập tin riêng tư, cũng như không đảm bảo rằng một URL sẽ biến mất khỏi kết quả tìm kiếm. Đối với một quy trình thu thập dữ liệu, hãy coi nó như một phần của chính sách nguồn trong khi giữ quyền truy cập và việc sử dụng dữ liệu là những quyết định riêng biệt.
TL;DR
- Robots.txt kiểm soát các yêu cầu của trình thu thập thông tin tham gia. Các quy tắc của nó là sở thích theo một giao thức, không phải là biện pháp thực thi quyền truy cập phía máy chủ.
- I'm sorry, but I need the specific text that you'd like me to translate. Sơ đồ, máy chủ và cổng là quan trọng khi quyết định tệp nào quản lý một URL.
- Disallow và noindex có vai trò khác nhau. Chặn một yêu cầu fetch khác với việc kiểm soát sự bao gồm của chỉ mục.
- Các tiện ích mở rộng cần kiểm tra cụ thể cho từng loại crawler. Các hướng dẫn bên ngoài giao thức chính có thể được xử lý khác nhau.
Nơi robots.txt sống và những gì nó điều chỉnh
Robots.txt được lấy từ đường dẫn gốc của nguồn đang được thu thập dữ liệu. Thông tin này hướng dẫn các crawler về cách thức tương tác với các nội dung trên trang web. Giao thức Loại trừ Robot xác định vị trí tệp và cách các trình thu thập thông tin tham gia diễn giải nó.
Ranh giới nguồn quan trọng. Một tên miền phụ có thể có một tệp quy tắc khác với máy chủ chính. HTTP và HTTPS cũng là các giao thức riêng biệt, và một cổng khác có thể xác định một nguồn khác. Đừng áp dụng một tệp đã tải xuống cho mọi địa chỉ liên quan chỉ vì thương hiệu là giống nhau.
Đối với công việc quản lý hàng tồn kho, lưu trữ nguồn gốc nào đã cung cấp quyết định quy tắc. Nếu một trang chuyển hướng đến nơi khác, hãy đánh giá điểm đến theo chính sách liên quan đến điểm đến đó. Tính đủ điều kiện của một URL khởi đầu không nên tự động chuyển sang một thay đổi nguồn gốc.
Tên tệp là một đường dẫn giao thức, không phải là quy ước cụ thể cho thư mục. Một tệp được đặt trong một thư mục con nội dung không thay thế tệp quy tắc gốc cho nguồn gốc đó. Chủ sở hữu trang web nên xác minh vị trí thực tế và phản hồi thay vì giả định rằng một bảng cấu hình đã lưu quy tắc ở nơi mà trình thu thập thông tin đọc nó.
Nhóm Bò Cạp và Khớp Đường Dẫn
Robots.txt liên kết các nhóm user-agent với các quy tắc cho phép và không cho phép đường dẫn. Một trình thu thập thông tin chọn nhóm áp dụng cho danh tính sản phẩm của nó và đánh giá đường dẫn URL theo giao thức.
Quy tắc:
1. Chỉ xuất ra văn bản đã dịch — không giải thích, không mã bọc thêm.
2. Bảo toàn cấu trúc Markdown/HTML (tiêu đề, danh sách, liên kết, bảng) một cách chính xác.
3. Giữ nguyên bất kỳ mã thay thế nào như @@CODEBLOCK_0@@ hoặc @@INLINECODE_0@@ ĐÚNG NHƯ VẬY; không bao giờ dịch, sắp xếp lại, hợp nhất hoặc định dạng lại chúng.
4. Không thêm hoặc xóa các dấu ``` mã, và KHÔNG bọc văn bản bình thường vào một khối mã. User-agent các tên trường của token sản phẩm trình thu thập thông tin cho nhóm, và * cung cấp một nhóm dự phòng. Quy tắc cho một sản phẩm được đặt tên và nhóm dự phòng không được kết hợp một cách bừa bãi. Thực hiện hành vi khớp đã được định nghĩa thay vì coi tệp như một danh sách các chuỗi để tìm kiếm.
Disallow đánh dấu các đường dẫn tương ứng mà trình thu thập thông tin không nên lấy. Allow có thể xác định một đường dẫn được phép cụ thể hơn. Khi có nhiều quy tắc khớp, quy tắc khớp cụ thể nhất sẽ điều khiển; một quy tắc cho phép cụ thể như nhau có ưu tiên hơn theo giao thức.
Việc khớp đường dẫn nhạy cảm với sự biểu diễn URL thực tế. Chữ hoa và mã hóa phần trăm có thể quan trọng. Một sự so sánh đơn giản hạ cấp mọi đường dẫn có thể thay đổi quyết định. Sử dụng một bộ phân tích cú pháp mà hành vi của nó phù hợp với tiêu chuẩn và xác minh các URL đại diện.
Cách tốt nhất để tránh rò rỉ thông tin nhạy cảm là gì? Để giữ cho thông tin nhạy cảm không bị lộ ra ngoài, bạn nên làm theo các nguyên tắc sau: 1. **Không công khai thư mục nhạy cảm**: Tránh công khai các tên thư mục nhạy cảm trong tệp tin công cộng, vì việc tiết lộ chính nó có thể tạo thành vấn đề. 2. **Thực hiện hướng dẫn thu thập thông tin**: Hãy đảm bảo rằng các hướng dẫn thu thập thông tin chỉ ra rõ ràng rằng thư mục tư nhân cần được giữ kín. 3. **Theo dõi thông tin**: Luôn theo dõi và đánh giá các hướng dẫn để đảm bảo rằng chúng vẫn phù hợp với chính sách của bạn. 4. **Giáo dục nhân viên**: Đảm bảo rằng tất cả nhân viên được đào tạo về bảo mật thông tin và biết cách xử lý thông tin nhạy cảm đúng cách.
Wildcards, Điểm kết thúc, và Mở rộng
Các quy tắc robot cốt lõi hỗ trợ các tính năng mẫu, trong khi một số lĩnh vực thường thấy là các phần mở rộng bên ngoài cách giải thích cho phép/không cho phép chính. Kiểm tra cả tiêu chuẩn và triển khai trình thu thập dữ liệu.
Kí tự hoa thị (*) có thể khớp với một chuỗi trong mẫu đường dẫn, và ký hiệu đô la ($) có thể gắn kết với cuối một sự khớp. Những tính năng này giúp phân biệt tiền tố đường dẫn với một mẫu đã hoàn thành. Hãy kiểm tra các tài nguyên được phép và không được phép thay vì giả định rằng một mẫu hoạt động giống như một biểu thức thông thường chung.
A Sitemap trường có thể chỉ dẫn các trình thu thập đến một danh sách tài nguyên đã được công bố. Danh sách đó giúp việc khám phá, nhưng việc liệt kê một URL không thay thế một quy tắc không cho phép áp dụng. Quyết định về việc khám phá và quyền truy cập vẫn là những quyết định riêng biệt.
Crawl-delay không phải là một hướng dẫn kiểm soát tỷ lệ toàn cầu theo giao thức cốt lõi. Sự hỗ trợ của nó phụ thuộc vào trình thu thập thông tin. Một chủ sở hữu trang web không nên dựa vào nó một mình để thi hành công suất máy chủ, và một người điều hành trình thu thập thông tin nên thiết lập tốc độ tổng hợp thích hợp cho riêng mình.
Các Hướng dẫn robots.txt của Google giải thích vai trò và giới hạn của trình thu thập thông tin tìm kiếm. Sử dụng tài liệu cụ thể cho trình thu thập thông tin khi một trường ngoài các quy tắc cốt lõi ảnh hưởng đến cấu hình của bạn.
Các trường chưa biết không nên trở thành quyền hạn được phát minh. Hãy giữ các quy tắc tiêu chuẩn có liên quan và chính sách dự án của bạn rõ ràng khi giải thích một tệp kết hợp giữa các chỉ thị thông thường và chuyên biệt.
Robots.txt, noindex, và Xác thực
Robots.txt, chỉ thị lập chỉ mục và xác thực giải quyết các vấn đề khác nhau. Một chủ sở hữu trang web cần chọn sự kiểm soát phù hợp với kết quả mong muốn.
| Kiểm soát | Mục đích chính | Giới hạn để Nhớ |
|---|---|---|
| robots.txt | Giao tiếp sở thích lấy dữ liệu cho các trình thu thập tham gia. | Nó không thi hành quyền truy cập riêng tư. |
| không chỉ mục | Giao tiếp ý định loại trừ chỉ mục đến các hệ thống tìm kiếm hỗ trợ. | Hệ thống cần nhận được chỉ thị liên quan. |
| Xác thực | Hạn chế quyền truy cập cho người dùng hoặc khách hàng đã được ủy quyền. | Quyền truy cập của nó vẫn cần cấu hình đúng. |
| Sơ đồ trang | Khai báo tài nguyên ứng cử viên để phát hiện. | Nó không đảm bảo thu thập dữ liệu hoặc bao gồm chỉ mục. |
Một URL không được phép vẫn có thể được biết thông qua các liên kết từ các trang khác. Một hệ thống tìm kiếm có thể hiển thị một URL mà không cần lấy nội dung đầy đủ của nó. Chặn thu thập dữ liệu không đảm bảo loại bỏ khỏi chỉ mục.
Nếu một trang dựa vào một chỉ thị noindex trong nội dung của nó, ngăn chặn trình thu thập dữ liệu tìm kiếm lấy trang có thể ngăn nó thấy được chỉ thị đó. Lập kế hoạch điều khiển chỉ mục với hành vi của hệ thống tìm kiếm liên quan trong tâm trí.
Các sự phân biệt robots.txt và chỉ mục giúp giải thích ranh giới. Đối với thông tin riêng tư, hãy sử dụng các biện pháp kiểm soát truy cập hợp lý thay vì phụ thuộc vào hành vi của trình thu thập dữ liệu tự nguyện.
Quy tắc thiếu và lỗi truy xuất
Một trình thu thập dữ liệu cần một chính sách xác định để lấy robots.txt cũng như phân tích một tệp thành công. Các trạng thái lỗi khác nhau có ý nghĩa khác nhau theo giao thức.
Tiêu chuẩn phân biệt tệp quy tắc không có sẵn với tệp không thể tiếp cận do lỗi máy chủ hoặc mạng. Phản hồi lỗi của khách hàng có thể cho phép truy cập dưới cách xử lý tệp không có sẵn của giao thức, trong khi trạng thái không thể tiếp cận yêu cầu xem xét các tài nguyên như là không được phép. Thực hiện hành vi tiêu chuẩn liên quan và bất kỳ chính sách dự án nào nghiêm ngặt hơn.
Không diễn giải một tải về trống như là bằng chứng cho việc không có hạn chế nào tồn tại. Kiểm tra phân loại phản hồi và điểm đến cuối cùng. Một trang lỗi, kết nối thất bại, hoặc chuyển hướng không liên quan cần xử lý riêng.
Lưu trữ quy tắc theo giao thức và nhu cầu của một công việc đang diễn ra. Ghi lại phiên bản quy tắc nào đã thông báo một quyết định thu thập khi bằng chứng đó quan trọng. Một dự án dài hạn nên có cách để nhận ra những thay đổi chính sách quan trọng thay vì sử dụng một tệp cũ vô thời hạn.
Một tệp bị thiếu cũng không thiết lập quyền hợp pháp. Giao thức mô tả hành vi của trình thu thập dữ liệu; các thỏa thuận trang web, quyền nội dung, và bảo vệ dữ liệu vẫn cần xem xét riêng. Chính sách quyền nghiêm ngặt hơn của một dự án có thể ngăn thu thập ngay cả khi giao thức tự nó cho phép lấy dữ liệu.
Kiểm tra robots.txt như là Chủ sở hữu Trang web
Một chủ sở hữu trang web nên kiểm tra quy tắc robots chống lại các URL cụ thể và danh tính trình thu thập dữ liệu dự kiến. Một tệp hợp lệ về cú pháp có thể vẫn chặn phần sai hoặc để lại hạn chế dự kiến không được phù hợp.
Chuẩn bị các trường hợp cho cả hai phía của mỗi ranh giới. Nếu một tiền tố đường dẫn có ý định hạn chế một khu vực, hãy bao gồm các tài nguyên trong khu vực đó và các tài nguyên có tên tương tự bên ngoài nó. Thêm khác biệt về trường hợp và truy vấn nơi chúng ảnh hưởng đến cấu trúc URL thực.
Kiểm tra triển khai đến nguồn gốc dự kiến. Một quy tắc staging đúng không phải là bằng chứng cho việc sản xuất phục vụ cùng một tệp. Xác nhận vị trí và nội dung cuối cùng của tệp sau khi thay đổi, bao gồm bất kỳ hành vi chuyển hướng nào.
Cũng kiểm tra kết quả chỉ mục dự kiến riêng. Một quy tắc ngăn chặn thu thập dữ liệu không phải là một yêu cầu gỡ bỏ và không thay thế xác thực. Chọn các điều khiển tìm kiếm liên quan cho quản lý chỉ mục và các điều khiển máy chủ cho các tài nguyên riêng tư.
Giữ rõ quyền sở hữu của tệp. Di chuyển nội dung và thay đổi hạ tầng có thể thay đổi đường dẫn hoặc máy chủ, vì vậy một quy tắc đã hoạt động trước đó có thể không còn mô tả trang hiện tại. Duy trì một bản ghi ngắn gọn về lý do mỗi hạn chế đáng kể tồn tại.
Sử dụng Quy tắc Robots trong một Dự án Thu thập Dữ liệu
Một dự án thu thập dữ liệu nên tích hợp các quyết định robots vào các kiểm soát phạm vi của nó trước khi lấy tài nguyên ứng cử viên. Giữ nguồn gốc, danh tính trình thu thập dữ liệu, bằng chứng quy tắc, và lý do loại trừ cùng nhau.
Đối với một lần thu thập tài liệu minh họa, người điều hành bắt đầu với các hạt giống đã được phê duyệt, đọc các quy tắc cho nguồn gốc tài liệu, và đánh dấu các ứng cử viên là đủ điều kiện hoặc bị loại trừ. Công việc báo cáo các trường hợp loại trừ thay vì im lặng giảm yêu cầu bao phủ của nó.
Thu thập dữ liệu trang web Scrapeless mô tả bề mặt thu thập dữ liệu được quản lý. Xác nhận cấu hình thực tế và cách xử lý chính sách cho công việc của bạn; bài viết này không tuyên bố rằng mọi cài đặt của nhà cung cấp tự động thi hành mọi quy tắc của trình thu thập dữ liệu.
Trình thu thập dữ liệu Scrapeless cung cấp thực thi cho thu thập dữ liệu dựa trên trình duyệt. Lớp thực thi vẫn hoạt động trong phạm vi nguồn cấp phép của dự án. Xem lại giá Scrapeless cho công việc mà phạm vi đó yêu cầu.
Bài viết thông giải thích robots.txt liên quan cung cấp thêm ngữ cảnh. Sử dụng giao thức hiện tại và tài liệu trình thu thập dữ liệu cho hành vi khớp chính xác, đặc biệt là nơi các ví dụ lịch sử mô tả các trường phi tiêu chuẩn như là các điều khiển toàn cầu.
Khi chính sách ngăn chặn một cuộc viếng thăm, ghi lại kết quả đó như là một sự loại trừ có chủ ý. Nó không nên được chuyển đổi thành một kết quả thu thập dữ liệu hợp lệ-trống hoặc một tuyên bố rằng nguồn chứa không có dữ liệu.
Kết luận
Robots.txt truyền đạt sở thích thu thập dữ liệu cho một nguồn gốc thông qua các nhóm trình thu thập dữ liệu và quy tắc đường dẫn. Diễn giải nó bằng cách sử dụng giao thức, kiểm tra nó chống lại các URL thực tế, và giữ rõ những giới hạn của nó.
Đối với các chủ sở hữu trang, hãy sử dụng các biện pháp kiểm soát truy cập cho vật liệu riêng tư và các chỉ thị chỉ mục thích hợp cho kết quả tìm kiếm. Đối với các nhà điều hành thu thập dữ liệu, hãy giữ bằng chứng loại trừ và xem xét quyền riêng biệt. Những sự phân biệt này giữ cho một tệp quy tắc nhỏ không bị yêu cầu giải quyết những vấn đề mà nó chưa bao giờ được thiết kế để thực thi.
Giữ Thu thập Dữ liệu Trang web Trong một Chính sách Được xác định
Đánh giá Scrapeless Crawl với các nguồn đã được phê duyệt, phạm vi đường dẫn rõ ràng và lý do hiển thị cho các URL bị loại trừ.
Đăng ký hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.
Nhận tín dụng $5 của bạn →Câu hỏi thường gặp
Tập tin robots.txt có ngăn chặn mọi bot không?
Tập tin robots.txt không ngăn chặn mọi bot. Nó truyền đạt hướng dẫn đến các trình thu thập dữ liệu tham gia và không thực thi quyền truy cập máy chủ. Sử dụng kiểm soát xác thực và ủy quyền cho các tài nguyên riêng tư.
Quy tắc Disallow có xóa một URL khỏi kết quả tìm kiếm không?
Một quy tắc Disallow không đảm bảo rằng một URL biến mất khỏi kết quả tìm kiếm. Các hệ thống tìm kiếm có thể biết URL thông qua các tham chiếu khác. Sử dụng các kiểm soát lập chỉ mục hoặc gỡ bỏ liên quan cho kết quả mong muốn.
Một bản đồ trang có ghi đè lên robots.txt không?
Một bản đồ trang không ghi đè lên một quy định robots.txt áp dụng. Một bản đồ trang công bố các ứng viên khám phá, trong khi các quy tắc robots điều chỉnh quyết định thu thập của trình thu thập dữ liệu tham gia. Giữ hai vai trò này riêng biệt.
Thời gian chậm crawl có được hỗ trợ bởi mỗi trình thu thập không?
Thời gian chậm crawl không được hỗ trợ đồng nhất bởi mọi trình thu thập. Kiểm tra tài liệu triển khai và thiết lập tốc độ phù hợp cho công việc của riêng bạn. Không coi trường này là thực thi tải máy chủ toàn cầu.
Một trình thu thập có thể tiến hành khi robots.txt bị thiếu không?
Một trình thu thập phải áp dụng xử lý trạng thái truy xuất của giao thức và chính sách quyền hạn của dự án khi robots.txt bị thiếu. Sự vắng mặt của tệp không giải quyết quyền truy cập hợp pháp hoặc sử dụng dữ liệu. Ghi lại trạng thái trước khi quyết định phạm vi.