Phát Hiện Chống Bot Là Gì? Phân Loại và Chính Sách

Phát Hiện Chống Bot Là Gì?

Trình duyệt Agent không có scrapeless cung cấp một môi trường trình duyệt được quản lý cho tự động hóa web mà gặp phải các kiểm tra trình duyệt và các thử thách được hỗ trợ.

Phát hiện chống bot là quá trình xác định lưu lượng hoặc hành vi tự động để một dịch vụ có thể quyết định cách xử lý nó. Cụm từ này thường được sử dụng cho các hệ thống phân biệt tự động hóa và sử dụng tương tác thông thường và đánh giá liệu hoạt động đó có xung đột với chính sách của trang web hay không. Phát hiện cung cấp bằng chứng; giảm thiểu áp dụng một hành động như quan sát, một thử thách, hoặc từ chối.

Tự động hóa bản thân không phải là một định nghĩa mối đe dọa hoàn chỉnh. Lập chỉ mục tìm kiếm, giám sát thời gian hoạt động, công cụ truy cập, và các tích hợp kinh doanh được phê duyệt có thể hữu ích. Một dịch vụ phải quyết định hành động nào mà nó cho phép và theo điều kiện nào. Một bộ phát hiện nhận ra phần mềm nhưng phớt lờ mục đích và sự cho phép của yêu cầu không thể đưa ra quyết định chính sách đó một mình.

Bắt Đầu Với Hành Vi Được Bảo Vệ

Một chương trình chống bot nên bắt đầu với các hành vi kinh doanh không mong muốn, không phải danh sách các đặc điểm của trình duyệt. Việc tạo tài khoản tự động, lạm dụng tài khoản, tích trữ hàng hóa, và việc thu thập quá mức có thể có những hậu quả khác nhau và đòi hỏi các kiểm soát khác nhau. Phân loại mối đe dọa tự động OWASP tổ chức những mối quan ngại này xung quanh các hành động chống lại các ứng dụng web.

Một dịch vụ đăng ký minh họa có thể quan tâm đến việc đăng ký tài khoản giả nhưng chào đón sự đồng bộ hóa danh mục của đối tác. Cả hai hoạt động đều tự động. Sự phân biệt hữu ích đến từ hoạt động được yêu cầu, mối quan hệ tài khoản, và chính sách của dịch vụ thay vì một quyết định chung rằng tất cả lưu lượng không phải con người là không mong muốn.

Viết kết quả được bảo vệ bằng các thuật ngữ có thể đo lường. Một đội có thể đánh giá liệu một kiểm soát có làm giảm việc đăng ký lạm dụng trong khi duy trì hoàn tất đăng ký hợp pháp không. “Phát hiện nhiều bot hơn” ít hữu ích hơn vì số lượng có thể tăng khi một crawler vô hại được phân loại lại mà không có bất kỳ cải tiến nào cho kết quả kinh doanh.

Có Nhiều Tín Hiệu Tại Nhiều Lớp

Các hệ thống chống bot có thể quan sát ngữ cảnh mạng, đặc điểm giao thức, khả năng trình duyệt, và các mẫu qua các yêu cầu. Mỗi lớp cung cấp một loại bằng chứng khác nhau. Một địa chỉ mô tả một lộ trình, một sự bắt tay TLS mô tả các khả năng đã thương lượng, và các API trình duyệt mô tả các khía cạnh của môi trường runtime.

Sự phân biệt giữa ngón tay thụ động và chủ động của W3C giúp tách biệt các quan sát có sẵn từ các yêu cầu với những cái được thu thập thông qua thực thi phía máy khách. Việc kết hợp các quan sát có thể cải thiện phân loại, nhưng việc kết hợp cũng yêu cầu quan tâm đến quyền riêng tư và cách mà kết luận được rút ra.

Một tín hiệu đơn lẻ hiếm khi xác lập ý định. Các mạng chia sẻ đặt người dùng không liên quan đằng sau một địa chỉ duy nhất. Các cài đặt quyền riêng tư có thể ngăn chặn các tính năng của trình duyệt. Các bản cập nhật phần mềm có thể thay đổi hành vi của một khách hàng hợp pháp. Một bộ phát hiện không nên coi “không bình thường” là “lạm dụng” mà không xem xét hành động và bằng chứng xung quanh nó.

Các Quy Tắc và Mô Hình Tạo Ra Các Trao Đổi Khác Nhau

Các quy tắc mã hóa các điều kiện rõ ràng, trong khi các mô hình thống kê ước lượng các mẫu học từ dữ liệu. Một quy tắc có thể dễ dàng được giải thích và hẹp về phạm vi. Một mô hình có thể kết hợp nhiều tín hiệu nhưng có thể yêu cầu nhiều công sức hơn để đánh giá và hiểu. Các hệ thống thực tế thường sử dụng cả hai.

Đối với một quy tắc, hãy hỏi quan sát nào kích hoạt nó và những người dùng hợp pháp nào có thể chia sẻ quan sát đó. Đối với một mô hình, hãy hỏi đầu ra của nó đã được đánh giá như thế nào với lưu lượng tiêu biểu và cách mà người điều hành giám sát các thay đổi. Không phương pháp nào loại bỏ sự cần thiết cho một chính sách truy cập.

Giữ điểm số của mô hình khác biệt với ngưỡng thực thi. Điểm số thể hiện ước lượng của bộ phát hiện dưới thiết kế của nó. Ngưỡng phản ánh một sự lựa chọn kinh doanh về rủi ro chấp nhận và fricition người dùng. Một ngưỡng phù hợp cho một hành động phục hồi tài khoản có thể quá hạn chế để đọc tài liệu công khai.

Phát Hiện, Thử Thách, và Giảm Thiểu

Phát hiện phân loại hoặc đánh dấu hoạt động. Một thử thách yêu cầu bằng chứng bổ sung. Giảm thiểu thay đổi cách mà dịch vụ xử lý hoạt động. Những giai đoạn này có thể xảy ra cùng nhau trong một sản phẩm, nhưng tách biệt chúng làm cho việc phân tích sự cố và đánh giá sản phẩm rõ ràng hơn.

Một người điều hành có thể ghi lại một yêu cầu đọc nghi ngờ trong khi thử thách một hành động nhạy cảm. Một yêu cầu khác có thể bị từ chối bởi một quy tắc kiểm soát truy cập không liên quan. Kết quả hiển thị một mình không tiết lộ phương pháp phát hiện nào đã được sử dụng. Bảo tồn quy tắc và hành động đã áp dụng trong nhật ký của người điều hành tại nơi mà nền tảng làm cho chúng có sẵn.

Khung phản hồi HTTP mô tả cách thức kết quả được truyền tải, nhưng nó không mã hóa lý do nội bộ đầy đủ về quyết định của một trang web. Một khách hàng bên ngoài nên mô tả những gì nó quan sát thay vì phát minh ra một lời giải thích phát hiện chi tiết.

Dương Tính Giả Có Một Chi Phí Vận Hành

Một trường hợp dương tính giả xảy ra khi hoạt động hợp pháp được coi là lớp không mong muốn. Nó có thể làm gián đoạn người dùng, giảm nhiệm vụ hoàn thành, và tăng công việc hỗ trợ. Đánh giá nó cùng với việc bỏ lỡ lạm dụng thay vì giả định rằng một bộ phát hiện nghiêm ngặt hơn luôn là phát hiện tốt hơn.

Tìm kiếm các nhóm bị ảnh hưởng mà các trung bình rộng lớn ẩn giấu. Các cổng doanh nghiệp, trình duyệt riêng tư, mạng di động, và quy trình làm việc hỗ trợ có thể khác với mẫu lưu lượng chủ đạo. Một kiểm soát hoạt động tốt cho phân khúc lớn nhất vẫn có thể tạo ra sự ma sát không hợp lý ở nơi khác.

Tạo ra một cách cho người dùng hoặc đối tác hợp pháp báo cáo vấn đề với đủ ngữ cảnh đã được làm sạch để điều tra. Người điều hành cần có lộ trình, thời gian và tham chiếu sự kiện liên quan, không phải một đống mật khẩu hoặc cookies. Một quy trình hỗ trợ mà không thể kết nối khiếu nại với một quy tắc đã áp dụng sẽ gặp khó khăn khi cải thiện chính sách.

Sự Thật Đáng Tin Cậy Khó Hơn Nhãn Của Bot

Dữ liệu đánh giá cần có nhãn tương ứng với vấn đề thực tế. Một yêu cầu được sản xuất bởi phần mềm không nhất thiết là độc hại, và một yêu cầu sản xuất qua trình duyệt không nhất thiết phải là chấp nhận. Nhãn chỉ dựa trên loại khách hàng có thể đào tạo hoặc đánh giá mục tiêu sai.

Đối với một hệ thống đăng ký mang tính minh họa, các tài khoản lạm dụng đã được xác nhận và các lượt đăng ký bình thường đã được xác thực có thể cung cấp bằng chứng liên quan hơn so với việc trình duyệt có phải là headless hay không. Ngay cả những nhãn đó cũng có thể không đầy đủ, vì vậy hãy ghi lại cách chúng được thiết lập và các trường hợp nào vẫn không chắc chắn.

Sử dụng một bộ đánh giá giữ lại và xem xét hiệu suất khi nền tảng nguồn thay đổi. Một mô hình phù hợp với lưu lượng truy cập của ngày hôm qua có thể phân loại sai một tích hợp hợp pháp mới. Ghi lại các tiêu chí quyết định và tác động kinh doanh, để việc xem xét có thể phân biệt sự trôi dạt của bộ phát hiện với một sự thay đổi cố ý trong chính sách.

Tự Động Hóa Hợp Pháp Nên Được Nhận Diện

Tự động hóa hợp pháp hưởng lợi từ một giao diện được phê duyệt và một người điều hành có thể xác định. Một API hoặc thỏa thuận truy cập đã được tài liệu hóa cung cấp một cơ sở rõ ràng hơn cho các quyết định so với việc cố gắng suy luận quyền từ sự xuất hiện của trình duyệt. Tích hợp có thể nêu rõ mục đích, lưu lượng dự kiến và thông tin hỗ trợ.

Sở thích của trình thu thập thông tin được truyền đạt qua Giao thức Loại Trừ Robot là một đầu vào để lập kế hoạch quy trình thu thập. Chúng không thay thế xác thực hoặc ủy quyền. Khả năng tiếp cận kỹ thuật của một nguồn không nên được coi là một tuyên bố đầy đủ về việc sử dụng cho phép.

Nếu một tích hợp đã được phê duyệt bị chặn, hãy sử dụng hỗ trợ của người điều hành hoặc quy trình truy cập để giải quyết sự không khớp. Một chỗ ở hẹp, đã được tài liệu hóa dễ duy trì hơn một ngoại lệ không giải thích. Khách hàng thu thập cũng nên giữ cho việc từ chối truy cập riêng biệt với một kết quả rỗng hợp lệ.

Hệ Thống Cơ Sở Hạ Tầng Chống Phát Hiện Làm Gì

Cơ sở hạ tầng trình duyệt có thể quản lý hành vi thời gian chạy và xử lý thách thức được hỗ trợ cho tự động hóa web. Trình Duyệt Đại Diện cung cấp môi trường trình duyệt đó. Nó không biến hành động không được phép thành một hành động được phép, và nó không thể làm chính sách của một trang web bên ngoài trở thành một hằng số.

Sử dụng nền tảng trình duyệt khi nhiệm vụ cần thực thi, trạng thái hoặc tương tác của trình duyệt. Xác thực trang dự kiến ​​sau khi điều hướng và xác nhận các trường đã trích xuất. Các thực hành tự động hóa trình duyệt cung cấp ngữ cảnh cho việc quản lý những lo ngại này trong quy trình thu thập.

Giữ đánh giá sản phẩm liên kết với khối lượng công việc được ủy quyền của bạn. Một lần điều hướng thành công trên một nguồn không thiết lập tỷ lệ thành công toàn cầu. So sánh các ghi chép đã chấp nhận, hành vi phiên và chi phí hoạt động, sử dụng hiện tại giá cả cho cơ sở hạ tầng đang được đánh giá.

Quyền Riêng Tư và Giảm Thiểu Dữ Liệu

Phát hiện chống bot nên thu thập thông tin cần thiết cho mục đích đã nêu và tránh coi mọi thuộc tính trình duyệt có sẵn là cần thiết. Việc giữ lại, truy cập vào telemetry và việc sử dụng thứ hai quan trọng bởi vì những quan sát giống nhau có thể hỗ trợ phân tích an ninh hoặc theo dõi.

Một đánh giá thực tế hỏi các trường nào ảnh hưởng đến quyết định, thời gian giữ lại quan sát thô, và ai có thể kiểm tra chúng. Nếu một tín hiệu thô là đủ cho một điều khiển, việc giữ lại một định danh chi tiết hơn có thể làm lộ ra quyền riêng tư mà không cải thiện kết quả.

Giải thích rõ ràng các kết quả đối diện với người dùng. Một du khách bị từ chối truy cập cần một bước tiếp theo hỗ trợ, trong khi một người điều hành cần đủ chi tiết để điều tra. Những khán giả đó cần thông tin khác nhau. Đừng tiết lộ các nội bộ phát hiện nhạy cảm trong một thông báo lỗi công cộng chỉ để bù đắp cho việc ghi log nội bộ kém.

Kết Luận

Phát hiện chống bot kết nối các quan sát với một phân loại, và chính sách của một dịch vụ kết nối phân loại đó với một hành động. Xác định hành vi không mong muốn trước, đánh giá tác động của người dùng hợp pháp, và bảo tồn bằng chứng về quyết định. Đối với tự động hóa đã được phê duyệt, sử dụng một hợp đồng truy cập rõ ràng và kiểm tra nội dung kết quả thay vì coi sự xuất hiện của trình duyệt là quyền.

Làm Cho Tự Động Hóa Trình Duyệt Quan Sát Được

Sử dụng Trình Duyệt Đại Diện Không Bị Giới Hạn cho các nhiệm vụ được phép và xác thực trang và dữ liệu được sản xuất bởi mỗi quy trình làm việc.

Đăng ký hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.

Nhận $5 Tín Dụng của Bạn →

Câu Hỏi Thường Gặp

Q: Tất cả bot đều có hại không?

Bot không phải tất cả đều có hại. Nhiều bot cung cấp lập chỉ mục, giám sát hoặc các tích hợp được phê duyệt. Một dịch vụ nên quyết định các hoạt động nào được phép và đánh giá hành vi trong chính sách đó hơn là coi tự động hóa là một định nghĩa mối đe dọa hoàn chỉnh.

Q: Phát hiện chống bot có giống như CAPTCHA không?

Phát hiện chống bot rộng hơn CAPTCHA. Một CAPTCHA là một cơ chế thách thức có thể có. Một hệ thống có thể phân loại lưu lượng, ghi lại sự kiện, hoặc từ chối hoạt động mà không hiển thị một câu đố.

Q: Địa chỉ IP có thể chứng minh yêu cầu là lạm dụng không?

Địa chỉ IP đơn lẻ không thể chứng minh rằng một yêu cầu là lạm dụng. Các mạng chia sẻ và trung gian có thể đại diện cho nhiều khách hàng không liên quan. Đánh giá hành động được yêu cầu và các bằng chứng liên quan khác trước khi chỉ định ý định.

Q: Sự khác biệt giữa một phân tích sai và một phát hiện bị bỏ lỡ là gì?

Một phân tích sai đánh dấu hoạt động hợp pháp là không mong muốn; một phát hiện bị bỏ lỡ cho phép hoạt động không mong muốn không được nhận ra. Cả hai đều quan trọng. Sự đánh đổi chấp nhận được phụ thuộc vào hoạt động kinh doanh và các tác động lên người dùng.

Q: Một trình thu thập dữ liệu được phép nên báo cáo chặn như thế nào?

Một trình thu thập dữ liệu được phép nên ghi lại một kết quả không khả dụng hoặc bị từ chối với ngữ cảnh chẩn đoán đã được làm sạch. Nó không nên báo cáo trang này như một kết quả rỗng hợp lệ. Người điều hành có thể điều tra con đường truy cập đã được phê duyệt mà không làm hỏng dữ liệu hạ lưu.

Tài Liệu Tham Khảo