Web Scraping Có Hợp Pháp Không? Hướng Dẫn Rủi Ro và Tuân Thủ

Web Scraping có hợp pháp không?

Trình duyệt thu thập thông tin không có rác tự động truy cập vào các trang web công khai, trong khi mỗi người dùng vẫn chịu trách nhiệm về tính hợp pháp và việc sử dụng dữ liệu đã thu thập.

  • Web scraping không được điều chỉnh bởi một quy tắc có tính chất yes-or-no toàn cầu. Rủi ro phụ thuộc vào quyền tài phán, phương thức truy cập, dữ liệu, điều khoản hợp đồng, hành vi thu thập và cách sử dụng tiếp theo.
  • Sự công khai liên quan nhưng không phải là một biện hộ hoàn chỉnh. Bản quyền, quyền riêng tư, quyền cơ sở dữ liệu, hợp đồng, xâm phạm, và các yêu cầu về cạnh tranh không công bằng có thể áp dụng ngay cả khi một trang không cần đăng nhập.
  • Các kiểm soát truy cập thay đổi phân tích. Việc thu thập tài liệu đã được xác thực, có phí, riêng tư hoặc bị giới hạn kỹ thuật tạo ra rủi ro cao hơn nhiều so với việc đọc các trang công khai thực sự.
  • Việc thu thập và sử dụng là hai câu hỏi pháp lý riêng biệt. Một phương pháp truy cập hợp pháp không tự động ủy quyền việc công bố lại, lập hồ sơ, bán lại hoặc đào tạo mô hình.
  • Một đánh giá có tài liệu là câu trả lời thực tiễn. Xác định mục đích, tối thiểu hóa các lĩnh vực, tôn trọng các ràng buộc nguồn, bảo vệ dữ liệu, và nhận tư vấn pháp lý đủ điều kiện cho các dự án có hậu quả.

Web scraping là một phương pháp tự động để lấy các trang web hoặc phản hồi liên quan và trích xuất thông tin được chọn. Kỹ thuật này tự nó không phải là một sự cho phép toàn diện cũng như không phải là một sự cấm đoán toàn diện. Sự tiếp xúc pháp lý phát sinh từ những gì hệ thống truy cập, cách mà nó truy cập, những quyền nào gắn liền với tài liệu, những thỏa thuận nào áp dụng, những thiệt hại nào xảy ra, và cách dữ liệu thu được được sử dụng.

Cách tiếp cận ưu tiên ngữ cảnh này tránh được hai sai lầm phổ biến: “mọi thứ công khai đều miễn phí để sử dụng” và “tất cả việc thu thập tự động đều là bất hợp pháp.” Một đánh giá cẩn thận phân tách luật truy cập máy tính, hợp đồng, bản quyền, quyền riêng tư, bảo vệ cơ sở dữ liệu, hành vi kỹ thuật và việc sử dụng kinh doanh sau này.

Truy cập Công khai, Đã xác thực và Hạn chế

Các trang công khai có sẵn mà không cần tài khoản, quyền riêng tư cá nhân hóa, hoặc rào cản kiểm soát ai có thể xem tài liệu. Các trang xác thực yêu cầu thông tin đăng nhập hoặc phiên người dùng. Các khu vực bị hạn chế có thể liên quan đến tường thu phí, API riêng, cổng kỹ thuật, hoặc ranh giới ủy quyền rõ ràng. Những danh mục này là thông tin thực tế, không phải là kết luận pháp lý cuối cùng.

Tại Hoa Kỳ, điều Ý kiến của Tòa án Ninth Circuit về hiQ Labs v. LinkedIn giải quyết các vấn đề về lệnh sơ bộ và Đạo luật Lừa đảo và Lạm dụng Máy tính trong bối cảnh dữ liệu hồ sơ công khai. Quyết định này quan trọng nhưng không tạo ra quyền phổ quát để thu thập, xóa bỏ các yêu cầu hợp đồng, giải quyết quyền tác giả, hoặc kiểm soát mọi quyền tài phán.

Truy cập tài liệu riêng tư, sử dụng thông tin xác thực ngoài phạm vi cho phép của họ, hoặc vượt qua một kiểm soát sẽ làm tăng một hồ sơ rủi ro khác. Một thiết kế tuân thủ nên xác định sự đại diện chính xác mà đang được yêu cầu và tránh thu thập dữ liệu chỉ vì một phiên trình duyệt có thể kỹ thuật đạt được nó.

Điều khoản Dịch vụ và Hợp đồng

Các điều khoản trên website có thể hạn chế quyền truy cập tự động, sao chép, sử dụng tài khoản hoặc tái sử dụng thương mại. Việc các điều khoản này có hình thành một hợp đồng có thể thi hành hay không và các biện pháp khắc phục áp dụng là gì phụ thuộc vào thông báo, sự đồng ý, tình trạng người dùng, quyền tài phán và các sự kiện. Một tệp robots.txt không giống như một hợp đồng, mặc dù việc bỏ qua sự ưu tiên thu thập thông tin rõ ràng vẫn có thể ảnh hưởng đến rủi ro, quan hệ nguồn và hành vi kỹ thuật.

Các nhóm nên lưu các điều khoản đã xem xét, ngày có hiệu lực của chúng, các điều khoản liên quan và quy định pháp lý cho quy trình làm việc dự kiến. Nếu nguồn cung cấp một API hoặc giấy phép được ủy quyền đáp ứng nhu cầu, con đường đó có thể cung cấp quyền rõ ràng hơn và hợp đồng dữ liệu ổn định. Quyền hạn nên được ghi lại, không giả định từ một cuộc trò chuyện không chính thức.

Bản quyền và Quyền cơ sở dữ liệu

Sự thật và biểu đạt sáng tạo không được xem xét tương đương. Các giá trị thực tế riêng lẻ có thể nhận được sự bảo vệ bản quyền khác nhau so với các bài viết gốc, hình ảnh, mô tả sản phẩm, hoặc một sự lựa chọn và sắp xếp sáng tạo. Ngay cả khi việc trích xuất là hợp pháp, việc công bố lại các biểu đạt được bảo vệ hoặc phân phối nội dung sao chép có thể tạo ra rủi ro vi phạm.

Những FAQ về sử dụng hợp lý của Văn phòng Bản quyền Hoa Kỳ nhấn mạnh rằng việc sử dụng hợp lý phụ thuộc vào hoàn cảnh hơn là một số lượng từ cố định hoặc quy tắc đơn giản. Một dự án nên phân tích những gì được sao chép, mục đích và đặc điểm của việc sử dụng, bản chất của tác phẩm, lượng đã sử dụng, và ảnh hưởng đến thị trường với sự tư vấn nếu cần.

Một số quốc gia cũng bảo vệ các cơ sở dữ liệu đủ điều kiện chống lại việc trích xuất hoặc tái sử dụng các phần quan trọng, bao gồm việc trích xuất lặp đi lặp lại trong một số trường hợp. Phân tích quyền cơ sở dữ liệu là tách biệt với quyền tác giả trong các hồ sơ riêng lẻ. Việc thu thập xuyên biên giới có thể kích hoạt nhiều chế độ cùng một lúc.

Quyền riêng tư và Dữ liệu Cá nhân

Dữ liệu cá nhân công khai vẫn là dữ liệu cá nhân. Tên, hồ sơ, thông tin liên lạc, vị trí chính xác, định danh, ý kiến và thuộc tính suy diễn có thể bị ảnh hưởng bởi các quy tắc về quyền riêng tư và bảo vệ dữ liệu. Một nhà thu thập có thể cần một cơ sở hợp pháp, tính minh bạch, giới hạn mục đích, giảm thiểu, kiểm soát thời gian lưu trữ, bảo mật và quy trình cho các quyền cá nhân.

The Quy định Bảo vệ Dữ liệu Chung định nghĩa việc xử lý một cách rộng rãi và áp đặt những nghĩa vụ có thể áp dụng cho việc thu thập, lưu trữ, phân tích và tiết lộ. Thực tế là một người đã đăng thông tin công khai không xóa bỏ những nghĩa vụ đó hay tự động ủy quyền cho một mục đích mới.

Các dự án có rủi ro cao bao gồm giải quyết danh tính, suy luận danh mục nhạy cảm, quyết định về việc làm hoặc tín dụng, theo dõi vị trí, dữ liệu của trẻ em, hình ảnh khuôn mặt và tổng hợp liên hệ quy mô lớn. Giảm thiểu dữ liệu vừa là một biện pháp kiểm soát tuân thủ vừa là kiểm soát kỹ thuật: các trường không được thu thập sẽ không thể bị rò rỉ hoặc bị lạm dụng sau này.

Robots.txt, Tỷ lệ và Tác động Nguồn

Robots.txt truyền đạt quyền truy cập của trình thu thập theo một giao thức tiêu chuẩn hóa. Thông số kỹ thuật của Giao thức Loại trừ Robots cũng làm rõ rằng các quy tắc này không phải là cơ chế cấp phép truy cập. Tác động pháp lý có thể thay đổi, nhưng một người thu thập có trách nhiệm vẫn đánh giá chúng cùng với các điều khoản, sự cho phép, sự ổn định của nguồn gốc và mục đích đã nêu.

Hành vi yêu cầu là quan trọng. Sự đồng thời quá mức, tải xuống lớn lặp đi lặp lại, hoặc việc thu thập làm suy yếu một dịch vụ có thể tạo ra các rủi ro kỹ thuật và pháp lý độc lập với chủ đề của dữ liệu. Sử dụng tỷ lệ giới hạn, lưu trữ các tài nguyên không thay đổi khi được phép, xác định quyền sở hữu nội bộ và cung cấp cơ chế dừng khi một nguồn phản đối hoặc đánh giá rủi ro thay đổi.

Thu thập không giống như sử dụng

Một nhóm có thể truy cập một trang nhưng thiếu quyền tái xuất bản hình ảnh của nó, tạo hồ sơ cá nhân, gửi thông điệp tiếp thị, hoặc bán lại bộ dữ liệu. Mỗi dự án nên định nghĩa mục đích hạ nguồn trước khi bắt đầu thu thập. “Nghiên cứu”, “AI” hoặc “phân tích” là quá rộng để phục vụ như một mục đích hoạt động.

Dữ liệu đã được xử lý cũng cần đánh giá. Việc kết hợp các đoạn công khai có thể tạo ra một hồ sơ nhạy cảm mà không nguồn nào đã hiển thị. Các suy diễn có thể không chính xác, phân biệt đối xử, hoặc chịu ảnh hưởng của các quy tắc quyết định tự động. Bảo tồn nguồn gốc, tách biệt các giá trị quan sát được khỏi suy diễn và cung cấp đánh giá nhân sự và pháp lý thích hợp cho các quyết định có ảnh hưởng lớn.

Danh sách kiểm tra đánh giá pháp lý thực tiễn

  1. Mô tả mục đích kinh doanh, người dùng, khu vực pháp lý và lợi ích mong đợi bằng các thuật ngữ cụ thể.
  2. Liệt kê chính xác các URL, đường dẫn truy cập, yêu cầu tài khoản, các biện pháp kiểm soát kỹ thuật và quyền sở hữu nguồn.
  3. Kiểm kê các trường và phân loại tài liệu cá nhân, nhạy cảm, được bản quyền, bí mật và có giấy phép.
  4. Xem xét điều khoản, robots.txt, tùy chọn API, giấy phép và sự cho phép bằng văn bản.
  5. Phân tích truy cập máy tính, hợp đồng, bản quyền, cơ sở dữ liệu, quyền riêng tư và các quy tắc cụ thể theo ngành.
  6. Giảm thiểu dữ liệu và khối lượng; định nghĩa tỷ lệ thu thập có giới hạn và một quy trình dừng.
  7. Đặt thời gian giữ lại, bảo mật, truy cập, xóa, sửa chữa và quy trình sự cố.
  8. Xem xét việc xuất bản, bán lại, tiếp cận, lập hồ sơ, đào tạo mô hình và các sử dụng hạ nguồn khác một cách riêng biệt.
  9. Ghi lại chủ quyết định, lời khuyên của cố vấn, điều kiện và ngày để đánh giá lại.

Mẫu hình rủi ro thấp và rủi ro cao

Yếu tốHướng rủi ro thấpHướng rủi ro cao
Truy cậpCác trang công khai thực sựĐăng nhập, tường phí, khu vực riêng tư hoặc kiểm soát bị vô hiệu hóa
Dữ liệuCác thông tin không cá nhân cần thiếtDữ liệu cá nhân nhạy cảm hoặc các tác phẩm sáng tạo
Mục đíchPhân tích nội bộ đã xác địnhTái xuất bản, lập hồ sơ, bán lại hoặc quyết định có ảnh hưởng lớn
Cách thứcĐược giới hạn và nhận thức nguồnKhối lượng quấy rối hoặc bỏ qua phản đối
Quản trịQuyền và kiểm soát đã được tài liệu hóaKhông chủ sở hữu, giới hạn thời gian giữ lại hoặc đánh giá pháp lý

Bảng này là một công cụ phân loại, không phải là một nơi trú ẩn pháp lý an toàn. Một yếu tố rủi ro cao có thể chi phối dự án, và một số yếu tố rủi ro thấp không đảm bảo tính hợp pháp. Cố vấn có đủ điều kiện nên đánh giá các trường hợp hệ quả hoặc không chắc chắn.

Sử dụng Scrapeless một cách có trách nhiệm

Trình duyệt thu thập Scrapeless cung cấp cơ sở hạ tầng tự động hóa trình duyệt; nó không cấp quyền cho nội dung của mục tiêu hoặc quyết định liệu việc sử dụng đề xuất có hợp pháp hay không. Cấu hình quy trình làm việc cho các nguồn công khai, được phép, hạn chế thu thập đến các trường cần thiết và giữ hành vi truy cập tương xứng.

Trước khi mở rộng, hãy ghi lại các URL, trường, quốc gia, tần suất, thời gian giữ lại và người dùng đích. Xem xét Giá Scrapeless cùng với chi phí tuân thủ và lưu trữ. Một con đường tiếp nhận rẻ có thể trở nên đắt đỏ nếu bộ dữ liệu thiếu quyền, nguồn gốc hoặc kiểm soát việc xóa.

Khi nào dừng lại và hỏi ý kiến cố vấn

Tạm dừng dự án khi việc truy cập yêu cầu thông tin xác thực không được cấp phép rõ ràng cho tự động hóa, nguồn đã gửi phản đối, dữ liệu cá nhân hoặc nhạy cảm là cốt lõi, nội dung sẽ được tái xuất bản, một bộ dữ liệu sẽ được bán, hoặc các quyết định tự động có thể ảnh hưởng đến con người. Cũng tạm dừng khi nhóm không thể xác định khu vực pháp lý quản lý, chủ sở hữu quyền, kế hoạch giữ lại hoặc mục đích hợp pháp.

Đánh giá pháp lý nên diễn ra trước khi thu thập và phân phối không thể đảo ngược, chứ không phải sau khi có khiếu nại. Cố vấn có thể thu hẹp phạm vi, xác định một lựa chọn được cấp phép, xin phép, thiết kế thông báo, hoặc xác định rằng việc sử dụng đề xuất không nên tiếp tục.

Kết luận

Việc thu thập dữ liệu trên web có thể hợp pháp, nhưng tính hợp pháp là kết luận cụ thể cho từng trường hợp hơn là thuộc tính của công cụ. Quyền truy cập công khai, điều khoản hợp đồng, bản quyền, quyền riêng tư, bảo vệ cơ sở dữ liệu, hành vi kỹ thuật và sử dụng hạ nguồn đều quan trọng. Mô hình hoạt động hợp lý là xác định mục đích, giảm thiểu phạm vi, tài liệu quyền và kiểm soát, bảo tồn nguồn gốc và nhận được tư vấn đủ điều kiện khi những rủi ro hoặc sự không chắc chắn là quan trọng.

Sẵn sàng xây dựng một quy trình công khai dữ liệu có quản lý?

Sử dụng Scrapeless để thu thập trang công khai được phép sau khi phạm vi pháp lý, kiểm soát và sử dụng hạ nguồn của dự án đã được tài liệu hóa.

Bắt đầu miễn phí →

Câu hỏi thường gặp

Việc thu thập dữ liệu công khai có sẵn có luôn hợp pháp không?

Không. Tính khả dụng công khai là quan trọng đối với phân tích truy cập, nhưng hợp đồng, bản quyền, quyền riêng tư, quyền cơ sở dữ liệu, thiệt hại kỹ thuật và sử dụng hạ nguồn vẫn có thể tạo ra trách nhiệm. Câu trả lời phụ thuộc vào quyền tài phán và các sự kiện.

Tệp robots.txt có làm cho việc thu thập dữ liệu hợp pháp hay bất hợp pháp không?

Không. Robots.txt truyền đạt sở thích của trình thu thập và bản thân nó không phải là một hệ thống ủy quyền truy cập. Nó vẫn nên được xem xét cùng với các điều khoản, quyền, hành vi kỹ thuật và phân tích pháp lý của dự án.

Có thể các điều khoản của một trang web cấm việc thu thập dữ liệu không?

Các điều khoản của trang web có thể hạn chế quyền truy cập tự động hoặc tái sử dụng, và khả năng thi hành phụ thuộc vào thông báo, đồng ý, quyền tài phán và sự kiện. Lưu lại và xem xét các điều khoản áp dụng và tìm kiếm sự cho phép hoặc API được ủy quyền khi thích hợp.

Dữ liệu đã thu thập có thể được công bố lại không?

Không tự động. Việc truy cập thông tin và công bố lại là những hành động riêng biệt. Quyền tác giả, quyền riêng tư, cơ sở dữ liệu, hợp đồng, bảo mật, thuộc tính và quy tắc cấp phép có thể hạn chế việc công bố hoặc tái sử dụng thương mại.

Có hợp pháp để thu thập dữ liệu cá nhân không?

Dữ liệu cá nhân có thể nhìn thấy công khai vẫn phải tuân theo luật bảo vệ dữ liệu. Một người thu thập có thể cần một cơ sở hợp pháp, tính minh bạch, giảm thiểu, bảo mật, giới hạn thời gian lưu trữ và quy trình quyền; việc sử dụng nhạy cảm hoặc có tác động lớn cần được xem xét kỹ lưỡng hơn.

Bước an toàn nhất đầu tiên cho một dự án thu thập dữ liệu là gì?

Xác định chính xác mục đích, URL, trường, phương thức truy cập, quốc gia, tần suất, người dùng và thời gian lưu giữ, sau đó xem xét các điều khoản, quyền, quyền riêng tư và tác động kỹ thuật trước khi thu thập ở quy mô lớn. Tìm kiếm cố vấn đủ điều kiện cho sự không chắc chắn.

Tài liệu tham khảo