Phân tích Màn Hình so với Phân Tích Web
Trình duyệt phân tích không có scrap hỗ trợ việc trích xuất web công khai được render, là một cách tiếp cận phân tích web có thể tương tác với trạng thái trình bày mà không phụ thuộc vào việc chụp màn hình chỉ bằng pixel.
TL;DR
- Phân tích màn hình đọc một trình bày hướng đến con người. Nó có thể nhắm đến các thiết bị đầu cuối, ứng dụng máy tính để bàn, phiên làm việc từ xa, hình ảnh và các chế độ xem web được render.
- Phân tích web trích xuất thông tin từ các tài nguyên web. Nó có thể phân tích HTML, tiêu thụ phản hồi trang, kiểm tra trạng thái trình duyệt, hoặc sử dụng các kỹ thuật hình ảnh cho nội dung chỉ trên web.
- Các danh mục chồng chéo lên nhau. Đọc một giao diện web được render có thể là cả phân tích web và phân tích màn hình, tùy thuộc vào lớp nào được nhấn mạnh.
- Các lớp có cấu trúc thường vượt trội hơn pixel. HTML, DOM, khả năng truy cập hoặc các điểm cuối được ủy quyền thường nhanh hơn và dễ xác minh hơn so với tọa độ và OCR.
- Quyết định theo dõi nguồn và bằng chứng cần thiết. Sử dụng phân tích màn hình cho các bề mặt không phải web hoặc chỉ hình ảnh; sử dụng phân tích web cho các cấu trúc gốc web; kết hợp chúng chỉ khi nội dung yêu cầu.
Phân tích màn hình và phân tích web đều tự động hóa việc thu thập dữ liệu, nhưng chúng không phải là các danh mục có thể hoán đổi cho nhau. Phân tích màn hình được xác định bởi lớp mà nó đọc: một trình bày dành cho con người. Phân tích web được xác định bởi miền nguồn: các tài nguyên được cung cấp qua web. Một mô tả cách tiếp cận cấp trình bày; cái còn lại mô tả việc trích xuất tập trung vào web.
Sự phân biệt đó giải thích cho sự chồng chéo. Một script phân tích HTML máy chủ là phân tích web nhưng thường không phải là phân tích màn hình. Một công cụ OCR đọc một cửa sổ kế toán trên máy tính để bàn là phân tích màn hình nhưng không phải là phân tích web. Một bot trình duyệt đọc các giá trị từ một ứng dụng web được render có thể được mô tả hợp lý là cả hai.
Sự khác biệt chính trong nháy mắt
| Kích thước | Phân tích màn hình | Phân tích web |
|---|---|---|
| Phạm vi chính | Bất kỳ màn hình máy tính nào hướng về con người | Các trang web và tài nguyên được cung cấp qua web |
| Đầu vào điển hình | Các ô đầu cuối, điều khiển, cây khả năng truy cập, pixel | HTML, DOM, phản hồi, liên kết, trạng thái trình duyệt |
| Công cụ phổ biến | RPA, tự động hóa đầu cuối, OCR, thị giác máy tính | Các khách hàng HTTP, bộ phân tích HTML, trình thu thập thông tin, trình duyệt |
| Rủi ro thay đổi chính | Bố cục, tọa độ, phông chữ, chủ đề, trạng thái cửa sổ | Đánh dấu, điểm cuối, render, điều hướng, chính sách truy cập |
| Đầu ra điển hình | Giá trị suy luận từ một chế độ xem | Các bản ghi được phân tích từ các đại diện web |
| Sự phù hợp tốt nhất | Hệ thống cũ và chỉ hình ảnh | Thu thập dữ liệu gốc web |
Nguồn Dữ Liệu Đến Từ Đâu
Một công cụ phân tích màn hình bắt đầu với những gì xuất hiện trên một màn hình. Một công cụ phân tích đầu cuối đọc các ký tự từ các vị trí hoặc trường. Tự động hóa máy tính để bàn có thể kiểm tra các điều khiển giao diện. OCR đọc các pixel. Hệ thống nền tảng có thể sử dụng cơ sở dữ liệu hoặc API nội bộ, nhưng công cụ phân tích màn hình không phụ thuộc vào việc truy cập trực tiếp tới nó.
Một công cụ phân tích web bắt đầu với một URL hoặc tài nguyên được cung cấp qua web. Nó có thể lấy HTML ban đầu, theo các liên kết, phân tích thuộc tính, kiểm tra siêu dữ liệu có cấu trúc, render JavaScript, hoặc thu thập phản hồi mạng. Trang có thể chỉ là một trong nhiều đại diện hữu ích. Một quy trình làm việc web tốt chọn lớp ủy quyền ổn định nhất thay vì phụ thuộc vào pixel mà người dùng thấy.
Tốc độ, Độ chính xác và Bảo trì
Trích xuất web có cấu trúc thường nhanh hơn vì nó có thể đọc văn bản và thuộc tính mà không cần nhận diện hình ảnh. Nó cũng cung cấp các điểm xác thực như mối quan hệ phần tử, định danh bản ghi, URL, và sơ đồ phản hồi. Phân tích màn hình có thể cần phải render mỗi chế độ xem, chờ bố cục, xác định một vùng, và giải thích ký tự với OCR.
Độ chính xác phụ thuộc vào trường, không chỉ vào danh mục. Một trường đầu cuối ổn định có thể rất đáng tin cậy; HTML có cấu trúc kém có thể khó khăn. Các phương pháp pixel nhạy cảm với quy mô, độ tương phản, che khuất và sự thay đổi phông chữ. Các bộ phân tích web nhạy cảm với các thay đổi trong mẫu và render. Cả hai đều cần xác thực theo cấp trường và kiểm tra hồi quy đại diện.
Tổng quan về WAI-ARIA cho thấy cách các vai trò và tên có thể truy cập thêm ngữ nghĩa cho các giao diện. Khi tự động hóa được ủy quyền có thể đọc những tín hiệu đó, chúng có thể tạo cầu nối giữa tọa độ dễ bị tổn thương và hiểu biết giao diện phong phú hơn.
Tự động hóa Trình Duyệt Làm Mờ Ranh Giới
Một nhiệm vụ tự động hóa trình duyệt có thể nhấp vào một điều khiển, chờ trạng thái đã được hiển thị và đọc văn bản dựa trên DOM. Nó tương tác với phần trình bày nhưng vẫn sử dụng cấu trúc gốc web. Gọi quy trình đó là thu thập dữ liệu web nhấn mạnh nguồn web; gọi nó là thu thập dữ liệu màn hình nhấn mạnh giao diện đã được hiển thị. Chi tiết triển khai quan trọng hơn nhãn.
Biểu đồ Canvas và nội dung dựa trên hình ảnh đưa quy trình hướng tới việc trích xuất hình ảnh. Một phản hồi JSON nhúng hoặc bảng ngữ nghĩa đẩy nó về phía phân tích cấu trúc. Quy trình kết hợp có thể sử dụng tương tác trình duyệt để điều hướng, phản hồi mạng cho dữ liệu và chụp màn hình cho bằng chứng hình ảnh. Mỗi đầu ra nên ghi lại lớp nguồn của nó để người dùng sau này hiểu những gì thực sự được quan sát.
Độ tin cậy theo Lớp Trích xuất
- Ưu tiên API hoặc xuất tài liệu có thẩm quyền khi điều đó đáp ứng yêu cầu.
- Đối với các trang web, ưu tiên phản hồi cấu trúc ổn định hoặc HTML ngữ nghĩa khi được phép và chính xác.
- Sử dụng DOM đã được hiển thị hoặc trạng thái khả năng tiếp cận khi cần thực thi từ phía khách hàng.
- Sử dụng OCR hoặc chụp dựa trên tọa độ khi thông tin chỉ có trong pixel hoặc một màn hình từ xa.
- Xác thực bản ghi được trích xuất độc lập với phương pháp định vị.
Thứ tự này là một phương pháp duy trì, không phải là một hạng mục quyền truy cập. Một điểm cuối nội bộ không tự động được ủy quyền chỉ vì một trình duyệt có thể gọi nó, và một API có thể có điều khoản không cho phép tái sử dụng như dự định. Cả quyền phép và tính khả thi kỹ thuật đều phải được đánh giá.
An toàn và Quyền riêng tư
Thu thập dữ liệu màn hình của các ứng dụng xác thực có thể làm lộ thông tin đăng nhập, dữ liệu phiên và mọi thứ có thể nhìn thấy trong giao diện. Chụp màn hình có thể ghi lại các trường cá nhân hoặc bí mật không liên quan. Thu thập dữ liệu web cũng có thể thu thập dữ liệu nhạy cảm hoặc tương tác với các quyền truy cập. Cả hai phương pháp cần có quyền tối thiểu, tối giản dữ liệu, xử lý bí mật an toàn, giới hạn lưu giữ và nhật ký kiểm tra.
Người Quy định Bảo vệ Dữ liệu Chung đối xử với việc thu thập, lưu trữ, sử dụng và tiết lộ dữ liệu cá nhân như các hoạt động xử lý. Một trường nhìn thấy không mất trạng thái dữ liệu cá nhân của nó chỉ vì tự động hóa đọc nó từ HTML hoặc pixel.
Khi nào nên chọn Thu thập dữ liệu Màn hình
- Nguồn không dựa trên web. Một ứng dụng trên máy chủ, máy tính để bàn, máy tính để bàn ảo, hoặc phiên từ xa không có giao diện hỗ trợ phù hợp.
- Kết quả hình ảnh là bằng chứng cần thiết. Bố cục, trạng thái biểu đồ, hoặc phần trình bày trên màn hình có liên quan đến trường hợp sử dụng.
- Nội dung chỉ tồn tại dưới dạng pixel. OCR hoặc thị giác máy tính là cần thiết cho hình ảnh, canvas, quét hoặc khung video.
- Cần một cầu nối di sản có kiểm soát. Một quy trình được ủy quyền phải kết nối các hệ thống cũ và mới trong khi việc thay thế là không thực tế.
Khi nào nên chọn Thu thập dữ liệu Web
- Nguồn là một trang web công khai. HTML, liên kết, thuộc tính và phản hồi trang chứa các bản ghi cần thiết.
- Khám phá là điều quan trọng. Quy trình phải theo các URL, phân trang, sơ đồ trang web hoặc điều hướng có cấu trúc qua nhiều trang.
- Cấu trúc ngữ nghĩa có sẵn. Mối quan hệ DOM, siêu dữ liệu hoặc phản hồi cung cấp danh tính trường mạnh hơn so với pixel.
- Quy mô và đầu ra chuẩn hóa là quan trọng. Công việc cần các bản ghi có thể lặp lại, nguồn gốc, loại bỏ bản sao, và làm mới theo lịch trình.
Câu hỏi Pháp lý và Đạo đức Chung
Không có nhãn nào xác định tính hợp pháp. Xem xét ủy quyền, quyền truy cập, điều khoản, bản quyền, quyền riêng tư, quyền cơ sở dữ liệu, hành vi yêu cầu và sử dụng phía dưới. Quy chuẩn Giao thức Exclusion Robots chuẩn hóa hướng dẫn cho crawler đối với các tài nguyên web nhưng không phải là cơ chế ủy quyền. Thu thập dữ liệu màn hình không phải web có các hợp đồng, giấy phép, thông tin đăng nhập và quy tắc nơi làm việc hoặc lĩnh vực riêng.
Chỉ thu thập những gì mục đích nêu rõ cần. Tránh các nguồn hạn chế hoặc riêng tư mà không có ủy quyền rõ ràng. Giữ khối lượng tương xứng, bảo mật dữ liệu, ghi lại nguồn gốc, và cung cấp quy trình xóa bỏ và sự cố nơi có thể. Tìm kiếm lời khuyên đủ tiêu chuẩn cho các dự án có tác động cao hoặc không chắc chắn.
Một Khung Quyết định Thực tế
- Xác định xem nguồn là web, máy tính để bàn, đầu cuối, hình ảnh, tài liệu, hoặc màn hình từ xa.
- Liệt kê các giao diện được ủy quyền từ cấu trúc nhất đến hình ảnh nhất.
- Xác định các trường chính xác, bằng chứng hình ảnh, độ tươi, quy mô và lỗi chấp nhận được.
- Đánh giá độ nhạy cảm với thay đổi, nỗ lực xác thực, rủi ro thông tin đăng nhập, và duy trì.
- Chọn một lớp trích xuất chính và gán nhãn cho bất kỳ sự fallback nào đã lấy hoặc hình ảnh.
- Kiểm tra bố cục, địa điểm, các trường trống, kết xuất chậm, bản sao, và thay đổi nguồn.
- Ghi lại quyền phép, nguồn gốc, phiên bản quy tắc, và quyền sở hữu ngoại lệ.
Sử dụng Scrapeless cho Phía Web
Trình duyệt Scraping Scrapeless phù hợp cho các trang công khai được trình duyệt hiển thị cần điều hướng hoặc JavaScript. Một quy trình làm việc có thể tương tác với trang và sau đó trích xuất từ trạng thái DOM ngữ nghĩa thay vì mặc định sử dụng OCR. Việc chụp hình ảnh vẫn khả dụng khi kết quả trên màn hình thực sự quan trọng.
Lập kế hoạch thời gian chạy trình duyệt, số trang, hành vi phiên và phân tích dưới dòng một cách riêng biệt. Xem xét Giá cả không rác với khối lượng thu mua dự kiến. Chi phí bảo trì cũng nên bao gồm các bài kiểm tra bộ lựa chọn, kiểm tra trực quan, xác minh dữ liệu và xem xét chính sách nguồn.
Danh sách kiểm tra đánh giá
Đo lường độ chính xác của trường, độ đầy đủ của bản ghi, các đối tượng khớp sai, bản ghi bị bỏ lỡ, độ trễ, chi phí thời gian chạy và khả năng thay đổi. Đối với OCR, kiểm tra phông chữ, tỷ lệ, độ tương phản và ngôn ngữ. Đối với phân tích DOM, kiểm tra các biến thể mẫu và kết xuất khách hàng. Đối với cả hai, giữ lại bằng chứng đại diện và so sánh danh tính được trích xuất với một nguồn độc lập nơi mà hậu quả của lỗi là cao.
Kết luận
Chụp màn hình và trích xuất web có sự chồng chéo, nhưng chúng mô tả các ranh giới khác nhau. Chụp màn hình đọc một cách trình bày hướng đến con người qua nhiều loại hệ thống; trích xuất web lấy từ các nguồn web sử dụng bất cứ thứ gì từ HTML thô đến trình duyệt đã được kết xuất. Chọn lớp được ủy quyền phong phú nhất mà vẫn giữ ý nghĩa cần thiết, và coi việc chụp hình ảnh là một phương pháp có chủ đích thay vì là mặc định.
Sẵn sàng trích xuất từ các trang web đã được kết xuất?
Sử dụng Scrapeless Scraping Browser cho phía web của quy trình làm việc và giữ việc trích xuất ngữ nghĩa, bằng chứng hình ảnh và xác minh được tách biệt rõ ràng.
Bắt đầu miễn phí →Câu hỏi thường gặp
Sự khác biệt chính giữa chụp màn hình và trích xuất web là gì?
Chụp màn hình được định nghĩa bằng cách đọc một cách trình bày hướng đến con người, trong khi trích xuất web được định nghĩa bằng cách lấy từ các nguồn web. Chụp màn hình có thể nhắm đến các hệ thống không phải web; trích xuất web có thể đọc dữ liệu web có cấu trúc mà không sử dụng màn hình hiển thị.
Một quy trình làm việc có thể vừa là chụp màn hình vừa là trích xuất web không?
Có. Một con bot trình duyệt đọc một giao diện web đã được kết xuất có thể phù hợp với cả hai mô tả. Ghi lại liệu giá trị có đến từ các phần tử DOM, phản hồi mạng, trạng thái khả năng tiếp cận, hay pixel vì điều đó xác định độ tin cậy.
Phương pháp nào chính xác hơn?
Trích xuất có cấu trúc từ một lớp được ủy quyền ổn định thường dễ xác minh hơn so với OCR pixel, nhưng độ chính xác phụ thuộc vào nguồn và các bài kiểm tra. Một trường đầu vào ổn định có thể vượt trội hơn HTML không ổn định, và bất kỳ phương pháp nào cũng có thể đọc sai dữ liệu một cách âm thầm.
Phương pháp nào nhanh hơn?
Phân tích web của HTML hoặc phản hồi có cấu trúc thường nhanh hơn việc kết xuất và OCR. Tương tác với trình duyệt và phân tích trực quan làm tăng thời gian chạy, nhưng chúng có thể cần thiết cho nội dung đã được kết xuất từ khách hàng hoặc chỉ pixel.
Chụp màn hình và trích xuất web có hợp pháp không?
Cả hai đều có thể hợp pháp hoặc bất hợp pháp tùy thuộc vào ủy quyền, kiểm soát truy cập, điều khoản, quyền lợi, quyền riêng tư, hành vi, quyền tài phán và sử dụng. Nhãn kỹ thuật không quyết định tính hợp pháp.
Có nên sử dụng OCR cho các trang web không?
Sử dụng OCR khi thông tin cần thiết thực sự chỉ tồn tại trong pixel, chẳng hạn như nội dung canvas hoặc hình ảnh. Ưu tiên dữ liệu DOM, khả năng tiếp cận hoặc phản hồi có cấu trúc khi các lớp ủy quyền đó mang cùng một ý nghĩa.