Loại bỏ boilerplate là gì? Phương pháp và đánh giá

Loại bỏ boilerplate là gì?

API thu thập dữ liệu Scraping Universal không có rác thu thập các trang web công khai mà nội dung trả về có thể được xử lý bởi hệ thống loại bỏ boilerplate và extraction nội dung chính.

TL;DR

  • Loại bỏ boilerplate tách biệt nội dung chính khỏi các phần trang lặp lại. Các mục tiêu thường gặp bao gồm điều hướng, thông báo cookie, quảng cáo, chân trang, thanh bên và đường ray gợi ý.
  • Nhiệm vụ là phân loại, không phải loại bỏ thẻ. Cả văn bản chính và boilerplate đều nằm trong các phần tử HTML hợp lệ, vì vậy cấu trúc, mật độ, sự lặp lại và tín hiệu ngôn ngữ đều quan trọng.
  • Không có phương pháp nào hoàn hảo cho mọi trang. Các quy tắc, heuristics, so sánh mẫu, học máy và các tính năng hình ảnh có các chế độ thất bại khác nhau.
  • Độ chính xác và độ thu hồi kéo theo các hướng ngược nhau. Làm sạch táo bạo loại bỏ tiếng ồn nhưng có thể xóa caption, cảnh báo, bảng và văn bản quan trọng nhưng lặp lại.
  • Các hệ thống sản xuất cần chứng cứ và các bài kiểm tra hồi quy. Bảo tồn các quyết định khối, ngữ cảnh nguồn, phiên bản thuật toán và các trang được gán nhãn đại diện.

Loại bỏ boilerplate là quá trình xác định và loại trừ các phần của một trang không phải là nội dung chính cho một mục đích nhất định. Trên trang bài viết, nội dung chính có thể là tiêu đề, tên tác giả, nội dung chính, tiêu đề, trích dẫn và hình ảnh liên quan. Boilerplate có thể bao gồm điều hướng trang web, kiểm soát tài khoản, biểu ngữ cookie, liên kết chân trang, quảng cáo, nút mạng xã hội và những gợi ý lặp lại.

Giới hạn phụ thuộc vào người tiêu dùng. Một chế độ xem đọc có thể bỏ qua bảng thông số sản phẩm mà một bộ máy trích xuất danh mục coi là thiết yếu. Một chỉ mục tìm kiếm có thể giữ tiêu đề và caption; một tập hợp mô hình ngôn ngữ có thể cần các thông báo pháp lý được bảo tồn cho ngữ cảnh. “Boilerplate” do đó là một nhãn theo nhiệm vụ hơn là một thuộc tính nội tại của mọi khối.

Tại sao việc loại bỏ thẻ HTML không đủ

Loại bỏ markup để lại tất cả văn bản nhìn thấy trong thứ tự tài liệu. Kết quả thường bắt đầu với thực đơn, yêu cầu tài khoản, danh sách danh mục, thông báo đồng ý và các liên kết lặp lại trước khi đến với bài viết. Nó có thể kết thúc với các câu chuyện liên quan và một chân trang lớn. Những từ đó là văn bản hợp lệ, nhưng chúng làm loãng chủ đề của tài liệu và tạo ra vật liệu trùng lặp trên nhiều trang.

Văn bản chính và boilerplate có thể sử dụng cùng một div, p, hoặc a các phần tử. Một hệ thống loại bỏ phải lý luận về các khối và ngữ cảnh: khu vực chứa bao nhiêu văn bản, chứa bao nhiêu liên kết, xuất hiện ở đâu, liệu nó có lặp lại trên các trang, phần tử ngữ nghĩa nào chứa nó, và liệu các khối lân cận có tạo thành văn bản mạch lạc hay không.

Phương pháp Dựa trên Quy tắc và Ngữ nghĩa

Các quy tắc có thể bao gồm hoặc loại trừ các bộ chọn, phần tử, ID, vai trò và điểm mốc đã biết. Các phần tử HTML ngữ nghĩa như bài viết, điều hướng, chính, tiêu đề và chân trang cung cấp những gợi ý hữu ích. Các quy tắc nhanh chóng và có thể giải thích cho một miền kiểm soát, và một nhà xuất bản có thể thiết kế các mẫu mà tiết lộ ranh giới nội dung ổn định.

Các quy tắc thất bại khi các trang sử dụng các container chung, lớp tạo ra, bài viết lồng ghép, hoặc markup không đồng nhất. Một quy tắc toàn cầu loại bỏ mọi chân trang có thể xóa một ghi chú trích dẫn bên trong một bài viết. Một quy tắc giữ mọi phần tử chính có thể giữ bộ lọc sản phẩm hoặc kiểm soát ứng dụng. Các quy tắc miền cần các gia đình mẫu, ngoại lệ và các trang hồi quy.

Hướng dẫn phân section của tiêu chuẩn HTML định nghĩa các phần tử ngữ nghĩa, nhưng các hệ thống extraction nên xem xét chúng như các tín hiệu thay vì các bảo đảm. Markup đúng cải thiện khả năng có ranh giới sạch mà không loại bỏ nhu cầu xác thực.

Heuristics Mật độ Văn bản và Mật độ Liên kết

Các phương pháp mật độ văn bản chia một trang thành các khối hoặc dòng và đánh giá bao nhiêu văn bản ngôn ngữ tự nhiên xuất hiện so với các thẻ hoặc markup. Các đoạn dài với dấu câu thường được đánh giá là nội dung. Mật độ liên kết giúp xác định điều hướng và danh sách gợi ý, nơi phần lớn văn bản nằm bên trong các thẻ liên kết.

Các heuristics này hiệu quả và linh hoạt về ngôn ngữ, nhưng các bài viết ngắn, thơ, công thức, bài đăng diễn đàn, bảng và các câu chuyện có hình ảnh dẫn dắt có thể vi phạm các giả định của chúng. Điều hướng có thể chứa các mô tả dài, trong khi một bản tin hợp lệ có thể ngắn. Mối quan hệ lân cận và ngữ cảnh cấp trang cải thiện quyết định so với một ngưỡng trên một khối.

Phát hiện Mẫu và Giao diện Trang

Boilerplate thường lặp lại trên các trang cùng một trang web. Một hệ thống có thể so sánh nhiều tài liệu và đánh dấu các khối, đường dẫn, hoặc chữ ký văn bản lặp lại. Điều này nắm bắt được điều hướng và nội dung chân trang đặc thù của trang mà không cần viết tay mọi bộ chọn. Nó cũng thích ứng với các ngôn ngữ mà quy tắc dấu câu hoặc mật độ từ hành xử khác nhau.

Sự lặp lại không phải là bằng chứng của sự không liên quan. Một thông số sản phẩm, cảnh báo an toàn, tiểu sử tác giả, hoặc điều kiện pháp lý có thể xuất hiện trên nhiều trang và vẫn quan trọng với nhiệm vụ. Các phương pháp xuyên trang nên tạo ra boilerplate ứng viên mà được đánh giá dựa trên sơ đồ nội dung dự định, không phải danh sách xóa tự động.

Học Máy và Phân loại Cấu trúc

Các hệ thống học máy phân loại các khối sử dụng các đặc tính văn bản, cấu trúc, hình ảnh và lân cận. Các mô hình dãy có thể sử dụng thực tế rằng các khối nội dung có xu hướng xảy ra trong chuỗi, trong khi các phương pháp đồ thị có thể kết nối các khối tương tự hoặc các quan hệ bố cục. Bài báo Web2Text miêu tả dự đoán cấu trúc sâu cho việc tách biệt boilerplate và nội dung chính.

Các mô hình có thể tổng quát trên các mẫu chưa thấy, nhưng chúng thừa hưởng các nhãn và kiểu trang được sử dụng cho huấn luyện. Một mô hình được huấn luyện trên các bài viết tin tức trên máy tính có thể thất bại trên các trang thương mại di động hoặc diễn đàn đa ngôn ngữ. Phiên bản mô hình, ghi lại độ tin cậy và các quyết định khối, và so sánh hiệu suất giữa các loại nội dung thay vì báo cáo một điểm tổng hợp.

Các Đặc điểm Hình ảnh và Rendered

Một số ranh giới trở nên rõ ràng hơn sau khi hiển thị. Vị trí, khả năng hiển thị, kích thước, chồng chéo và bố cục phản ứng có thể phân biệt một ngăn điều hướng ẩn với văn bản bài viết. Hình ảnh liên quan có thể cần thông tin bố cục trực quan mà HTML thô không thể cung cấp. Hiển thị cũng phơi bày nội dung được thêm bởi JavaScript.

Các tính năng trực quan tốn nhiều chi phí hơn để có được và phụ thuộc vào viewport, tỷ lệ thiết bị, phông chữ và thời gian. Một bố cục di động có thể di chuyển điều hướng vào một hộp thoại và sắp xếp lại nội dung. Nếu bố cục ảnh hưởng đến phân loại, quá trình ghi lại nên ghi lại viewport và trạng thái đã hiển thị để kết quả có thể tái tạo.

Độ Chính Xác, Độ Phục Hồi và Lỗi Ranh Giới

Đối với phát hiện boilerplate, độ chính xác hỏi bao nhiêu nội dung bị loại bỏ thực sự là boilerplate; độ phục hồi hỏi bao nhiêu boilerplate hệ thống đã tìm thấy. Đối với việc trích xuất nội dung chính, góc nhìn có thể được đảo ngược: độ chính xác thưởng cho đầu ra sạch, trong khi độ phục hồi thưởng cho việc bảo tồn tất cả các khối liên quan. Quy ước báo cáo được chọn nên được nêu rõ ràng.

Các lỗi ranh giới cần được chú ý riêng. Một hệ thống có thể trích xuất bài viết nhưng bỏ qua đoạn mở đầu của nó, bao gồm thẻ câu chuyện liên quan đầu tiên, bỏ qua mọi chú thích hoặc sao chép các phiên bản phản ứng. Trung bình theo khối có thể che giấu những khiếm khuyết đó mặc dù chúng gây hại cho trải nghiệm đọc hoặc chất lượng thu hồi.

Mozilla Readability cung cấp một triển khai thực tế và một bộ sưu tập các trang thử nghiệm. Một bộ kiểm tra hồi quy đại diện là rất quan trọng vì một thay đổi cải thiện một bố cục có thể giảm chất lượng trên một bố cục khác.

Loại bỏ Boilerplate cho Tìm Kiếm và RAG

Nội dung điều hướng và văn bản chân trang lặp lại có thể thống trị số lượng token, tạo ra các đoạn trùng lặp và khiến việc thu hồi trả về chrome trang thay vì câu trả lời được yêu cầu. Loại bỏ boilerplate cải thiện sự tập trung của tài liệu và giảm việc lập chỉ mục dư thừa. Nó nên bảo tồn tiêu đề, bảng, chú thích, trích dẫn và các yếu tố cần thiết cho công việc hạ nguồn.

Phân đoạn nên diễn ra sau khi cấu trúc tài liệu được hiểu. Việc làm sạch từng khối nhỏ một cách độc lập thì sẽ mất tín hiệu giữa các khối và có thể bảo tồn các phần của một menu hoặc loại bỏ một kết luận ngắn nhưng liên quan. Giữ lại URL nguồn, đường dẫn tiêu đề, thứ tự khối và quyết định loại bỏ cùng với đầu ra.

Các Chế Độ Thất Bại Thông Thường

  • Làm sạch quá mức. Các chú thích, cảnh báo, mã, bảng hoặc giới thiệu ngắn biến mất cùng với tiếng ồn.
  • Làm sạch không đủ. Menus, văn bản cookie, điều khiển chia sẻ và liên kết liên quan vào tài liệu chính.
  • Nội dung phản ứng trùng lặp. Các biến thể máy tính để bàn và di động đều có mặt trong DOM và tồn tại sau khi trích xuất.
  • Trạng thái đã hiển thị sai. Một lớp đồng ý hoặc khung tải được phân loại thay vì trang mục tiêu.
  • Thiên lệch mẫu. Một mô hình hoặc heuristic hoạt động trên các bài viết tin tức dài nhưng không hoạt động trên diễn đàn, danh mục hoặc tài liệu.
  • Thiếu nguồn gốc. Các đánh giá viên không thể thấy lý do tại sao một khối bị loại bỏ hoặc khôi phục nó sau một lỗi.

Danh Sách Kiểm Tra Thiết Kế Sản Xuất

  1. Định nghĩa “nội dung chính” có nghĩa là gì đối với người tiêu dùng hạ nguồn.
  2. Thu thập các trang đại diện trên nhiều mẫu, ngôn ngữ, độ dài và thiết bị.
  3. Gán nhãn các khối và trường hợp ranh giới, bao gồm nội dung lặp lại vẫn liên quan.
  4. Chọn quy tắc, heuristic, mẫu, mô hình hoặc phối hợp dựa trên kết quả đo lường.
  5. Bảo tồn các trang thô và các quyết định ở cấp khối dưới một chính sách lưu trữ phù hợp.
  6. Theo dõi độ chính xác, độ phục hồi, lỗi ranh giới, đầu ra trống và nội dung trùng lặp.
  7. Chạy các bài kiểm tra hồi quy bất cứ khi nào việc thu thập, phân tích, quy tắc hoặc mô hình thay đổi.
  8. Cung cấp đánh giá và hoàn tác cho các cập nhật tập hợp hoặc chỉ mục tìm kiếm có tác động lớn.

Sử dụng Scrapeless trong Quy trình làm việc

Scrapeless Universal Scraping API có thể thu thập nội dung web công khai trước khi bộ làm sạch phân loại các khối trang. Giữ nhật ký thu thập riêng biệt khỏi kết quả trích xuất để một trang truy cập, bản render không đầy đủ và lỗi phân loại không bị sụp đổ thành một tài liệu rỗng.

Ước lượng việc thu thập nguồn, hiển thị, lưu trữ, gán nhãn, đánh giá và lập chỉ mục hạ nguồn cùng nhau. Giá cả Scrapeless bao gồm thành phần thu thập; chi phí chất lượng lớn hơn thường nằm ở các nhãn đại diện, kiểm tra hồi quy và quy trình sửa lỗi.

Kết luận

Việc loại bỏ boilerplate phân loại các khối trang tùy thuộc vào việc chúng phục vụ cho việc sử dụng nội dung đã định hay không. Các quy tắc, các biện pháp mật độ, sự lặp lại giữa các trang, học máy và bố cục đã hiển thị đều cung cấp các tín hiệu hữu ích, nhưng mỗi cái đều có thể loại bỏ vật liệu có ý nghĩa hoặc bảo tồn tiếng ồn. Một hệ thống đáng tin cậy xác định ranh giới nội dung một cách rõ ràng, đo lường độ chính xác và độ phục hồi trên các trang đại diện, bảo tồn nguồn gốc, và thử nghiệm mọi thay đổi so với các tài liệu hoàn chỉnh.

Sẵn Sàng Xây Dựng Tài Liệu Web Sạch Hơn?

Thu thập các trang công khai với Scrapeless, sau đó đánh giá việc loại bỏ boilerplate dựa trên nội dung mà hệ thống tìm kiếm, phân tích hoặc RAG của bạn thực sự cần.

Bắt đầu Miễn Phí →

Câu hỏi thường gặp

Boilerplate trên một trang web là gì?

Nội dung mẫu là nội dung trang không phải là chính cho mục đích đã chọn, thường là điều hướng, thông báo cookie, quảng cáo, chân trang, điều khiển chia sẻ và các khuyến nghị lặp lại. Ranh giới chính xác phụ thuộc vào người tiêu dùng.

Việc xóa nội dung mẫu có giống như việc xóa thẻ HTML không?

Không. Việc xóa thẻ giữ lại toàn bộ văn bản hiện thấy, bao gồm các menu và chân trang. Việc xóa nội dung mẫu phân loại các khối theo cấu trúc, ngôn ngữ, sự lặp lại, liên kết, vị trí hoặc các đặc điểm đã học để bảo tồn nội dung chính.

Làm thế nào để phát hiện nội dung mẫu?

Các hệ thống sử dụng quy tắc ngữ nghĩa, bộ chọn, mật độ văn bản và liên kết, sự lặp lại giữa các trang, học máy, bố cục trực quan hoặc một hình thức lai. Lựa chọn tốt nhất phụ thuộc vào tính đa dạng của trang, chi phí và chất lượng được đo lường.

Có thể việc xóa nội dung mẫu xóa văn bản quan trọng không?

Có. Việc làm sạch quyết liệt có thể xóa tiêu đề, cảnh báo, bảng, ghi chú tác giả hoặc các thông số lặp lại. Các nhãn đại diện, bằng chứng khối và bài kiểm tra hồi quy là cần thiết.

Tại sao việc xóa nội dung mẫu lại quan trọng đối với RAG?

Nội dung mẫu tạo ra các khối trùng lặp có giá trị thấp có thể chèn vào câu trả lời chính trong quá trình truy xuất. Việc làm sạch cải thiện sự tập trung, nhưng tiêu đề, các yếu tố định tính và ngữ cảnh nguồn phải vẫn được gắn với văn bản hữu ích.

Việc đánh giá việc xóa nội dung mẫu nên được thực hiện như thế nào?

Đánh giá độ chính xác, độ thu hồi, lỗi ranh giới, nội dung trùng lặp, đầu ra trống và chất lượng nhiệm vụ hạ nguồn trên các trang đầy đủ đại diện. Báo cáo kết quả theo mẫu, ngôn ngữ và loại nội dung thay vì chỉ một điểm tổng hợp duy nhất.

Tài liệu tham khảo