Khái Niệm Trích Xuất Nội Dung Là Gì?
API Trích Xuất Web Không Cần Rác thu thập các trang web công khai cho quy trình trích xuất nội dung mà phân tích và cấu trúc đại diện đã trả về.
TL;DR
- Trích xuất nội dung chuyển đổi tài liệu nguồn thành dữ liệu đã chọn, có thể sử dụng. Trên web, nó có thể phục hồi văn bản bài viết, các trường sản phẩm, liên kết, siêu dữ liệu, bảng hoặc thực thể từ các trang.
- Thu thập và trích xuất là hai giai đoạn khác nhau. Một lần lấy được đại diện; trích xuất quyết định phần nào quan trọng và cách chúng ánh xạ đến đầu ra.
- Trích xuất nội dung chính là một loại phụ. Nó tách văn bản biên tập chính khỏi điều hướng và các phần trang lặp lại, trong khi trích xuất trường nhắm đến một lược đồ xác định.
- Đầu ra đáng tin cậy cần có nguồn gốc và xác thực. Giữ lại URL nguồn, phương pháp thu thập, chứng cứ thô, phiên bản quy tắc và trạng thái chất lượng cấp trường.
- Lược đồ đầu ra nên tuân theo trường hợp sử dụng. Tối ưu hóa, phân tích, RAG, di chuyển và giám sát cần các ranh giới và biện pháp chất lượng khác nhau.
Trích xuất nội dung là quá trình xác định và chuyển đổi thông tin hữu ích từ một nguồn thành dạng mà hệ thống hạ nguồn có thể tiêu thụ. Nguồn có thể là một trang web, PDF, email, hình ảnh, báo cáo hoặc giao diện ứng dụng. Đầu ra có thể là văn bản liên tục, một tập hợp các trường, một bảng, các thực thể liên kết, các tham chiếu phương tiện, hoặc một bảng ghi đã được chuẩn hóa.
Trên web, việc trích xuất bắt đầu sau hoặc song song với việc thu thập. Một khách hàng HTTP hoặc trình duyệt thu thập một đại diện; một bộ phân tích xây dựng cấu trúc; các trình chọn hoặc mô hình xác định nội dung; chuẩn hóa giải quyết các giá trị; xác thực kiểm tra ý nghĩa. Đối xử tất cả những điều đó như một “trích xuất” mờ có thể làm khó xác định các khiếm khuyết.
Đường ống Trích Xuất Nội Dung
| Giai đoạn | Câu hỏi | Đầu ra điển hình |
|---|---|---|
| Thu thập | Đại diện nguồn nào đã được thu thập? | HTML, DOM đã được kết xuất, phản hồi, PDF, hình ảnh |
| Phân tích | Cấu trúc nào mà đại diện đã phơi bày? | Cây DOM, khối, token, bảng, siêu dữ liệu |
| Lựa chọn | Nội dung nào đáp ứng trường hợp sử dụng? | Văn bản chính, các trường, liên kết, thực thể, phương tiện |
| Chuẩn hóa | Giá trị nên được thể hiện một cách đồng nhất như thế nào? | URL đã giải quyết, ngày tháng đã đánh dấu, đơn vị, định danh |
| Xác thực | Kết quả có hoàn chỉnh, chính xác và có thể truy nguyên không? | Cờ chất lượng, chứng cứ, lý do từ chối |
| Giao hàng | Người tiêu dùng sẽ tiếp cận sản phẩm như thế nào? | JSON, bảng, chỉ mục, tài liệu, sự kiện |
Mỗi giai đoạn nên có ranh giới rõ ràng. Nếu việc thu thập trả về một trang đồng ý, trình chọn không nên báo cáo “bài viết bị thiếu.” Nếu phân tích thất bại do đánh dấu không hợp lệ, chuẩn hóa không nên tạo ra các trường trống. Các giai đoạn quan sát được biến đổi từ một kết quả mơ hồ thành một thất bại cụ thể mà một chủ sở hữu có thể giải quyết.
Nội Dung Chính, Các Trường và Các Thực Thể
Trích xuất nội dung chính nhằm phục hồi thân bài chính có thể đọc của một trang, thường kèm theo tiêu đề, tác giả, ngày, tiêu đề, liên kết và hình ảnh liên quan. Nó hữu ích cho các chế độ xem đọc, chỉ mục tìm kiếm, tóm tắt, dịch, lưu trữ và các hệ thống truy xuất. Việc loại bỏ mẫu mã liên quan chặt chẽ vì điều hướng, quảng cáo, chân trang, và các khuyến nghị lặp lại có thể lấn át văn bản chính.
Trích xuất trường bắt đầu từ một lược đồ. Một bản ghi sản phẩm có thể yêu cầu định danh, tên, giá, tiền tệ, tình trạng sẵn có, người bán và URL nguồn. Một sự kiện có thể yêu cầu tên, thời gian bắt đầu, địa điểm và người tổ chức. Trích xuất trường có thể sử dụng các trình chọn DOM, dữ liệu có cấu trúc, nhãn, mẫu hoặc mô hình, nhưng phải phân biệt giá trị nguồn bị thiếu với thất bại trong quá trình trích xuất.
Trích xuất thực thể và quan hệ vượt xa việc sao chép các trường. Nó xác định con người, tổ chức, địa điểm, sản phẩm hoặc khái niệm và liên kết các mối quan hệ giữa chúng. Đầu ra thu được nên giữ tách biệt khỏi các giá trị nguồn quan sát được để người tiêu dùng biết được điều gì đã được nêu và điều gì đã được suy luận.
Trích Xuất Dựa Trên Quy Tắc
Hệ thống dựa trên quy tắc sử dụng các trình chọn CSS, XPath, quan hệ DOM, thuộc tính siêu dữ liệu, mẫu URL, nhãn hoặc biểu thức chính quy. Chúng minh bạch và hiệu quả khi các mẫu trang ổn định. Một quy tắc cụ thể có thể giải thích chính xác lý do tại sao một giá trị được chọn và có thể được kiểm tra trên các trang đã biết.
Điểm yếu là sự phụ thuộc vào mẫu. Một trình chọn gắn với một lớp được tạo có thể thất bại sau khi thiết kế lại. Các quy tắc mạnh hơn sử dụng ID ổn định, các thành phần ngữ nghĩa, thuộc tính dữ liệu, nhãn, siêu dữ liệu có cấu trúc và các mối quan hệ như “giá bên trong bản ghi sản phẩm đã xác định.” Các quy tắc nên được phiên bản theo gia đình mẫu và được kiểm tra trên nhiều biến thể trang.
Định nghĩa phần tử bài viết của tiêu chuẩn HTML cung cấp một tín hiệu ngữ nghĩa cho nội dung độc lập, nhưng các trang thực tế không sử dụng đánh dấu ngữ nghĩa một cách nhất quán. Việc trích xuất nên kết hợp các tín hiệu thay vì giả định rằng một tên phần tử đảm bảo độ liên quan.
Heuristics và Machine Learning
Các bộ trích xuất nội dung chính heuristic đánh giá các khối sử dụng mật độ văn bản, mật độ liên kết, dấu câu, mối quan hệ tiêu đề, vị trí và nội dung lân cận. So sánh mẫu có thể xác định các khối lặp lại qua các trang từ một trang web.
Nghiên cứu Web2Text khung phát hiện mã khung như phân loại có cấu trúc trên các khối trang. Các mô hình có thể tổng quát tốt hơn qua các bố cục so với các bộ chọn cố định, nhưng chúng yêu cầu dữ liệu đào tạo, đánh giá, phiên bản và yêu cầu giải thích. Một điểm số độ tin cậy của mô hình không phải là sự thay thế cho bằng chứng cấp lĩnh vực.
Thiết kế lai là phổ biến: các quy tắc ngữ nghĩa xác định các khu vực ứng cử viên, heuristics loại bỏ điều hướng rõ ràng, và một mô hình giải quyết các khối mơ hồ. Lựa chọn sản xuất nên theo dõi độ chính xác và khả năng hồi phục đã đo lường trên các trang đại diện, không phải là sự ưu tiên dành cho quy tắc hoặc AI trong trừu tượng.
Trang và Render động
HTML ban đầu có thể chứa nội dung, một lớp dữ liệu, hoặc gần như không có gì ngoài các tập lệnh. Các ứng dụng khách có thể thêm văn bản sau khi yêu cầu, tương tác của người dùng, hoặc thay đổi viewport. Một bộ trích xuất phải xác định xem nó nhắm vào HTML nguồn, DOM đã render, phản hồi mạng có cấu trúc, hoặc trạng thái trực quan.
Việc thu thập đã render tăng chi phí và sự biến đổi nhưng có thể cần thiết. Các điều kiện chờ nên tương ứng với nội dung mục tiêu, chẳng hạn như một vùng chứa bản ghi hoặc phản hồi dữ liệu, thay vì một độ trễ chung. Lưu giữ đủ bằng chứng để tái tạo trạng thái mà bộ phân tích đã quan sát.
Chuẩn hóa và Nguồn gốc
Chuẩn hóa giải quyết các URL tương đối, tách số ra khỏi định dạng hiển thị, chuẩn hóa các đơn vị, ánh xạ các liệt kê, và giữ nguyên ngữ cảnh. Nó không bao giờ nên xóa giá trị thô. Lưu cả chuỗi đã quan sát và trường đã chuẩn hóa khi việc diễn giải quan trọng, cùng với quy tắc hoặc ngữ cảnh đã tạo ra sự chuyển đổi.
Nguồn gốc kết nối mọi đầu ra với một URL nguồn, thời gian ghi lại, đại diện, phần nguồn, phiên bản trích xuất, và trạng thái xác minh. Đối với một tài liệu, các vị trí hoặc định danh khối có thể chỉ về chứng cứ. Đối với một trường, bảo tồn thuộc tính nguồn hoặc phạm vi văn bản. Nguồn gốc hỗ trợ các cuộc kiểm toán, sửa chữa, loại bỏ trùng lặp, và đánh giá mô hình.
Cách Đo lường Chất lượng Trích xuất
Độ chính xác đo lường mức độ nội dung được trích xuất là có liên quan; độ hồi phục đo lường mức độ nội dung có liên quan được khôi phục. Trích xuất trường cũng cần độ chính xác của giá trị khớp chính xác hoặc giá trị đã chuẩn hóa, độ hoàn chỉnh của bản ghi, tỷ lệ trùng lặp, và các kiểm tra tính hợp lệ của lược đồ. Các hệ thống văn bản chính nên kiểm tra các lỗi biên như thiếu giới thiệu, liên kết liên quan được đưa vào, chú thích bị mất, hoặc văn bản trên di động và máy tính để bàn bị trùng lặp.
Các bộ đánh giá nên bao phủ các loại trang, ngôn ngữ, nội dung ngắn và dài, các trường thiếu, tường phí hoặc thông báo truy cập, render động, và sửa đổi mẫu. Dự án Mozilla Readability tiết lộ một trình phân tích nội dung chính mã nguồn mở thực tiễn và tài liệu các trang thử nghiệm, minh họa giá trị của các thiết bị thử nghiệm cho hành vi trích xuất.
Các Chế độ Thất bại Thông thường
- Biểu diễn không đúng. Bộ trích xuất phân tích HTML ban đầu ngay cả khi nội dung chỉ xuất hiện sau khi render.
- Quá khớp mẫu. Một bộ chọn làm việc trên một trang mẫu nhưng bỏ lỡ các biến thể, ngữ cảnh, hoặc thử nghiệm.
- Rò rỉ mã khung. Điều hướng, văn bản cookie, liên kết liên quan, và bản sao chân trang vào nội dung chính.
- Làm sạch quyết liệt. Chú thích, cảnh báo, bảng, hoặc ngữ cảnh lặp lại nhưng liên quan bị loại bỏ.
- Mất nguồn gốc. Giá trị đã chuẩn hóa không thể được truy tìm về một phần tử hoặc quy tắc nguồn.
- Giá trị null im lặng. Khó khăn truy cập, lỗi bộ phân tích, và các trường thực sự vắng mặt trở thành cùng một giá trị trống.
Trích xuất Nội dung cho Tìm kiếm và RAG
Tìm kiếm và tạo khu vực bổ trợ cần các khối đồng nhất, tiêu đề, tiêu đề, liên kết, và danh tính nguồn. Điều hướng và văn bản chân trang lặp lại tạo ra các khối có giá trị thấp có thể chiếm ưu thế trong việc truy xuất. Việc làm sạch quá mức loại bỏ các thuộc tính và ngữ cảnh mà câu trả lời cần. Mục tiêu trích xuất nên bảo tồn cấu trúc tài liệu trước khi chia nhỏ thay vì làm sụp đổ mọi thứ thành một chuỗi duy nhất.
Giữ các URL nguồn và bằng chứng với mỗi khối. Loại bỏ các nội dung lặp lại qua các trang, nhưng đừng giả định rằng sự lặp lại có nghĩa là không liên quan; một thông số sản phẩm hoặc cảnh báo pháp lý có thể xuất hiện một cách nhất quán và vẫn quan trọng. Đánh giá chất lượng truy xuất và câu trả lời trên các câu hỏi thực tế bên cạnh các chỉ số trích xuất cấp khối.
Thiết kế Quy trình Sản xuất
- Xác định người tiêu dùng, lược đồ, nhu cầu bằng chứng và lỗi chấp nhận được.
- Chọn đại diện chính thức và phương pháp thu thập cho mỗi loại trang.
- Bảo tồn các hiện vật thô dưới một chính sách giữ lại tỷ lệ.
- Tách biệt các giai đoạn lựa chọn, chuẩn hóa, xác minh, và giao hàng.
- Xây dựng một bộ đánh giá gán nhãn đại diện và bộ hồi quy mẫu.
- Theo dõi độ phủ trường, ranh giới khối, các trùng lặp, độ trôi của lược đồ, và các thay đổi nguồn.
- Cung cấp kiểm dịch và xem xét con người cho các đầu ra mơ hồ hoặc có tác động cao.
Scrapeless Universal Scraping API có thể phục vụ giai đoạn thu thập cho các trang web công khai, trong khi lớp trích xuất của bạn xác định lược đồ và quy tắc chất lượng. Xem xét Giá Scrapeless với khối lượng trang, nhu cầu render, giữ lại thô, và chi phí xử lý hạ nguồn.
Kết luận
Chiết xuất nội dung chuyển đổi một nguồn đã được ghi lại thành thông tin được chọn lọc, có cấu trúc và đã được xác thực. Các hệ thống mạnh nhất tách biệt việc thu thập dữ liệu khỏi việc phân tích, chọn một ranh giới đầu ra phù hợp với người tiêu dùng, bảo tồn bằng chứng gốc và đo lường chất lượng trường hoặc khối trên các trang đại diện. Chiết xuất nội dung chính, chiết xuất trường, chiết xuất thực thể và loại bỏ boilerplate là những công cụ liên quan, không phải là những cái tên thay thế cho nhau.
Sẵn sàng xây dựng một quy trình chiết xuất nội dung?
Thu thập các trang web công cộng với Scrapeless, sau đó giữ lại lựa chọn, chuẩn hóa, xác thực và nguồn gốc dưới sơ đồ của riêng bạn.
Bắt đầu miễn phí →Câu hỏi thường gặp
Chiết xuất nội dung là gì theo cách đơn giản?
Chiết xuất nội dung là quá trình chọn lọc thông tin hữu ích từ một nguồn và chuyển đổi nó thành văn bản, trường, thực thể, bảng hoặc một định dạng khác mà hệ thống hạ lưu có thể sử dụng.
Chiết xuất nội dung có giống như thu thập dữ liệu trên web không?
Không. Thu thập dữ liệu trên web thu thập và xử lý các tài nguyên web, trong khi chiết xuất nội dung là bước lựa chọn và cấu trúc có thể áp dụng cho các trang web, PDF, email, hình ảnh và các nguồn khác.
Chiết xuất nội dung chính là gì?
Chiết xuất nội dung chính xác định phần nội dung có thể đọc được chủ yếu của một tài liệu và tách nó ra khỏi điều hướng, quảng cáo, chân trang và các yếu tố khác của trang. Nó thường bảo tồn tiêu đề, liên kết và phương tiện liên quan.
Chất lượng chiết xuất được đo như thế nào?
Đo độ chính xác, hồi tưởng, độ chính xác của trường, độ đầy đủ của bản ghi, tỷ lệ trùng lặp, tính hợp lệ của sơ đồ và phạm vi nguồn gốc trên các nguồn đã được gán nhãn đại diện. Các chỉ số liên quan phụ thuộc vào người tiêu dùng.
Chiết xuất nội dung có cần AI không?
Không. Các quy tắc và trực giác là hiệu quả cho các mẫu ổn định và sơ đồ rõ ràng. Học máy có thể giúp tổng quát qua các bố cục hoặc các khối không rõ ràng, nhưng nó thêm yêu cầu đánh giá và quản trị.
Tại sao cần bảo tồn bằng chứng nguồn gốc gốc?
Bằng chứng gốc cho phép một nhóm kiểm toán các giá trị đã được chuẩn hóa, phân biệt sự thay đổi nguồn so với lỗi trong bộ phân tích, sửa chữa các quy tắc chuyển đổi và xử lý lại dữ liệu mà không cần phải thu thập lại từng nguồn.