Cách Lấy Văn Bản Từ Website Để Đào Tạo LLM Với Scrapeless
Advanced Data Extraction Specialist
TL;DR:
- Nền tảng văn bản web sẵn sàng cho LLM là một sản phẩm dữ liệu, không phải là một đống trang đã sao chép. Một quy trình đáng tin cậy kiểm soát phạm vi, bảo tồn các URL nguồn, loại bỏ tiếng ồn điều hướng, chuẩn hóa văn bản, loại bỏ nội dung lặp lại và xác thực từng bản ghi trước khi lưu trữ.
- Bắt đầu với nhiệm vụ mô hình. Tạo ra dữ liệu tăng cường tìm kiếm cần các khối liên kết nguồn có thể được làm mới; tinh chỉnh cần các ví dụ được xem xét cẩn thận; tiền huấn luyện đòi hỏi một chương trình quản trị và chất lượng rộng hơn nhiều.
- Sử dụng thiết kế thu thập hai con đường. Lấy các trang công khai đơn giản qua HTTP, sau đó định tuyến các trang cần JavaScript hoặc xử lý truy cập thông qua một lớp thu thập được quản lý như Scrapeless Web Unlocker.
- Lưu trữ các đại diện thô và đã xử lý riêng biệt. Các phản hồi thô hỗ trợ kiểm tra và xử lý lại. Markdown hoặc văn bản sạch hỗ trợ chia nhỏ, tìm kiếm và tiếp nhận mô hình.
- Đo lường chất lượng ở cấp bản ghi. Từ chối các trang trống, mẫu trùng lặp, ngôn ngữ không mong đợi, các bản sao mỏng và các bản ghi không có nguồn gốc trước khi chúng vào một bộ dữ liệu LLM.
Cái Gì Đó Có Nghĩa “Thu Thập Văn Bản Website Để Đào Tạo LLM”?
Việc thu thập văn bản website cho công việc LLM có nghĩa là biến các trang công khai đã được phê duyệt thành các bản ghi có thể theo dõi và đọc được bằng máy. Kết quả hữu ích không phải là HTML thô. Đó là một tập dữ liệu trong đó mỗi đơn vị văn bản có một URL nguồn, thời gian thu thập, loại nội dung, ngôn ngữ và lịch sử xử lý.
Sự phân biệt đó quan trọng vì các trang web trộn lẫn nội dung bài viết với thực đơn, bảng cookie, liên kết liên quan, chân trang lặp lại và trạng thái ứng dụng. Gửi tất cả văn bản hiển thị đến một mô hình tạo ra bối cảnh ồn ào và làm cho việc sửa chữa sau này trở nên khó khăn. Một quy trình sản xuất phải tách biệt thu thập, trích xuất, chuẩn hóa, kiểm soát chất lượng và lưu trữ.
Lớp truy cập web cũng phải tôn trọng quy tắc của nhà xuất bản và luật pháp áp dụng. Giao Thức Loại Trừ Robots xác định cách mà các trình thu thập thông tin phát hiện quy tắc trong robots.txt; nó không thay thế các điều khoản, nghĩa vụ bảo mật hoặc kiểm tra quyền.
Chọn Mục Đích Tập Dữ Liệu Trước Khi Bạn Thu Thập
Cùng một trang cần được xử lý khác nhau tùy thuộc vào đích đến của nó.
| Sử dụng Mô hình | Đơn vị tốt nhất | Siêu dữ liệu cần thiết | Mô hình làm mới | Rủi ro chất lượng chính |
|---|---|---|---|---|
| RAG hoặc tìm kiếm | Đoạn liên kết nguồn | URL, tiêu đề, đường đi tiêu đề, thời gian thu được | Tăng dần | Các khối lỗi thời hoặc không có bối cảnh |
| Tinh chỉnh | Ví dụ đầu vào-đầu ra đã được xem xét | Nguồn, cơ sở giấy phép hoặc sự cho phép, người đánh giá, phiên bản | Phát hành được quản lý | Nhãn yếu hoặc tái sử dụng không được phê duyệt |
| Đánh giá | Lời nhắc đóng băng và bộ tham chiếu | Phiên bản tập dữ liệu, kết quả mong đợi, quy tắc chấm điểm | Kiểm soát | Rò rỉ vào dữ liệu đào tạo |
| Tiền huấn luyện | Đơn vị tài liệu hoặc corpus lớn hơn | Nguồn gốc, ngôn ngữ, quyết định chính sách, khóa loại bỏ trùng lặp | Các bản chụp quản lý lớn | Quyền, trùng lặp, và văn bản chất lượng thấp |
Đối với RAG, độ mới và nguồn gốc thường quan trọng hơn việc thu thập mọi trang. Đối với tinh chỉnh, một tập hợp nhỏ hơn đã được xem xét thường hữu ích hơn một lần thu thập không lọc lớn. Dữ liệu đánh giá nên được tách biệt khỏi các đầu vào đào tạo. Tiền huấn luyện yêu cầu đánh giá pháp lý, an toàn và quản lý dữ liệu chuyên môn trước khi bắt đầu thu thập.
Quy Trình Văn Bản LLM Trong Nháy Mắt
Sử dụng một chuỗi rõ ràng với một hiện vật bền bỉ tại mỗi ranh giới:
- Xác định miền, đường dẫn, ngôn ngữ và loại trang được phép.
- Khám phá các URL chuẩn từ sitemaps và điều hướng được phê duyệt.
- Thu thập mỗi trang thông qua phương pháp nhẹ nhất trả về nội dung cần thiết.
- Trích xuất tài liệu chính trong khi vẫn bảo tồn tiêu đề, danh sách và bảng.
- Chuẩn hóa khoảng trắng, URL, Unicode và quyết định mẫu.
- Loại bỏ trang và các vùng nội dung lặp lại.
- Chia nhỏ tài liệu thành các khối liên kết nguồn cho nhiệm vụ mô hình mục tiêu.
- Xác thực sơ đồ, nguồn gốc, ngôn ngữ, mật độ nội dung và trạng thái chính sách.
- Lưu trữ các bản chụp thô, tài liệu sạch và siêu dữ liệu xử lý một cách riêng biệt.
Kiến trúc này cho phép một nhóm cải thiện quá trình trích xuất hoặc chia nhỏ mà không cần thu thập lại nguồn. Nó cũng tạo ra một con đường kiểm toán từ bất kỳ phản hồi mô hình nào quay lại trang và phiên bản xử lý đã cung cấp bối cảnh của nó.
Bước 1: Xác Định Phạm Vi Và Quy Tắc Truy Cập
Viết phạm vi dưới dạng dữ liệu, không phải là một ghi chú không chính thức. Một chính sách thu thập hữu ích bao gồm các máy chủ được phép, tiền tố đường dẫn được phép, các đường dẫn bị từ chối, độ sâu tối đa, các loại phương tiện được chấp nhận, quy tắc ngôn ngữ và ngân sách yêu cầu theo từng máy chủ. Ghi nhớ ai đã phê duyệt nguồn và việc sử dụng nào được phép.
Đừng coi một liên kết là sự cho phép tự động để thu thập mọi thứ phía sau nó. Giữ các khu vực chỉ dành cho tài khoản, dữ liệu cá nhân, nội dung yêu cầu thanh toán và các điểm cuối hạn chế ra khỏi phạm vi trừ khi dự án có một cơ sở tài liệu và kiểm soát phù hợp. Không bao giờ cố gắng vượt qua các kiểm soát truy cập kỹ thuật.
Mã trạng thái HTTP, chuyển hướng, hướng dẫn bộ nhớ đệm và siêu dữ liệu đại diện nên được diễn giải theo đặc tả nghĩa HTTP. Điều này ngăn việc các trang lỗi, chuyển hướng đăng nhập và tệp không được hỗ trợ bị gán nhầm là tài liệu văn bản thành công.
Bước 2: Khám Phá URL Mà Không Mất Ranh Giới
Sơ đồ trang thường là điểm khởi đầu sạch sẽ nhất vì chúng lộ diện các URL nội dung chuẩn mà không buộc một con nhện phải lần theo mọi biến thể điều hướng. Thêm các trang hạt giống đã được chấp thuận cho các phần thiếu trong sơ đồ trang, sau đó chuẩn hóa mỗi ứng cử viên trước khi lên lịch cho nó.
Chuẩn hóa nên loại bỏ các đoạn, giải quyết các URL tương đối, tiêu chuẩn hóa cách viết tên miền, và áp dụng quy tắc dự án cho các tham số theo dõi. Bảo toàn các tham số thay đổi nội dung; chỉ loại bỏ các tham số mà dự án phân loại là các biến thể không chứa nội dung.
Sử dụng hai khóa loại bỏ trùng lặp:
- Một khóa URL đã được chuẩn hóa ngăn việc lập lịch cho cùng một tuyến đường nhiều lần.
- Một dấu vân tay nội dung bắt giữ các trang giống hệt hoặc gần giống được xuất bản dưới các URL khác nhau.
Khám phá và thu thập nên là các hàng đợi riêng biệt. Điều đó giúp có thể kiểm tra phạm vi đã lên kế hoạch trước khi lấy nội dung và ngăn việc mở rộng không cần thiết trên lịch, trang tìm kiếm phân loại hoặc phân trang không giới hạn.
Bước 3: Thu Thập Trang Với Đường Dẫn Kết Xuất Đúng
Một phản hồi HTTP trực tiếp là đủ khi văn bản bài viết cần có mặt trong HTML trả về. Nó rẻ hơn để vận hành và dễ dàng hơn để gỡ lỗi. Một trình duyệt hoặc đường dẫn kết xuất là cần thiết khi JavaScript phía khách hàng xây dựng nội dung, điều hướng cần được mở rộng, hoặc một phản hồi công khai hợp pháp yêu cầu xử lý truy cập được quản lý.
Scrapeless Web Unlocker cung cấp một lớp thu thập cho các trang công khai cần kết xuất JavaScript hoặc quản lý truy cập. Giữ cho hợp đồng thu thập hẹp: gửi một URL đã được chấp thuận, yêu cầu HTML là kết quả mong đợi, và xác thực URL cuối cùng, trạng thái, và loại phương tiện trước khi khai thác.
Đừng gửi mọi trang qua trình duyệt theo mặc định. Trước tiên, kiểm tra các URL đại diện từ từng mẫu. Định tuyến các mẫu tĩnh qua HTTP và các mẫu động qua kết xuất. Điều này giữ cho quy trình dễ hiểu và cung cấp cho mỗi mẫu một quy tắc thu thập rõ ràng.
Giới thiệu Web Unlocker tài liệu ranh giới dịch vụ. Để tìm hiểu kỹ hơn về phân tích tĩnh và thực thi trình duyệt, hãy đọc hướng dẫn khai thác JavaScript.
Bắt Đầu Khai Thác Với Scrapeless
Tăng cường quy trình khai thác web và tự động hóa của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 trong tín dụng miễn phí — không yêu cầu thẻ tín dụng.Nhận tín dụng miễn phí của bạn ngay bây giờ trong Bảng Điều Khiển Scrapeless.
Bước 4: Trích Xuất Tài Liệu Chính
Việc trích xuất nội dung chính nên bảo toàn cấu trúc tài liệu trong khi loại bỏ giao diện của trang web. Giữ các tiêu đề theo thứ tự, đính kèm các mục danh sách vào phần của chúng, giữ nguyên các hàng bảng có ý nghĩa, và bảo tồn văn bản liên kết khi nó có giá trị cho câu. Loại bỏ điều hướng, các bảng quảng cáo lặp lại, các điều khiển cookie và các đề xuất không liên quan.
Mô hình tài liệu trình duyệt được mô tả bởi Chuẩn DOM cung cấp một cái cây, nhưng cái cây đó không xác định tự động bài viết chính. Việc trích xuất vẫn cần quy tắc mẫu, các phần tử ngữ nghĩa, hoặc một extractor nội dung đã được kiểm tra.
Xem xét kết quả trong hai chế độ:
- Chế độ cấu trúc: các tiêu đề, đoạn văn, danh sách, bảng và mã xuất hiện theo thứ tự mong đợi.
- Chế độ đọc: một người có thể hiểu tài liệu mà không cần nhìn thấy bố cục gốc.
Giữ một báo cáo trích xuất ngắn gọn cho mỗi mẫu. Nó nên chỉ tên gốc đã được chọn, các khu vực đã loại bỏ, chiều dài văn bản tối thiểu chấp nhận được, và các trường cần có mặt.
Bước 5: Chuẩn Hóa Mà Không Xóa Nghĩa
Chuẩn hóa nên làm cho văn bản tương đương nhất quán trong khi bảo tồn sự thật. Chuyển đổi các kết thúc dòng, chuẩn hóa Unicode, thu gọn khoảng trắng bố cục, và tiêu chuẩn hóa sự đại diện của Markdown. Giữ nguyên dấu câu, đơn vị, sự phủ định, định dạng mã, và ranh giới của các phần.
Bước 6: Loại bỏ trùng lặp trước khi chia nhỏ
Việc loại bỏ trùng lặp chính xác loại bỏ những tài liệu giống hệt nhau. Phát hiện trùng lặp gần sẽ phát hiện các trang in, gương vùng, và mẫu mà chỉ có một khối nhỏ thay đổi. Phân tích mẫu chuẩn nên diễn ra trên nhiều trang từ cùng một mẫu để có thể xác định một cách an toàn văn bản điều hướng và chân trang lặp lại.
Loại bỏ trùng lặp trước khi chia nhỏ. Nếu không, cùng một đoạn văn có thể nhận được nhiều ID đoạn nhỏ và chiếm ưu thế trong kết quả truy xuất. Giữ lại một bản đồ từ các bản trùng lặp đã bị loại bỏ đến bản ghi chuẩn được giữ lại để các nhà phân tích có thể giải thích lý do tại sao một URL không sản xuất ra tài liệu mới.
Bước 7: Chia nhỏ cho việc truy xuất, không phải sự tiện lợi
Các đoạn nhỏ nên theo ranh giới ngữ nghĩa như các phần tiêu đề, nhóm danh sách, hoặc đơn vị bảng. Một cửa sổ ký tự cố định có thể tách định nghĩa khỏi điều kiện và tách giá trị khỏi nhãn cột. Giữ lại đường dẫn tiêu đề và URL nguồn trên mỗi đoạn nhỏ.
Sử dụng chồng chéo chỉ khi đánh giá cho thấy ngữ cảnh ranh giới đang bị mất. Sự chồng chéo lớn làm tăng dung lượng lưu trữ và có thể khiến cho trình truy xuất trả về nhiều bản sao của cùng một đoạn văn. Kiểm tra việc chia nhỏ với các câu hỏi thực tế từ ứng dụng, không chỉ dựa vào thống kê số lượng ký tự.
Bước 8: Xác thực từng bản ghi đầu ra
Xác thực thuộc về trước khi lưu trữ và trước khi tiếp nhận mô hình. Từ chối hoặc cách ly các bản ghi khi:
- URL cuối cùng nằm ngoài phạm vi phê duyệt;
- phản hồi không phải là một đại diện văn bản mong đợi;
- bản trích dẫn trống, mỏng hoặc chủ yếu là điều hướng;
- ngôn ngữ khác với ngôn ngữ của tập dữ liệu đã công bố;
- tài liệu thiếu URL nguồn hoặc thời gian thu thập;
- hash nội dung đã tồn tại mà không có thay đổi phiên bản đã được phê duyệt;
- trang chứa trạng thái hạn chế hoặc chính sách cần xem xét.
Khung Quản lý Rủi ro AI NIST cung cấp một từ vựng quản trị hữu ích để lập bản đồ, đo lường và quản lý rủi ro xung quanh các hệ thống AI. Áp dụng những ý tưởng đó vào phê duyệt nguồn, tài liệu tập dữ liệu, đánh giá và kiểm soát thay đổi thay vì xem việc lấy dữ liệu như một bước kỹ thuật tách biệt.
Lưu trữ Dữ liệu Thô, Sạch và Đã Đánh chỉ mục Tách biệt
Giữ ba lớp:
- Thu thập thô: thân phản hồi, tiêu đề cần thiết cho kiểm toán, URL cuối cùng và dấu thời gian.
- Tài liệu sạch: Markdown chuẩn hóa hoặc văn bản cộng với siêu dữ liệu trích xuất.
- Chỉ số ứng dụng: các đoạn nhỏ, nhúng, trường truy xuất và phiên bản chỉ mục.
Cập nhật trích xuất nên tái xây dựng hai lớp thứ hai và thứ ba từ thu thập thô đã được giữ lại. Cập nhật chia nhỏ chỉ nên tái xây dựng chỉ mục. Sự tách biệt này rút ngắn thời gian điều tra khi một tài liệu tham khảo sai hoặc một mẫu thay đổi.
Kết luận: Xây dựng để Có thể Theo dõi Trước Khi Tăng Khối Lượng
Một quy trình văn bản LLM thành công khi mỗi đoạn văn sạch có thể được truy tìm đến một nguồn đã được phê duyệt và tái sản xuất từ một thu thập đã biết. Bắt đầu với một bộ mẫu trang hẹp, xác minh đường dẫn thu thập, xem xét các tài liệu đã trích xuất và thiết lập các cổng chất lượng theo bản ghi trước khi tăng khối lượng thu thập.
Cột mốc thứ nhất hữu ích nhất không phải là một tập hợp lớn. Đó là một tập dữ liệu nhỏ có phạm vi, nguồn gốc, biến đổi và quy tắc thất bại rõ ràng đủ để một kỹ sư khác kiểm toán.
Xây dựng một Quy trình Văn bản Web Liên kết Nguồn
So sánh giá của Scrapeless, khám phá Web Unlocker, hoặc tham gia cộng đồng Scrapeless Discord và cộng đồng Telegram.
Câu hỏi thường gặp
Q: HTML thô có phù hợp cho việc đào tạo LLM không?
HTML thô hữu ích như một tư liệu kiểm toán và tái xử lý, nhưng thường chứa điều hướng, kịch bản, các mẫu lặp lại, và đánh dấu bố cục không nên được đưa vào đầu vào của mô hình mà không thay đổi. Tạo một đại diện sạch riêng và giữ liên kết đến thu thập thô.
Q: Mỗi trang web có nên được hiển thị trong trình duyệt không?
Không. Sử dụng thu thập HTTP trực tiếp khi văn bản yêu cầu có mặt trong phản hồi. Thêm trình duyệt chỉ cho các mẫu cần JavaScript hoặc tương tác để tiết lộ nội dung công khai đã được phê duyệt.
H: Định dạng nào hoạt động tốt nhất cho văn bản chuẩn bị cho LLM?
Markdown hữu ích khi các tiêu đề, danh sách, bảng và cấu trúc mã có ý nghĩa. JSONL hữu ích như một container cho tài liệu hoặc phần cùng với siêu dữ liệu. Các trường sơ đồ và nguồn gốc quan trọng hơn phần mở rộng tệp.
H: Nên xử lý các trang web trùng lặp như thế nào?
Sử dụng URL chuẩn hóa cho lập lịch, băm nội dung cho các bản sao chính xác, và một phương pháp gần giống đã được kiểm tra cho các gương hoặc biến thể theo mẫu. Giữ một bản ghi ánh xạ các bản sao bị loại trừ với tài liệu được giữ lại.
H: Bao lâu thì một tập dữ liệu văn bản web nên được làm mới?
Đặt quy tắc làm mới theo độ biến động của nguồn và nhu cầu ứng dụng. Tài liệu sản phẩm có thể cần kiểm tra thường xuyên, trong khi các tài liệu tham khảo lưu trữ có thể hiếm khi thay đổi. Lưu thời gian thu thập và so sánh băm nội dung để các trang không thay đổi không tạo ra phiên bản mới.
H: Có thể sử dụng văn bản thu thập được cho bất kỳ dự án mô hình nào không?
Không. Các yêu cầu về truy cập, bản quyền, quyền riêng tư, hợp đồng và bảo vệ dữ liệu phụ thuộc vào nguồn gốc, quyền tài phán và mục đích sử dụng. Thu thập đánh giá thích hợp và giữ dữ liệu hạn chế hoặc cá nhân ngoài quy trình trừ khi dự án có cơ sở hợp pháp và kiểm soát đã được tài liệu hóa.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



