Embedding là gì?
Scrapeless Web Unlocker truy xuất nội dung web được render mà bạn có thể chuẩn bị cho việc nhúng và tìm kiếm ngữ nghĩa.
Một embedding là một đại diện số của một đối tượng trong không gian vector, được thiết kế để các mối quan hệ hữu ích có thể được diễn đạt thông qua các vị trí của các vector. Đối tượng có thể là một câu, mô tả sản phẩm, hình ảnh, hoặc một loại đầu vào khác. Một mô hình nhúng văn bản biến văn bản thành một danh sách đã sắp xếp các số.
Câu hỏi quan trọng là mô hình đã học để coi cái gì là có liên quan. Tương tự có thể có nghĩa là chia sẻ chủ đề, một câu trả lời có thể cho một câu hỏi, hoặc nội dung hình ảnh có thể so sánh. Một embedding không tự thiết lập rằng một tài liệu là đúng, hiện tại, hoặc phù hợp cho một độc giả cụ thể. Những thuộc tính đó nằm trong dữ liệu xung quanh và quy trình đánh giá.
Các Số Đại Diện Gì
Các tọa độ nhúng mô tả một đại diện đã học thay vì một tập hợp các cột cơ sở dữ liệu có thể đọc. Bạn thường không thể gán một tọa độ là “giá” và một tọa độ khác là “độ tin cậy” chỉ bằng cách kiểm tra một vector. Ý nghĩa được phân phối trên đại diện, và mục tiêu đào tạo ảnh hưởng đến những sự phân biệt mà mô hình giữ lại.
Hãy xem một bộ sưu tập hỗ trợ minh họa chứa các bài viết về cách đặt lại mật khẩu, thay đổi địa chỉ email, và chỉnh sửa địa chỉ thanh toán. Một khách hàng hỏi về việc khôi phục quyền truy cập tài khoản có thể không sử dụng chính xác các từ trong tiêu đề. Một mô hình nhúng hữu ích đặt câu hỏi đó gần bài viết về mật khẩu vì các văn bản liên quan đến cùng một nhiệm vụ. Điều này mô tả hành vi dự kiến, không phải là kết quả đã đo cho mỗi mô hình.
Một embedding khác với một định danh tài liệu. Định danh nên giữ được tính ổn định khi văn bản thay đổi. Embedding nên được tái tạo khi một sự thay đổi vật chất ảnh hưởng đến ý nghĩa của văn bản. Việc giữ cả hai cho phép bạn theo dõi một vector được truy xuất quay lại một nguồn thực tế thay vì coi một bản ghi số vô danh là bằng chứng.
Cách Văn Bản Trở Nên Tìm Kiếm Được
Nhúng văn bản bắt đầu với một mô hình đã được đào tạo chuyển đổi đầu vào thành một đại diện độ dài cố định cho cấu hình mô hình đó. Phân tách, xử lý mô hình, và một phương pháp kết hợp các đại diện trung gian đóng góp vào đầu ra. Sử dụng định dạng đầu vào và giới hạn độ dài đã được tài liệu hóa của mô hình, vì việc cắt bớt một đoạn văn có thể loại bỏ câu trả lời cho câu hỏi.
Nghiên cứu về các nhúng câu cho sự tương đồng ngữ nghĩa cho thấy tại sao các đoạn văn được mã hóa độc lập hữu ích: các vector của chúng có thể được so sánh mà không cần xử lý đồng thời mọi cặp có thể thông qua một mô hình ngôn ngữ đầy đủ. Tính chất đó hỗ trợ việc lập chỉ mục một bộ sưu tập trước khi người dùng gửi truy vấn.
Vào thời điểm tìm kiếm, hệ thống mã hóa câu hỏi, tìm các đoạn ứng viên, áp dụng các ràng buộc truy cập và siêu dữ liệu, và trả về văn bản nguồn. Một số mô hình truy xuất sử dụng các bộ mã hóa truy vấn và tài liệu khác nhau. Theo cặp mà mô hình mong đợi; độ dài vector giống hệt nhau không làm cho các đại diện trở nên tương thích.
Điểm Tương Tự Cần Ý Nghĩa Được Định Nghĩa
Một điểm tương tự đo lường mối quan hệ được chỉ định bởi một so sánh toán học trong một không gian nhúng cụ thể. Tương tự cosine so sánh hướng vector. Sản phẩm điểm bị ảnh hưởng bởi hướng và độ lớn trừ khi các vector được chuẩn hóa. Khoảng cách Euclidean đo lường sự tách biệt. Lựa chọn chính xác phụ thuộc vào mô hình và cách mà chỉ mục được xây dựng.
Xem điểm như một tín hiệu xếp hạng. Nó không tự động là một xác suất tự tin, và cùng một ngưỡng số có thể hoạt động khác nhau sau khi thay đổi mô hình hoặc tài liệu nguồn. Một điểm tách biệt các đoạn văn liên quan và không liên quan trong hướng dẫn sản phẩm có thể hoạt động kém trên các tên danh mục ngắn. Calibrate các quyết định dựa trên các ví dụ từ bộ sưu tập mà bạn thực sự định tìm kiếm.
Một chỉ mục có thể sử dụng một phương pháp hàng xóm gần nhất xấp xỉ để giảm công việc tìm kiếm. Điều đó đặt ra một câu hỏi khác: chỉ mục có trả về các ứng viên mà mô hình nhúng sẽ xếp hạng cao nhất dưới một so sánh chính xác không? Khi chất lượng tìm kiếm giảm, hãy xem xét chất lượng đại diện và hành vi chỉ mục một cách riêng biệt. Nếu không, bạn có thể thay thế một mô hình khi kết quả thiếu sót là do việc lọc hoặc cấu hình chỉ mục.
Nhúng, Từ Khóa, và Định Danh Chính Xác
Nhúng hữu ích khi cách diễn đạt khác nhau mô tả một ý định tương tự, trong khi việc khớp từ khóa là có giá trị khi văn bản chính xác quan trọng. Mã sản phẩm, định danh lỗi, cụm từ được trích dẫn, và các tên không phổ biến thường xứng đáng với một con đường khớp chính xác. Một hệ thống ngữ nghĩa có thể truy xuất một mô hình hàng xóm có thể từ một thiết bị trong khi thiếu phiên bản chính xác mà người dùng yêu cầu.
Một thiết kế truy xuất lai kết hợp các ứng viên từ điển với các ứng viên ngữ nghĩa trước khi xếp hạng chúng. Đối với một truy vấn hỗ trợ chứa mã lỗi và mô tả bằng ngôn ngữ thông thường, giữ mã như một tín hiệu từ điển hoặc bộ lọc và sử dụng mô tả cho việc khớp ngữ nghĩa. Kiểm tra sự kết hợp; việc thêm nhiều giai đoạn truy xuất không đảm bảo một câu trả lời tốt hơn.
Cách tiếp cận truy xuất đoạn văn dày đặc minh họa việc học một mối quan hệ giữa các câu hỏi và các đoạn văn. Bản chất cụ thể của nó quan trọng: một mô hình được đào tạo để khớp các câu hỏi với câu trả lời không nhất thiết phải là lựa chọn tốt nhất để tìm các điều khoản pháp lý trùng lặp hoặc nhóm các bức ảnh sản phẩm.
Chuẩn bị các trang web trước khi nhúng
Việc chuẩn bị nhúng nên bảo tồn nội dung hữu ích và loại bỏ tài liệu làm sai lệch việc truy xuất. Các menu điều hướng, chân trang lặp lại, các lớp đồng ý, và thông điệp kiểm tra trình duyệt đều có thể trở thành các vectơ. Nếu những văn bản đó chiếm ưu thế trong nhiều tài liệu, một hệ thống tìm kiếm có thể trả về chúng với các điểm số tương đồng thuyết phục mặc dù bài viết dự kiến chưa bao giờ được thu thập.
Sử dụng Web Unlocker cho giai đoạn truy xuất web khi nội dung trang đã được tạo cần thiết. Sau khi thu thập, kiểm tra danh tính trang cuối cùng và nội dung bài viết mong đợi, loại bỏ các yếu tố không liên quan, và giữ lại URL nguồn chính thống. Dòng văn bản web sạch phát triển phần extraction và chunking của quy trình làm việc đó. Việc tạo nhúng vẫn là một hoạt động mô hình riêng biệt.
Chia tài liệu xung quanh các ranh giới có ý nghĩa như một tiêu đề và giải thích của nó. Một đoạn về đủ điều kiện nên giữ lại điều kiện hạn chế đề nghị. Một đoạn về cài đặt nên giữ lại yêu cầu nền tảng. Sự chồng chéo có thể giúp bảo tồn ngữ cảnh qua các ranh giới, nhưng sự chồng chéo vô tội vạ cũng tạo ra các bản sao gần giống gây ùn tắc các kết quả hữu ích khác.
Lưu trữ đường dẫn tiêu đề, thời gian thu thập, định danh nguồn, và cấu hình mô hình với mỗi đoạn. Bảo tồn các hạn chế truy cập như là siêu dữ liệu mà lớp truy xuất thực thi. Loại trừ văn bản không hợp lệ sau khi tạo là quá muộn nếu nó đã được đưa vào ngữ cảnh của mô hình.
Một Đánh Giá Truy Xuất Thực Tế
Đánh giá các nhúng bằng các câu hỏi và phán đoán đại diện về các đoạn nào thực sự trả lời chúng. Xây dựng các ví dụ bao gồm các yêu cầu thông thường, cụm từ mơ hồ, định danh chính xác, nội dung lỗi thời, và các câu hỏi mà bộ sưu tập không thể trả lời. Giữ lại một bộ dữ liệu không bị động để các điều chỉnh lặp lại không chỉ tối ưu cho các ví dụ quen thuộc.
Đối với mỗi truy vấn, kiểm tra các đoạn ứng cử viên trước khi đánh giá câu trả lời được tạo. Hỏi xem đoạn liên quan có được truy xuất không, liệu điều kiện của nó có sống sót qua quy trình chunking không, và liệu một đoạn bản sao gần giống không liên quan có chiếm chỗ nó không. Ghi lại loại thất bại. Thất bại truy xuất, thất bại extraction, và thất bại tạo ra câu trả lời yêu cầu các cách sửa chữa khác nhau.
Một bài kiểm tra hỗ trợ sản phẩm minh họa có thể hỏi xem một thiết bị có hỗ trợ một phụ kiện dưới một hệ điều hành cụ thể không. Một đoạn tên phụ kiện là không đủ nếu nó mô tả một phiên bản thiết bị khác. Thêm siêu dữ liệu phiên bản và so sánh kết quả với một tìm kiếm mang tính ngữ nghĩa thuần túy. Kết quả hữu ích là lựa chọn chứng cứ chính xác, không phải chỉ là một điểm số cao.
Nơi nhúng phù hợp trong RAG
Tạo ra nội dung tăng cường sử dụng chứng cứ truy xuất làm ngữ cảnh cho một mô hình sinh. Nhúng có thể giúp chọn chứng cứ đó, nhưng chúng không phải là toàn bộ hệ thống RAG. Quy trình thu thập, quyền truy cập, quy tắc truy xuất, cấu trúc yêu cầu, và trình bày nguồn đều ảnh hưởng đến câu trả lời.
Nghiên cứu tạo ra nội dung tăng cường kết hợp việc truy xuất với việc tạo ra thay vì chỉ dựa vào thông tin được lưu trữ trong các tham số mô hình. Trong một ứng dụng dữ liệu web thực tế, một tài liệu thay đổi có thể được thu thập và lập chỉ mục mà không cần coi mỗi cập nhật nội dung là một dự án đào tạo mô hình.
Không truyền một vectơ cho một người đọc như bằng chứng. Trả về đoạn cơ bản và một liên kết nguồn, với đủ văn bản xung quanh để kiểm tra ý nghĩa của nó. Nếu chứng cứ yếu hoặc mâu thuẫn, ứng dụng nên nói rõ điều đó. Một câu trả lời lưu loát không thể sửa chữa một nguồn thiếu.
Làm mới và Thay thế Nhúng
Bảo trì nhúng bắt đầu với danh tính tài liệu và phát hiện thay đổi. Khi một trang thay đổi, xác định các đoạn bị ảnh hưởng và thay thế vectơ của chúng cùng với văn bản nguồn liên quan. Khi một trang bị xóa, đảm bảo rằng các đoạn cũ của nó không thể tiếp tục xuất hiện như chứng cứ hiện tại. Một dấu thời gian thu thập một mình không xác lập rằng tuyên bố ban đầu vẫn là hợp lệ.
Xem một thay đổi mô hình như là một di chuyển chỉ mục. Ghi lại các cấu hình mô hình cũ và mới, so sánh chất lượng truy xuất trên cùng một bộ đánh giá, và giữ các bộ sưu tập riêng cho đến khi quá trình di chuyển hoàn tất. Việc trộn lẫn các không gian nhúng không liên quan trong một so sánh tương đồng tạo ra các điểm số không có cách giải thích đáng tin cậy.
Dự kiến ngân sách cho việc thu thập, extraction, suy diễn mô hình, lưu trữ, và công việc truy vấn một cách riêng biệt. Giá cả không rác bao gồm cơ sở hạ tầng thu thập; nó không mô tả chi phí của một mô hình nhúng độc lập hoặc cơ sở dữ liệu vectơ. Việc phân tách này giúp dễ dàng xác định giai đoạn nào cần tối ưu hóa.
Kết luận
Một nhúng biến đổi nội dung thành một đại diện hỗ trợ các so sánh hữu ích. Giá trị của nó đến từ mối quan hệ giữa mô hình, dữ liệu, và nhiệm vụ truy xuất. Bắt đầu với các đoạn nguồn sạch, bảo tồn danh tính của chúng, và đánh giá xem hệ thống có tìm thấy chứng cứ trả lời các câu hỏi thực sự không. Một bộ sưu tập được bảo trì tốt với máy móc truy xuất khiêm tốn có thể hữu ích hơn một chỉ mục tinh vi đầy văn bản không liên quan.
Xây dựng Một Bộ Sưu Tập Nguồn Sạch Hơn
Sử dụng Scrapeless để thu thập các trang công khai đã được tạo, sau đó chuẩn bị các đoạn mà quy trình làm việc nhúng của bạn cần.
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.
Yêu cầu tín dụng $5 của bạn →Câu hỏi thường gặp
Q: Một nhúng có giống như một vectơ không?
Một nhúng là một đại diện thường được lưu trữ như một vectơ, nhưng không phải tất cả các vectơ đều là một nhúng đã học. Một danh sách đo lường được viết tay cũng có thể là một vectơ. Điều làm cho một nhúng hữu ích là cách mà đại diện của nó bảo tồn các mối quan hệ liên quan đến một nhiệm vụ.
Q: Nhúng có thể thay thế một cơ sở dữ liệu không?
Nhúng không thay thế cơ sở dữ liệu nguồn của sự thật. Chúng hỗ trợ các hoạt động như tìm kiếm tương đồng, trong khi cơ sở dữ liệu bảo tồn các bản ghi, quyền truy cập, và các giá trị chính xác. Lưu trữ một kết nối ổn định giữa mỗi nhúng và bản ghi hoặc đoạn mà nó đại diện.
Q: Hai mô hình nhúng có thể chia sẻ một chỉ mục không?
Các vector từ các mô hình khác nhau không nên được so sánh như thể chúng chiếm cùng một không gian trừ khi tính tương thích được thiết lập một cách rõ ràng. Việc khớp các kích thước là không đủ. Giữ các bộ sưu tập cụ thể của mô hình và đánh giá khả năng di chuyển trước khi chuyển đổi ứng dụng tìm kiếm.
Hỏi: Điểm độ tương đồng cao có chứng minh một câu trả lời là đúng không?
Điểm độ tương đồng cao không chứng minh tính chính xác về mặt thực tế. Nó có nghĩa là chỉ số đã chọn đã tìm thấy các đại diện tương tự. Kiểm tra đoạn văn nguồn, ngày tháng và phạm vi của nó, và liệu nó có thực sự hỗ trợ câu trả lời đang được trình bày hay không.
Hỏi: Scrapeless có tạo ra các embedding không?
Trong quy trình công việc được mô tả ở đây, Scrapeless lấy nội dung web và một mô hình embedding tách biệt tạo ra các vector. Giữ cho các giai đoạn đó khác biệt cho phép bạn thay đổi các cài đặt sưu tập mà không phải giả định rằng mô hình embedding hoặc chỉ mục lấy dữ liệu cũng phải thay đổi.