LlamaIndex là gì? Dữ liệu, RAG, đại lý và quy trình làm việc

LlamaIndex là gì?

Trình duyệt Scraping không rác có thể cung cấp nội dung web công khai đã được hiển thị cho các quy trình dữ liệu chuẩn bị kiến thức bên ngoài cho các ứng dụng LlamaIndex.

TL;DR

  • LlamaIndex là một khuôn khổ cho các ứng dụng được tăng cường ngữ cảnh trên dữ liệu riêng tư hoặc bên ngoài. Nó tập trung vào việc nạp dữ liệu, lập chỉ mục, truy xuất, truy vấn, đại lý và quy trình làm việc.
  • Các tài liệu trở thành các nút nhỏ hơn trước khi truy xuất. Văn bản, siêu dữ liệu, mối quan hệ và nhúng quyết định ngữ cảnh nào mà một truy vấn có thể phục hồi.
  • Một chỉ mục không nhất thiết phải là một bản sao của nguồn gốc. Nó là một cấu trúc giúp nội dung nguồn có thể được tìm kiếm hoặc truy vấn.
  • Các động cơ truy vấn và các động cơ trò chuyện cung cấp các mẫu tương tác khác nhau. Một cái trả lời các truy vấn qua dữ liệu; cái kia duy trì một cuộc trao đổi đối thoại.
  • Chất lượng truy xuất phụ thuộc vào sự lựa chọn nạp dữ liệu. Phân tích, siêu dữ liệu, ranh giới các phần, và đánh giá thường quan trọng hơn việc đánh bóng lời nhắc.

LlamaIndex được định nghĩa

LlamaIndex là một khuôn khổ để xây dựng các ứng dụng mô hình ngôn ngữ trên dữ liệu mà mô hình cơ sở không đã chứa sẵn. Tài liệu chính thức Tài liệu LlamaIndex mô tả việc tăng cường ngữ cảnh là làm cho dữ liệu riêng tư hoặc cụ thể cho vấn đề có sẵn cho mô hình thông qua các kết nối, chỉ mục, giao diện truy vấn, đại lý, và quy trình làm việc.

Khuôn khổ bắt đầu với trọng tâm mạnh mẽ vào việc tạo ra nội dung tăng cường và lập chỉ mục dữ liệu. Phạm vi hiện tại rộng hơn. Các nhà phát triển có thể nạp tệp và API, phân tích tài liệu, xây dựng hệ thống truy xuất, phơi bày động cơ truy vấn và trò chuyện, tạo đại lý sử dụng công cụ, và điều phối quy trình làm việc dựa trên sự kiện. Các dịch vụ LlamaCloud được quản lý ngồi bên cạnh khuôn khổ mã nguồn mở nhưng không giống nhau.

LlamaIndex hữu ích khi quyền truy cập dữ liệu là trung tâm của ứng dụng. Một mô hình có thể hiểu ngôn ngữ tốt trong khi thiếu chính sách công ty, danh mục sản phẩm, lưu trữ nghiên cứu, hoặc các trang web vừa được xuất bản. LlamaIndex cung cấp các cấu trúc để chuyển các nguồn đó vào một con đường ngữ cảnh có thể tìm kiếm.

Đường Dữ liệu LlamaIndex

Một quy trình LlamaIndex điển hình bắt đầu với một nguồn tài liệu và kết thúc với ngữ cảnh đã chọn cho một mô hình. Một trình đọc hoặc kết nối tải nội dung nguồn. Một bộ phân tích biến tài liệu thành các nút. Một mô hình nhúng hoặc phương pháp chỉ mục khác biến những nút đó thành có thể tìm kiếm. Một trình lấy dữ liệu chọn ứng viên, các bộ xử lý sau tùy chọn lọc hoặc xếp hạng lại chúng, và một bộ tổng hợp phản hồi yêu cầu một mô hình trả lời từ bằng chứng đã chọn.

Mỗi giai đoạn có thể thay đổi câu trả lời cuối cùng. Một bộ phân tích bỏ qua các tiêu đề bảng có thể tách giá trị ra khỏi ý nghĩa của chúng. Một ranh giới phần có thể tách một quy tắc ra khỏi ngoại lệ của nó. Siêu dữ liệu yếu có thể trộn lẫn các khu vực pháp lý hoặc các phiên bản tài liệu. Do đó, việc đánh giá truy xuất thuộc gần với việc nạp dữ liệu, trước khi nhóm dành thời gian điều chỉnh lời nhắc cuối cùng.

Các Thành phần Chính của LlamaIndex

Thành phầnMục đíchCâu hỏi thiết kế
Trình đọc hoặc kết nốiTải dữ liệu từ tệp, API, cơ sở dữ liệu hoặc các nguồn khác.Những quyền hạn và siêu dữ liệu nguồn nào cần được bảo tồn?
Tài liệu và nútĐại diện cho nội dung nguồn và các đơn vị có thể truy xuất.Ranh giới nên rơi ở đâu mà không mất đi ngữ cảnh?
Chỉ mụcSắp xếp các nút để truy cập hiệu quả.Biểu diễn nào phù hợp với mẫu truy vấn?
Trình lấy dữ liệuChọn các nút liên quan đến một đầu vào.Làm thế nào để đo lường độ hồi nhớ và độ chính xác?
Động cơ truy vấn hoặc trò chuyệnKết hợp truy xuất với việc tạo phản hồi.Ứng dụng có cần hành vi một lần hay đối thoại không?
Đại lý và quy trình làm việcSử dụng công cụ và phối hợp thực hiện đa bước.Những bước nào yêu cầu phán đoán mô hình so với mã cố định?

Các thành phần có thể kết hợp, điều này giúp thử nghiệm. Sự linh hoạt đó cũng có thể che giấu nguyên nhân thực sự của một câu trả lời kém. Giữ một dấu vết của các nút đã phân tích, điểm truy xuất, xử lý sau, các lời nhắc, và các ID nguồn đã trích dẫn để mỗi lớp có thể được kiểm tra độc lập.

Các trường hợp sử dụng LlamaIndex phổ biến

Trợ lý kiến thức

Nhân viên truy vấn các bộ sưu tập chính sách, hướng dẫn và tài liệu nội bộ với các câu trả lời liên kết nguồn.

Nghiên cứu tài liệu

Các nhà nghiên cứu tìm kiếm các báo cáo dài, so sánh các đoạn văn và tổng hợp câu trả lời trong khi vẫn bảo tồn nguồn gốc.

Trích xuất có cấu trúc

Phân tích và trích xuất dựa trên cấu trúc chuyển đổi các tệp phức tạp thành các bản ghi mà các hệ thống hạ nguồn có thể xác thực.

Đại lý nhận thức dữ liệu

Các đại lý coi các công cụ truy vấn, cơ sở dữ liệu và API bên ngoài là các công cụ trong một quy trình làm việc lớn hơn.

Nội dung web có thể đi vào cùng một con đường. Khi các trang hiển thị văn bản chính của chúng bằng JavaScript, một công cụ thu thập hỗ trợ trình duyệt có thể nắm bắt nội dung hiển thị trước khi LlamaIndex phân tích nó. Scrapeless xử lý thực thi trình duyệt; ứng dụng LlamaIndex xử lý đại diện, truy xuất và tổng hợp câu trả lời.

Thiết kế một Dòng Ingestion

Ingestion nên bảo tồn ý nghĩa trước khi tối ưu hóa cho tốc độ. Bắt đầu bằng việc xác định các đơn vị mà độc giả thực sự tham chiếu: các phần, điều khoản, hàng bảng, bản ghi sản phẩm hoặc lượt trò chuyện. Chuẩn hóa tiếng ồn rõ ràng, nhưng không loại bỏ tiêu đề, nhãn, thời gian, và các định danh nguồn mà việc truy xuất hoặc trích dẫn cần trong tương lai.

  1. Danh sách các loại nguồn, sở hữu, tần suất cập nhật và quy tắc truy cập.
  2. Chọn các bộ phân tích giữ nguyên cấu trúc cần thiết cho các câu hỏi và trích dẫn.
  3. Tạo các nút với ID nguồn ổn định và siêu dữ liệu cho phiên bản, phần, ngày và quyền tài phán.
  4. Chọn ranh giới phân mảnh dựa trên cấu trúc tài liệu, sau đó so sánh chúng với một tiêu chuẩn cơ sở.
  5. Xây dựng chỉ mục và xác định bộ lọc truy xuất trước khi thêm tạo ra.
  6. Kiểm tra truy xuất với các câu hỏi thực và đoạn văn có liên quan đã biết.
  7. Thêm tổng hợp phản hồi chỉ sau khi đường dẫn chứng cứ hoạt động tốt.

Thứ tự này ngăn chặn một câu trả lời mẫu lưu loát làm mờ đi một vấn đề truy xuất. Nếu nút đúng không bao giờ đến được lời nhắc, một bộ tạo tốt hơn không thể phục hồi một cách đáng tin cậy sự thật bị thiếu.

Chỉ mục, Truy xuất và Công cụ Truy vấn

Một chỉ mục tổ chức các nút để chúng có thể được tìm thấy. Một chỉ mục vector sử dụng nhúng để khớp độ tương đồng ngữ nghĩa, trong khi các cấu trúc khác có thể sử dụng từ khóa, tài liệu, danh sách hoặc đồ thị thuộc tính. Bộ truy xuất chuyển đổi một truy vấn thành các nút ứng cử viên. Các bộ xử lý sau có thể áp dụng bộ lọc siêu dữ liệu, ngưỡng tương đồng, tái xếp hạng, hoặc mở rộng ngữ cảnh.

Một công cụ truy vấn kết nối truy xuất với tổng hợp phản hồi. Một công cụ trò chuyện thêm trạng thái trò chuyện và có thể viết lại các câu hỏi theo sau trước khi truy xuất. Lịch sử cuộc trò chuyện không nên im lặng ghi đè bằng chứng nguồn. Lưu lại câu hỏi đã giải quyết và các nút đã truy xuất cho mỗi lượt để người đánh giá có thể thấy lý do câu trả lời đã thay đổi.

Đánh giá nên tách biệt truy xuất khỏi tạo ra. Đo lường xem nguồn mong đợi có xuất hiện trong tập ứng viên hay không, sau đó đo lường xem câu trả lời cuối cùng có trung thực với nguồn đó hay không. Các điểm số kết hợp đầu cuối hữu ích, nhưng chúng không tiết lộ giai đoạn nào cần sửa chữa. Tài liệu gốc bài báo về tạo ra có gia tăng truy xuất cung cấp nền tảng hữu ích về việc kết hợp kiến thức tham số và kiến thức được truy xuất.

Các đại lý và quy trình làm việc LlamaIndex

Các đại lý LlamaIndex sử dụng các mô hình để chọn công cụ, bao gồm các công cụ truy vấn, chức năng và dịch vụ bên ngoài. Các quy trình làm việc phối hợp các sự kiện và trạng thái qua nhiều bước. Sử dụng các đại lý nơi con đường phụ thuộc vào yêu cầu; giữ phân tích xác định, ủy quyền, xác thực, và tác dụng phụ trong mã bình thường hoặc các nút quy trình làm việc rõ ràng.

Các công cụ cần mô tả và sơ đồ hẹp. Một công cụ “tìm kiếm mọi thứ” tạo ra các lựa chọn không rõ ràng, trong khi các công cụ riêng biệt cho bộ chính sách, cơ sở dữ liệu sản phẩm, và web công khai hiện tại rõ ràng về ranh giới nguồn. Quyền hạn nên đi kèm với mỗi công cụ. Một hướng dẫn mô hình không phải là một sự thay thế cho kiểm soát truy cập.

Tổng quan về thành phần LlamaCloud phân biệt phân tích quản lý, trích xuất, lập chỉ mục, phân loại, và dịch vụ đại lý. Các đội so sánh các con đường nguồn mở và quản lý nên đánh giá cư trú dữ liệu, chi phí, quyền sở hữu hoạt động và mức độ tùy chỉnh mà mỗi khối lượng công việc cần.

Thương lượng và Đánh giá

LlamaIndex cung cấp nhiều điểm mở rộng, điều này có thể tăng số lượng lựa chọn mà một đội phải sở hữu. Các mặc định hữu ích cho các nguyên mẫu nhưng nên được coi là giả thuyết. Cấu trúc tài liệu, phong cách truy vấn, ngôn ngữ, và từ vựng miền có thể thay đổi bộ phân tích tốt nhất, kích thước phân mảnh, nhúng, hoặc phương pháp truy xuất.

Xây dựng một bộ đánh giá nhỏ trước khi mở rộng ingestion. Bao gồm các câu hỏi tìm kiếm chính xác, câu hỏi đa đoạn văn, cách diễn đạt mơ hồ, trường hợp thiếu câu trả lời, và xung đột phiên bản. Xem xét việc trích dẫn nguồn và bỏ phiếu, không chỉ sự tương đồng ngôn ngữ tự nhiên. Mục tiêu là một hệ thống lấy được bằng chứng quản lý và nói rõ khi bộ sưu tập không thể trả lời.

Kết luận

LlamaIndex là một khuôn khổ để kết nối các mô hình ngôn ngữ với dữ liệu bên ngoài thông qua ingestion, các nút, chỉ mục, truy xuất, công cụ truy vấn, đại lý, và quy trình làm việc. Sự phù hợp mạnh nhất của nó là một ứng dụng mà chất lượng dữ liệu và quyền truy cập bằng chứng thúc đẩy thiết kế. Bắt đầu với cấu trúc nguồn và đánh giá truy xuất, bảo tồn nguồn gốc, và thêm hành vi đại lý chỉ khi lựa chọn công cụ có hướng dẫn mô hình tạo ra giá trị đo lường được.

Sẵn sàng xây dựng một đường ống LlamaIndex được cung cấp từ web không?

Thu thập nội dung công khai đã được hiển thị bằng trình duyệt quản lý, sau đó giữ việc lập chỉ mục và truy xuất dưới sự kiểm soát của ứng dụng.

Đăng ký hôm nay và nhận $5 tín dụng miễn phíkhông yêu cầu thẻ tín dụng.

Nhận tín dụng $5 của bạn →

Câu hỏi thường gặp

LlamaIndex có phải là một cơ sở dữ liệu vector không?

Không. LlamaIndex có thể kết nối với các cơ sở dữ liệu vector và xây dựng các chỉ mục dựa trên vector, nhưng đó là một khuôn khổ rộng hơn cho ingestion, phân tích, truy xuất, tổng hợp phản hồi, đại lý, và quy trình làm việc. Cơ sở dữ liệu vẫn là một thành phần lưu trữ và tìm kiếm riêng biệt.

LlamaIndex chỉ dành cho RAG không?

Không. Tạo ra thông tin bổ sung từ việc truy xuất là một trường hợp sử dụng trung tâm, nhưng LlamaIndex cũng hỗ trợ phân tích tài liệu, trích xuất có cấu trúc, công cụ truy vấn và trò chuyện, đại lý sử dụng công cụ, và quy trình công việc dựa trên sự kiện trên dữ liệu.

Điểm khác biệt giữa Tài liệu và Nút là gì?

Một Tài liệu đại diện cho tài liệu nguồn được tải vào hệ thống. Một Nút là một đơn vị nhỏ hơn được rút ra từ tài liệu đó để lập chỉ mục và truy xuất. Các quy trình tốt bảo toàn siêu dữ liệu kết nối mỗi nút trở lại tài liệu nguồn và vị trí của nó.

LlamaIndex có thể tiếp nhận các trang web không?

Có. Một đầu nối hoặc bộ tải tùy chỉnh có thể cung cấp nội dung trang, và một lớp thu thập dựa trên trình duyệt có thể hiển thị các trang phụ thuộc vào JavaScript trước khi tiếp nhận. Ứng dụng nên bảo toàn các URL chuẩn, dấu thời gian, tiêu đề và quy tắc truy cập cùng với văn bản đã trích xuất.

Một nhóm nên đánh giá ứng dụng LlamaIndex như thế nào?

Đánh giá việc truy xuất và tạo ra một cách riêng biệt. Kiểm tra xem các nút liên quan đã biết có xuất hiện cho các câu hỏi đại diện hay không, liệu các trích dẫn có hỗ trợ câu trả lời không, liệu hệ thống có xử lý chứng cứ thiếu không, và liệu các thay đổi về phân tích, chia nhóm, nhúng hoặc nhắc nhở có cải thiện tiêu chí mong muốn không.

Tài liệu tham khảo