Quay lại blog

Cách xây dựng một quy trình RAG tác động với dữ liệu web trực tiếp

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

17-Aug-2026

TL;DR:

  • Agentic RAG cho phép một tác nhân quyết định khi nào và cách nào để thu thập chứng cứ. Vòng thu thập có thể hình thành lại truy vấn, kiểm tra nguồn khác, đánh giá chứng cứ, và dừng lại dưới các giới hạn rõ ràng.
  • Dữ liệu web trực tiếp cần một lớp thu thập riêng biệt. Tìm kiếm phát hiện các nguồn ứng viên, trình duyệt hiển thị các trang phía client, và chuẩn hóa biến nội dung trang thành các tài liệu có thể truy dấu.
  • Máy chủ MCP không scrapeless cung cấp cho một client MCP một bề mặt công cụ cho tìm kiếm, trích xuất trang, và các hành động trình duyệt đám mây. Tác nhân có thể chọn các công cụ đó từ nhiệm vụ thay vì mã cứng một con đường thu thập.
  • Đánh giá thuộc về mọi giới hạn. Đo nguồn liên quan, độ hoàn chỉnh của trích xuất, hỗ trợ trích dẫn, chất lượng câu trả lời, độ trễ, và chi phí độc lập.

Kiến Trúc Agentic RAG Nhìn Qua

Một đường ống RAG agentic đặt các quyết định thu thập bên trong một vòng lặp tác nhân thay vì chạy một chuỗi cố định thu thập-rồi-sinh.

Kiến trúc tăng cường quá trình sinh thu thập kết hợp một bộ sinh với bộ nhớ bên ngoài được thu thập. Agentic RAG thêm kế hoạch và sử dụng công cụ xung quanh nền tảng đó:

Câu hỏi → Kế hoạch → Tìm kiếm → Hiển thị hoặc thu thập → Chuẩn hóa → Đánh giá → Lưu trữ hoặc trả lời → Trích dẫn

Mỗi mũi tên là một hợp đồng. Tìm kiếm trả về các ứng viên, không phải sự thật. Hiển thị trả về trạng thái trang, không phải một bản ghi sạch. Một kho vector trả về các đoạn tương tự, không nhất thiết là chứng cứ đầy đủ. Tác nhân chỉ nên tiến lên khi hiện vật hiện tại vượt qua các kiểm tra của giai đoạn tiếp theo.

Khi nào Agentic RAG Vượt Trội so với Một Đường ống Cố định

Agentic RAG hữu ích khi các nhu cầu thu thập khác nhau từ câu hỏi này sang câu hỏi khác.

Một đường ống cố định thường đơn giản hơn cho một tập hợp đã biết với phân đoạn ổn định và một chiến lược thu thập. Kiểm soát agentic mang lại lợi ích của nó khi một câu hỏi có thể yêu cầu nhiều tìm kiếm, so sánh nguồn, một trang được hiển thị bằng JavaScript, kiểm tra độ mới, hoặc một lần kiểm tra thứ hai sau chứng cứ yếu.

Mô hình ReAct xen kẽ các dấu vết lý do với hành động và quan sát. Trong một hệ thống thu thập, mô hình đó trở thành một vòng lặp giới hạn: quyết định về một công cụ, kiểm tra đầu ra của nó, cập nhật trạng thái chứng cứ, và tiếp tục hoặc dừng lại.

Đừng thêm một tác nhân chỉ để đổi tên một chuỗi xác định. Nếu mọi yêu cầu sử dụng cùng một truy vấn, trình thu thập, số lượng phân đoạn, và lời nhắc trả lời, một đường ống RAG thông thường dễ dàng hơn để kiểm tra và vận hành.

Các yêu cầu

Một bản xây dựng RAG agentic cần một lớp công cụ thu thập hoạt động trước khi cần một vòng lặp mô hình.

  • Node.js và một dự án có thể chạy các mô-đun ECMAScript.
  • @modelcontextprotocol/sdkscrapeless-mcp-server được cài đặt trong dự án.
  • Một tài khoản Scrapeless và biến môi trường SCRAPELESS_KEY.
  • Một khóa nhà cung cấp mô hình cho vòng lập lập kế hoạch và sinh câu trả lời cuối cùng.
  • Một kho tài liệu mà bảo tồn URL chuẩn, tiêu đề, thời gian thu thập, băm nội dung, và độ dịch chuyển phân đoạn.

Lưu ý: Bước tay bắt tay của client MCP dưới đây yêu cầu SCRAPELESS_KEY. Cài đặt gói đã được chạy, trong khi bước tay bắt tay xác thực và cuộc gọi công cụ trực tiếp vẫn là một yêu cầu khi khóa sản phẩm đó không có trong thời gian thực.

Kết nối Máy chủ Scrapeless MCP

Máy chủ MCP không scrapeless kết nối với bất kỳ client MCP tuân thủ tiêu chuẩn nào qua một quy trình stdio cục bộ hoặc điểm cuối HTTP có thể phát trực tuyến.

Cài đặt SDK client và gói máy chủ chính xác:

bash Copy
pnpm add @modelcontextprotocol/sdk scrapeless-mcp-server

Tạo một client, kết nối qua stdio, kiểm tra bề mặt công cụ, và đóng giao thông một cách sạch sẽ:

javascript Copy
import { Client } from "@modelcontextprotocol/sdk/client/index.js";
import { StdioClientTransport } from "@modelcontextprotocol/sdk/client/stdio.js";

const transport = new StdioClientTransport({
  command: "pnpm",
  args: ["exec", "scrapeless-mcp-server"],
  env: {
    ...process.env,
    SCRAPELESS_KEY: process.env.SCRAPELESS_KEY,
  },
});

const client = new Client(
  { name: "agentic-rag-client", version: "1.0.0" },
  { capabilities: {} },
);

await client.connect(transport);
const { tools } = await client.listTools();
console.log(tools.map((tool) => tool.name));

// Attach `tools` to the tool adapter used by your agent framework.

await client.close();

Định nghĩa đặc tả vòng đời MCP việc khởi tạo và thương lượng khả năng trước khi hoạt động bình thường. Liệt kê các công cụ do đó là bài kiểm tra khói đúng: nó chứng minh rằng client và server đã hoàn thành việc bắt tay giao thức trước khi một tác nhân phụ thuộc vào chúng.

Bài viết ra mắt Scrapeless MCP đề cập đến vai trò của máy chủ, trong khi tích hợp Mastra cho thấy cùng một bề mặt công cụ được gắn vào một khung tác nhân cụ thể.

Cách Bạn Thực Sự Sử Dụng Điều Này: Nhắc Nhở Tác Nhân Thu Thập

Tác nhân nên nhận được một mục tiêu, một hợp đồng chứng cứ, và một quy tắc dừng lại.

Một lời nhắc hữu ích là cụ thể:

Tìm các nguồn chính hiện tại trả lời câu hỏi. Tìm kiếm trước, chỉ hiển thị một trang khi nội dung yêu cầu không có trong phản hồi đã thu thập, giữ URL chuẩn cho mỗi tuyên bố, từ chối các nguồn không hỗ trợ trực tiếp cho câu trả lời, và dừng lại khi chứng cứ đủ hoặc ngân sách thu thập đã hết.
Hướng dẫn tách biệt việc khám phá nguồn từ việc tiếp nhận chứng cứ. Nó cũng ngăn chặn một vòng lặp duyệt vô hạn.

Các lời nhắc bạn có thể điều chỉnh

Nhiệm vụ thu hồi Ràng buộc lời nhắc
Theo dõi thay đổi sản phẩm Yêu cầu ghi chú phát hành của nhà cung cấp và ngày công bố của nó
Nghiên cứu tiêu chuẩn Ưu tiên cơ quan tiêu chuẩn và giữ lại URL của phần
So sánh thị trường Yêu cầu các trường tương đương và ghi lại các giá trị còn thiếu một cách rõ ràng
Khắc phục sự cố kỹ thuật Ưu tiên tài liệu chính thức và cấu hình có thể tái tạo

Bắt đầu thu thập dữ liệu với Scrapeless

Tăng cường quy trình làm việc thu thập dữ liệu và tự động hóa của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận 5 đô la tín dụng miễn phíkhông yêu cầu thẻ tín dụng.

Nhận tín dụng miễn phí của bạn ngay bây giờ trong Bảng điều khiển Scrapeless.

Bảng điều khiển Scrapeless hiển thị 5 đô la tín dụng đội nhóm

Tìm kiếm và Render Nguồn Tươi Mới

Việc thu hồi web trực tiếp nên bắt đầu từ nguồn đáng tin cậy ít tốn kém nhất đến nguồn phong phú hơn.

Bắt đầu với tìm kiếm để thu thập các URL và đoạn băng ứng viên. Lấy nội dung trang sạch khi HTML phản hồi chứa câu trả lời. Chỉ sử dụng rendering trình duyệt khi thực thi phía khách hàng điều khiển trạng thái trang có liên quan. Điều này giữ cho lớp thu thập nhanh mà không giả vờ rằng mọi trang đều tĩnh.

Ghi lại một phong bì thu hồi cho mỗi tài liệu được chấp nhận:

json Copy
{
  "canonicalUrl": "https://example.com/primary-source",
  "title": "Primary source title",
  "retrievedAt": "illustrative timestamp",
  "contentHash": "illustrative hash",
  "retrievalMethod": "search_then_render",
  "text": "Illustrative normalized page text"
}

Các giá trị trên là một mẫu minh họa; các trường là hợp đồng. Bảo tồn URL gốc ngay cả khi văn bản chuẩn hóa di chuyển vào một kho lưu trữ khác.

Chuẩn hóa, Chia nhỏ, và Lưu trữ

Chuẩn hóa chuyển đổi nội dung trang thành tài liệu ổn định mà không xóa nguồn gốc.

Loại bỏ sự sao chép điều hướng, giao diện người dùng vô hình và nội dung không liên quan. Giữ lại tiêu đề, danh sách, bảng và các ranh giới mã vì chúng mang ý nghĩa. Loại bỏ trùng lặp theo URL chuẩn và băm nội dung trước khi chia nhỏ.

Chia nhỏ dựa trên cấu trúc tài liệu trước, sau đó thực hiện các ràng buộc ngữ cảnh của mô hình. Mỗi đoạn nên giữ lại định danh tài liệu, URL chuẩn, đường dẫn tiêu đề, offset ký tự, và thời gian thu hồi. Nghiên cứu Self-RAG chứng minh lý do tại sao tín hiệu thu hồi và phê bình thuộc về quy trình tạo ra thay vì được coi là một bước xử lý trước vô hình.

Lưu trữ tài liệu đã chuẩn hóa thô riêng biệt với các embedding. Sự tách biệt đó cho phép nhóm thay đổi mô hình embedding hoặc chính sách chia nhỏ mà không cần phải thu hồi lại mọi nguồn.

Thu hồi, Đánh giá, và Trả lời

Bước đánh giá quyết định xem chứng cứ thu hồi có thể hỗ trợ câu trả lời được yêu cầu hay không.

Chấm điểm mỗi ứng viên dựa trên độ trực tiếp, quyền lực nguồn, độ tươi mới, sự đồng thuận với các chứng cứ khác, và tính đầy đủ của việc trích xuất. Điểm tương đồng vector cao không chứng minh rằng văn bản trả lời cho câu hỏi.

Nút câu trả lời chỉ nên nhận được chứng cứ đã chấp nhận, với các định danh nguồn đính kèm cho mỗi đoạn. Nếu chứng cứ không đủ, tác nhân sẽ định hình lại truy vấn hoặc chọn một công cụ thu hồi khác. Nếu ngân sách thu hồi đã cạn kiệt, nó sẽ trả về một kết quả “chứng cứ không đủ” có giới hạn thay vì lấp đầy khoảng trống từ bộ nhớ mô hình không được hỗ trợ.

Thiết kế Một Tác Nhân vs Thiết Kế Đa Tác Nhân

Một tác nhân thu hồi đơn lẻ là mặc định vì một máy trạng thái dễ theo dõi hơn.

Chỉ tách biệt quy trình làm việc khi các vai trò thực sự có công cụ, chính sách hoặc tiêu chí đánh giá khác nhau. Một tác nhân có thể sở hữu việc thu hồi nguồn, một tác nhân khác chấm điểm chứng cứ, và một tác nhân cuối cùng tổng hợp câu trả lời. Thiết kế đa tác nhân thêm trạng thái phối hợp, ngữ cảnh trùng lặp, và nhiều ranh giới thất bại hơn, vì vậy mỗi lần chuyển giao cần một sơ đồ rõ ràng.

Sử dụng Tác Nhân AI Scrapeless làm giao diện sản phẩm khi quy trình làm việc cần một tác nhân có thể vận hành các công cụ web. Sử dụng đầu cuối MCP được lưu trữ khi một khuôn khổ tác nhân hiện có đã sở hữu lập kế hoạch và chỉ cần các khả năng web trực tiếp.

Đánh giá và Giám sát

Đánh giá Agentic RAG nên tách biệt chất lượng thu hồi, thu thập và câu trả lời.

Theo dõi xem tìm kiếm có tìm thấy nguồn chính như mong đợi không, xem rendering có phơi bày nội dung cần thiết không, xem chuẩn hóa có bảo tồn đoạn hỗ trợ không, xem đánh giá có chấp nhận chứng cứ đúng không, và xem tuyên bố cuối cùng có được chứng cứ đó hỗ trợ không.

Ngoài ra, cũng ghi lại lựa chọn công cụ, các hình thức truy vấn lại, URL của nguồn, băm tài liệu, định danh đoạn, lý do dừng, thời gian đã trôi qua, và chi phí. Đường dẫn này giúp phân tích một câu trả lời yếu. Nếu không có nó, mọi vấn đề trông giống như một vấn đề của mô hình.
Xem giá cả Scrapeless so với sự kết hợp tìm kiếm, thu thập và hiển thị dự kiến, và giữ cho thiết lập khách hàng MCP phù hợp với tài liệu Scrapeless hiện tại.

Kết luận: Biến Chứng Cứ Thành Một Tài Sản Hạng Nhất

Một pipeline RAG agentic hữu ích khi việc thu thập phải thích ứng, nhưng vòng lặp agent không loại bỏ sự cần thiết của các hợp đồng.

Tìm kiếm, hiển thị, chuẩn hóa, chấm điểm và tạo ra nên sản xuất các tài sản có thể kiểm tra. Kết nối lớp công cụ MCP trước, xác minh bắt tay, sau đó thêm vòng lặp mô hình với ngân sách thu thập và quy tắc dừng dựa trên chứng cứ.


Sẵn sàng để xây dựng một pipeline RAG agentic?

Tham gia cộng đồng của chúng tôi để yêu cầu một kế hoạch miễn phí và kết nối với các nhà phát triển xây dựng hệ thống thu thập dữ liệu web trực tiếp: Discord · Telegram.

Đăng ký tại app.scrapeless.com và kết nối lớp công cụ Scrapeless MCP trước khi thêm vòng lập lập kế hoạch dựa trên mô hình.


Câu hỏi thường gặp

Hỏi: RAG agentic là gì?

RAG agentic là một thiết kế tạo ra dữ liệu tăng cường truy xuất, trong đó một agent chọn các hành động truy xuất, đánh giá chứng cứ và quyết định liệu có nên tiếp tục hay trả lời. Vòng lặp hoạt động trong giới hạn công cụ, thời gian, và chi phí rõ ràng.

Hỏi: RAG agentic khác gì so với RAG tiêu chuẩn?

RAG tiêu chuẩn thường chạy một bước truy xuất cố định trước khi tạo ra, trong khi RAG agentic có thể cải cách truy vấn, chọn công cụ khác, chấm điểm kết quả, và thực hiện một bước truy xuất được giới hạn khác.

Hỏi: RAG agentic có cần một cơ sở dữ liệu vector không?

RAG agentic không cần một cơ sở dữ liệu vector. Agent có thể sử dụng tìm kiếm từ khóa, cơ sở dữ liệu có cấu trúc, công cụ web trực tiếp, hoặc một trình thu thập kết hợp miễn là hợp đồng chứng cứ là rõ ràng.

Hỏi: Tại sao lại sử dụng dữ liệu web trực tiếp trong một pipeline RAG?

Dữ liệu web trực tiếp hữu ích khi câu trả lời phụ thuộc vào thông tin thay đổi sau mốc thời gian đào tạo của mô hình hoặc ngoài một tập hợp nội dung tĩnh. Pipeline phải bảo vệ các URL nguồn và siêu dữ liệu truy xuất để độ mới có thể được kiểm tra.

Hỏi: MCP thêm gì vào một hệ thống RAG agentic?

MCP cung cấp cho khách hàng một vòng đời tiêu chuẩn để khám phá và gọi các công cụ máy chủ. Scrapeless MCP Server tiết lộ tìm kiếm, trích xuất trang, và các hành động trình duyệt thông qua ranh giới công cụ đó.

Hỏi: Một agent có nên hiển thị mọi nguồn trong trình duyệt không?

Không. Agent chỉ nên hiển thị một nguồn khi nội dung phản hồi không cung cấp thông tin cần thiết hoặc một tương tác là cần thiết. Truy xuất theo hướng HTTP giúp pipeline nhanh hơn và dễ vận hành hơn.

Hỏi: Làm thế nào để ngăn chặn các vòng lặp truy xuất vô tận?

Đặt giới hạn cho các cuộc gọi công cụ, thời gian trôi qua, nguồn được chấp nhận, cải cách truy vấn, và tổng chi phí. Chính sách dừng nên cho phép kết quả "chứng cứ không đủ".

Hỏi: Thiết kế đa agent có tốt hơn cho RAG agentic không?

Thiết kế đa agent chỉ tốt hơn khi các vai trò riêng biệt cần các công cụ, chính sách, hoặc tiêu chí đánh giá khác nhau. Bắt đầu với một agent và tách vai trò sau khi dấu vết cho thấy ranh giới rõ ràng.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục