ライブウェブデータを使用してエージェンティックRAGパイプラインを構築する方法
Lead Scraping Automation Engineer
TL;DR:
- エージェンティックRAGは、エージェントが証拠を取得するタイミングと方法を決定することを可能にします。 取得ループはクエリを再構築し、別のソースを調査し、証拠を評価し、明示的な制限の下で停止できます。
- ライブウェブデータには、別の取得レイヤーが必要です。 検索は候補となるソースを見つけ、ブラウザのレンダリングはクライアントサイドのページを表示し、正規化はページの内容を追跡可能なドキュメントに変換します。
- スクレイプレスMCPサーバーは、MCPクライアントに検索、ページ抽出、クラウドブラウザアクションのための1つのツール表面を提供します。 エージェントは、ハードコードされた1つの取得パスに代わって、タスクからこれらのツールを選択できます。
- 評価はすべての境界で行うべきです。 ソースの関連性、抽出の完全性、引用のサポート、回答の質、待機時間、コストを独立して測定します。
エージェンティックRAGアーキテクチャの概要
エージェンティックRAGパイプラインは、固定の取得-生成シーケンスを実行するのではなく、エージェントループ内に取得の決定を置きます。
元の 取得拡張生成アーキテクチャは、生成器と取得された外部メモリを組み合わせています。エージェンティックRAGは、その基盤の周りに計画とツールの使用を追加します:
質問 → 計画 → 検索 → レンダリングまたは取得 → 正規化 → 評価 → 保存または回答 → 引用
各矢印は契約です。検索は候補を返し、真実を返すわけではありません。レンダリングはページ状態を返し、クリーンな記録を返すわけではありません。ベクトルストアは類似のチャンクを返しますが、必ずしも十分な証拠ではありません。エージェントは、現在の成果物が次のステージのチェックを通過したときのみ前進すべきです。
エージェンティックRAGが固定パイプラインに勝るとき
エージェンティックRAGは、取得のニーズが質問ごとに異なるときに有用です。
固定パイプラインは、安定したチャンク化と1つの取得戦略を持つ既知のコーパスの場合、通常は簡単です。エージェンティック制御は、質問が複数の検索、ソース比較、JavaScriptで描画されたページ、新鮮さチェック、または弱い証拠の後の2回目のパスを必要とする可能性があるときに、そのコストを得ることができます。
ReAct研究パターンは、 reasoning tracesとアクション、観察を交互に行います。取得システムでは、そのパターンは制限されたループになります:ツールを決定し、その出力を調査し、証拠の状態を更新し、続行するか停止します。
決定論的なシーケンスの名前を変更するためだけにエージェントを追加しないでください。すべてのリクエストが同じクエリ、リトリーバー、チャンク数、回答プロンプトを使用する場合、通常のRAGパイプラインはテストと操作が簡単です。
前提条件
エージェンティックRAGビルドは、モデルループが必要になる前に、作動する取得ツールレイヤーが必要です。
- Node.jsおよびECMAScriptモジュールを実行できるプロジェクト。
- プロジェクトにインストールされた
@modelcontextprotocol/sdkおよびscrapeless-mcp-server。 - スクレイプレスアカウントおよび
SCRAPELESS_KEY環境変数。 - 最終的な計画と回答生成ループのためのモデルプロバイダキー。
- 標準のURL、タイトル、取得時刻、コンテンツハッシュ、およびチャンクオフセットを保持するドキュメントストア。
注:以下のMCPクライアントハンドシェイクには
SCRAPELESS_KEYが必要です。パッケージのインストールは実行されましたが、認証されたハンドシェイクとライブツールコールは、そのプロダクトキーがランタイムに存在しない場合の前提条件として残ります。
スクレイプレスMCPサーバーを接続する
スクレイプレスMCPサーバーは、ローカルのstdioプロセスまたはホストされたストリーミングHTTPエンドポイントを介して、任意の標準準拠MCPクライアントに接続します。
正確なクライアントSDKとサーバーパッケージをインストールします:
bash
pnpm add @modelcontextprotocol/sdk scrapeless-mcp-server
クライアントを作成し、stdioを介して接続し、ツール表面を検査し、輸送をクリーンに閉じます:
javascript
import { Client } from "@modelcontextprotocol/sdk/client/index.js";
import { StdioClientTransport } from "@modelcontextprotocol/sdk/client/stdio.js";
const transport = new StdioClientTransport({
command: "pnpm",
args: ["exec", "scrapeless-mcp-server"],
env: {
...process.env,
SCRAPELESS_KEY: process.env.SCRAPELESS_KEY,
},
});
const client = new Client(
{ name: "agentic-rag-client", version: "1.0.0" },
{ capabilities: {} },
);
await client.connect(transport);
const { tools } = await client.listTools();
console.log(tools.map((tool) => tool.name));
// Attach `tools` to the tool adapter used by your agent framework.
await client.close();
MCPライフサイクル仕様は、通常の操作の前に初期化と機能交渉を定義しています。ツールのリストは、エージェントがそれに依存する前にクライアントとサーバーがプロトコルのハンドシェイクを完了したことを証明するため、適切なスモークテストです。
スクレイプレスMCPローンチ記事はサーバーの役割をカバーしており、Mastra統合は特定のエージェントフレームワークに接続された同じツール表面を示しています。
実際の使用法:取得エージェントにプロンプトを与える
エージェントは、目標、証拠契約、および停止ルールを受け取る必要があります。
有用なプロンプトは具体的です:
質問に回答する現在の主要なソースを見つけてください。まず検索し、必要なコンテンツが取得した応答に存在しない場合のみページをレンダリングし、すべての主張のために正規のURLを保持し、答えを直接支持しないソースを拒否し、証拠が十分であるか取得予算が尽きるまで停止してください。
指示は、ソースの発見と証拠の受け入れを分離します。また、無限に続くブラウジングループを防ぎます。
適応可能なプロンプト
| 検索タスク | プロンプト制約 |
|---|---|
| 製品変更追跡 | ベンダー自身のリリースノートとその公開日を必要とする |
| 標準の調査 | 標準団体を優先し、セクションのURLを保持する |
| 市場比較 | 同等のフィールドを必要とし、欠落している値を明示的に記録する |
| 技術的トラブルシューティング | 公式文書と再現可能な構成を優先する |
Scrapelessを使用してスクレイピングを開始
Scrapelessでウェブスクレイピングと自動化のワークフローを強化しましょう!
今日サインアップして**$5の無料クレジット**を手に入れましょう — クレジットカードは不要です。今すぐScrapeless Dashboardで無料クレジットを請求してください。

新しいソースを検索してレンダリングする
ライブウェブの取得は、最も安価で信頼できるソースからよりリッチなものへとエスカレートすべきです。
検索から始めて候補のURLとスニペットを収集します。レスポンスHTMLに答えが含まれている場合は、クリーンなページコンテンツを取得します。クライアント側の実行が関連するページの状態を制御している場合のみ、ブラウザレンダリングを使用します。これにより、すべてのページが静的であると装って、取得レイヤーを迅速に保つことができます。
受け入れた各文書に対して取得エンベロープを記録します:
json
{
"canonicalUrl": "https://example.com/primary-source",
"title": "Primary source title",
"retrievedAt": "illustrative timestamp",
"contentHash": "illustrative hash",
"retrievalMethod": "search_then_render",
"text": "Illustrative normalized page text"
}
上記の値は説明のサンプルです; フィールドは契約です。正規化されたテキストが別のストアに移動しても、元のURLは保持してください。
正規化、チャンク化、保存
正規化は、出典を消去することなくページコンテンツを安定した文書に変換します。
ナビゲーションの重複、不明瞭なUIクローム、無関係なボイラープレートを削除します。意味を持っているため、見出し、リスト、テーブル、およびコードの境界を保持します。チャンク化する前に、正規URLとコンテンツハッシュで重複を排除します。
まず文書構造に基づいてチャンク化し、その後モデルのコンテキスト制約を強制します。全てのチャンクは、文書識別子、正規URL、見出しパス、文字オフセット、および取得時間を保持する必要があります。Self-RAG研究は、取得と批評信号が生成プロセスにおいてどのように関わるべきかを示しています。
生の正規化された文書は、埋め込みから別個に保存します。その分離により、チームはすべてのソースを再取得することなく埋め込みモデルやチャンクポリシーを変更できます。
取得、評価、回答
評価ステップは、取得した証拠が要求された回答を支持できるかどうかを決定します。
直接性、ソースの権威、新鮮さ、他の証拠との一致、抽出の完全性に基づいて各候補をスコアリングします。高いベクトル類似度スコアは、そのテキストが質問に答えていることを証明するものではありません。
回答ノードは、受け入れた証拠のみを受け取り、各パッセージにソース識別子が添付されるべきです。証拠が不十分な場合、エージェントはクエリを再構築するか、別の取得ツールを選択します。取得予算が枯渇した場合、未サポートのモデルメモリからギャップを埋めるのではなく、「証拠不十分」という制限された結果を返します。
シングルエージェントとマルチエージェントデザイン
シングルリトリーバルエージェントは、単一の状態マシンが追跡しやすいため、デフォルトです。
ワークフローは、役割が本当に異なるツール、ポリシー、または評価基準を持っている場合にのみ分割します。1つのエージェントがソース取得を所有し、別のエージェントが証拠の評価を、最後のエージェントが回答の統合を行う場合があります。マルチエージェントデザインは、調整状態、文脈の重複、およびより多くの障害境界を追加するため、各ハンドオフには明示的なスキーマが必要です。
Scrapeless AI Agentを、ワークフローにウェブツールを操作できるエージェントが必要な場合の製品インターフェースとして使用します。既存のエージェントフレームワークがすでにプランニングを所有し、ライブウェブ機能のみが必要な場合は、ホストされたMCPエンドポイントを使用します。
評価と可視性
Agentic RAG評価は、取得、リトリーバル、および回答の質を分離するべきです。
検索が期待される主要ソースを見つけたか、レンダリングが必要なコンテンツを明らかにしたか、正規化が支持となるパッセージを保持したか、評価が正しい証拠を受け入れたか、最終的な主張がその証拠によって支持されているかを追跡します。
また、ツールの選択、クエリの再構築、ソースURL、文書ハッシュ、チャンク識別子、停止理由、経過時間、コストを記録します。このトレースにより、弱い回答を診断可能にします。これがなければ、すべての問題はモデルの問題のように見えます。
レビュー Scrapelessの価格 を期待される検索、取得、レンダリングのミックスと比較し、MCPクライアントのセットアップを現在の Scrapelessドキュメント に合わせておきます。
結論:エビデンスを一級のアーティファクトにする
エージェンティックRAGパイプラインは、取得が適応しなければならない場合に役立ちますが、エージェントループは契約の必要性を排除しません。
検索、レンダリング、正規化、グレーディング、生成はそれぞれ検査可能なアーティファクトを生成する必要があります。まずMCPツール層を接続し、ハンドシェイクを確認し、その後、取得予算とエビデンスベースの停止ルールを持つモデルループを追加します。
エージェンティックRAGパイプラインを構築する準備はできましたか?
私たちのコミュニティに参加して無料プランを取得し、ライブウェブ取得システムを構築する開発者とつながりましょう:Discord · Telegram。
app.scrapeless.com にサインアップし、モデル駆動の計画ループを追加する前にScrapeless MCPツール層を接続してください。
FAQ
Q: エージェンティックRAGとは何ですか?
エージェンティックRAGは、エージェントが検索アクションを選択し、エビデンスを評価し、続行するか回答するかを決定する取得強化生成デザインです。ループは明示的なツール、時間、およびコストの制限内で動作します。
Q: エージェンティックRAGは標準RAGとどのように異なりますか?
標準RAGは通常、生成の前に固定取得ステップを実行しますが、エージェンティックRAGはクエリの再設定、異なるツールの選択、結果のグレーディング、そしてもう一つの制約のある取得ステップを実行することができます。
Q: エージェンティックRAGはベクターデータベースを必要としますか?
エージェンティックRAGはベクターデータベースを必要としません。エージェントは、エビデンス契約が明示的である限り、キーワード検索、構造化データベース、ライブウェブツール、またはハイブリッドリトリーバーを使用できます。
Q: RAGパイプラインでライブウェブデータを使用する理由は何ですか?
ライブウェブデータは、答えがモデルのトレーニングカットオフ後や静的内部コーパスの外部で変わる情報に依存する場合に役立ちます。パイプラインはソースのURLと取得メタデータを保存する必要があり、データの新鮮さが監査可能です。
Q: MCPはエージェンティックRAGシステムに何を追加しますか?
MCPはクライアントにサーバーツールを発見し、呼び出すための標準ライフサイクルを提供します。Scrapeless MCPサーバーは、そのツール境界を介して検索、ページ抽出、ブラウザアクションを公開します。
Q: エージェントはすべてのソースをブラウザでレンダリングするべきですか?
いいえ。エージェントは、レスポンスコンテンツが必要な情報を露出しない場合や相互作用が必要な場合にのみソースをレンダリングすべきです。HTTPファーストの取得はパイプラインを迅速かつ操作しやすく保ちます。
Q: 無限取得ループをどのように防ぎますか?
ツール呼び出し、経過時間、受け入れソース、クエリの再構成、および総コストに制限を設定します。停止ポリシーは「証拠が不十分」な結果を許可する必要があります。
Q: マルチエージェントデザインはエージェンティックRAGにとってより良いですか?
マルチエージェントデザインは、別々の役割が異なるツール、ポリシー、または評価基準が必要な場合にのみ優れています。一つのエージェントから始め、トレースが明確な境界を示した後に役割を分割します。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



