ガチョウ + スクラップレス: MCPを介してBlockのAIエージェントにライブウェブデータを提供
Lead Scraping Automation Engineer
TL;DR:
- GooseはBlockのオープンソースAIエージェントで、Model Context Protocol(MCP)を通じて外部ツールにアクセスします。 Scrapeless MCPサーバーを追加することで、Gooseは独自には持っていないライブウェブ検索とスクレイピング機能を得ます。
- Scrapeless MCPサーバーは21のツールを提供します —
google_search、google_trends、scrape_html、scrape_markdown、scrape_screenshot、およびクラウドブラウザを操作するための16のbrowser_*アクション。 - それを1つのstdio拡張として追加します。 Gooseの
config.yamlに追加するか、goose run --with-extensionとインラインで指定し、ScrapelessキーをSCRAPELESS_KEY環境変数に設定してnpx -y scrapeless-mcp-serverを指します。 - Gooseはその後、自らツールを呼び出します。 タスクが与えられると、エージェントは適切なScrapelessツールを選択し、それを実行して返されたデータから回答します — グルーコードは不要です。
- 無料で始めましょう。 新しいScrapelessアカウントには無料クレジットが含まれています — app.scrapeless.comでサインアップ。
Gooseは、Blockのオープンソースエージェントであり、コードを書いて実行し、ワークフローを推進し、外部サービスを自ら呼び出します。アウトオブボックスではできないことは、ライブウェブを見ることです — その知識はモデルのトレーニングカットオフで止まっています。Gooseは、他のすべてのMCPホストが行うのと同じ方法でそのギャップを埋めます:ツールを公開する< a href="https://modelcontextprotocol.io/docs/getting-started/intro" rel="nofollow">Model Context Protocolサーバーに接続することによって。このガイドでは、GooseをScrapeless MCPサーバーに接続し、エージェントはGoogleを検索し、ページをスクレイピングできるようにします。以下のすべてのコマンド、ツール名、および結果は、ライブ実行から取得されました。
この統合が可能にすること
Scrapeless MCPサーバーはstdioサーバーです:Gooseはそれをサブプロセスとして起動し、標準入力および出力を介してMCP — JSON-RPCプロトコル —を話します。接続が確立されると、Gooseは以下の機能を得ます:
- ライブ検索 —
google_searchとgoogle_trendsによるリアルタイムの結果と関心データ。 - ページ抽出 —
scrape_html、scrape_markdown、およびscrape_screenshotは任意のURLをHTML、クリーンなMarkdown、または画像に変換します。 - クラウドブラウザ制御 — 16の
browser_*ツール(browser_goto、browser_click、browser_type、browser_get_text、browser_snapshotなど)は、インタラクションが必要なページのために管理されたブラウザを操作します。
エージェントは、これらのどれを呼び出すかを決定します。タスクを平易な言葉で説明します。
前提条件
- Gooseがインストールされていること(CLIまたはデスクトップ) — インストーラーについてはGooseプロジェクトを参照してください。
npxが利用可能なNode.jsがインストールされていること、これによりGooseはnpx -y scrapeless-mcp-serverでサーバーを起動できます。- Scrapeless APIキー — app.scrapeless.comで無料プランのものを取得してください。
- Gooseにモデルプロバイダーが設定されていること(エージェントの推論は、選択したモデル上で動作します)。
Scrapeless MCPサーバーをGooseに追加する
拡張機能を登録する方法は2つあります。恒久的な設定の場合は、Gooseのconfig.yaml(Linuxの場合、~/.config/goose/config.yaml)にextensionsの下に追加します:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: your-scrapeless-api-key
enabled: true
bundled: false
timeout: 300
description: Scrapeless web search and scraping tools
デスクトップアプリでは、同じ値をExtensions → Add custom extensionに入力します:名前scrapeless、コマンドnpx -y scrapeless-mcp-server、環境変数SCRAPELESS_KEY。
一度限りの実行の場合は、設定ファイルをスキップし、インラインで拡張機能を渡します。--with-extensionフラグには、環境変数を伴った完全なコマンドが必要です:
bash
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
--text "Googleで『ウェブスクレイピング』を検索し、最初の結果を教えてください。"
Gooseが見るもの:ツーリスト
接続時に、GooseはMCPハンドシェイクを実行し、サーバーのツールを読み込みます。Scrapeless MCPサーバー(プロトコル 2024-11-05)は21のツールを広告しています:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
最初の5つはデータを直接返します。browser_* セットは、Scrapeless スクレイピングブラウザ 上で持続的なセッションを駆動します — 1つを作成し、移動し、アクションを実行し、読み取り、閉じます。これらのツールを基にした他のエージェントタスクについては、5つのScrapeless MCPユースケースをご覧ください。
プロンプト駆動型使用
拡張機能が登録されると、Gooseにタスクを渡し、ツールを選択させます。検索を実行するよう依頼する場合:
bash
goose run --no-session \
--text "Use the scrapeless google_search tool to search Google for 'web scraping'. Report how many organic results came back and the exact title of the first organic result."
Gooseはあなたのモデル上でセッションを開始し、ツールを呼び出し、結果から回答します。ライブ実行では、エージェントがツールを呼び出し、実際のデータを報告する様子が示されました:
text
▸ google_search (q: web scraping)
「web scraping」に関するGoogle検索では、8つのオーガニック結果が返されました。
最初のオーガニック結果の正確なタイトルは「Web scraping」で、Wikipediaからです。
エージェントはgoogle_searchを選択し、クエリを渡し、構造化された応答からカウントと最初のタイトルを読み取りました — あなた側でのパースコードは不要です。
結論
Gooseは、アクセスできるツールの能力に限られていますが、Scrapeless MCPサーバーは21のツールを提供します:検索、トレンド、3つのページからデータへのコンバーター、そして完全なクラウドブラウザツールセットです。サーバーを1つのstdio拡張として登録します — config.yaml に、または --with-extension とインラインで — SCRAPELESS_KEY を設定し、Gooseは各タスクに対して適切なツールを呼び出し、ライブウェブデータから回答します。全体の統合は1つの拡張エントリです。エージェントがそれを使って何をするかはプロンプトです。
あなたのGooseエージェントにライブウェブデータを提供する準備はできましたか?Scrapelessダッシュボードから無料で開始し、MCPサーバーのドキュメントを読み、Scrapelessの料金プランを比較してください。
FAQ
Q: Gooseとは何ですか?
A: GooseはBlockのオープンソースAIエージェントで、コマンドライン及びデスクトップアプリとして実行されます。自律的にタスクを実行し、モデルコンテキストプロトコルを通じて外部ツールに接続するので、追加する各MCPサーバーに応じてその能力が広がります。
Q: GooseはどのようにScrapelessに接続しますか?
A: GooseはScrapeless MCPサーバーをstdioサブプロセスとして起動し(npx -y scrapeless-mcp-server)、標準入力/出力を介してMCPと対話します。config.yamlに拡張として一度登録するか、goose run --with-extensionをインラインで使用します。
Q: Scrapeless MCPサーバーはどのようなツールを提供しますか?
A: 21のツールがあります:google_search、google_trends、scrape_html、scrape_markdown、scrape_screenshot、およびクラウドブラウザを駆動するための16のbrowser_*アクション(ナビゲート、クリック、タイプ、テキストまたはHTMLを読み取り、スクリーンショット、スクロール、待機、および閉じる)。
Q: Scrapeless APIキーはどこに置きますか?
A: 拡張のためのSCRAPELESS_KEY環境変数に – config.yamlのenvsブロック内、または--with-extensionコマンド文字列の一部として配置します。Gooseはそれをサーバーサブプロセスに渡します。
Q: まだモデルプロバイダーが必要ですか?
A: はい。Scrapelessはツールを提供しますが、Gooseのモデルプロバイダーがそれらを呼び出すタイミングを決定する推論を行います。通常通り、Gooseでプロバイダーを構成してください。
Q: エージェントはツールを自動的に呼び出しますか?
A: はい。拡張機能が登録されると、タスクを平易な言語で説明し、Gooseが適切なScrapelessツールを選択し、実行し、返されたデータから回答します。
Q: Gooseはページと対話できますか、それとも取得するだけですか?
A: はい。browser_*ツールは持続的なクラウドブラウザセッションを駆動します — browser_create、browser_goto、browser_click、browser_type、browser_get_text、およびbrowser_close — そのため、エージェントは対話が必要なページを操作できます。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



