🎯 Trình duyệt đám mây tùy chỉnh, chống phát hiện được hỗ trợ bởi Chromium tự phát triển, thiết kế dành cho trình thu thập dữ liệu webtác nhân AI. 👉Dùng thử ngay
Quay lại blog

Ngỗng + Không vết xước: Cung cấp dữ liệu web trực tiếp cho AI Agent của Block thông qua MCP.

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

16-Jul-2026

Tóm tắt:

  • Goose là đại lý AI mã nguồn mở của Block, và nó kết nối với các công cụ bên ngoài thông qua Giao thức Ngữ cảnh Mô hình (MCP). Việc thêm máy chủ Scrapeless MCP cung cấp cho Goose khả năng tìm kiếm và lấy thông tin trên web một cách trực tiếp mà nó không có sẵn.
  • Máy chủ Scrapeless MCP cung cấp 21 công cụgoogle_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, và 16 hành động browser_* để điều khiển trình duyệt đám mây.
  • Bạn thêm nó như một tiện ích mở rộng stdio, có thể trong config.yaml của Goose hoặc theo cách nhập trực tiếp với goose run --with-extension, chỉ định đến npx -y scrapeless-mcp-server với khóa Scrapeless của bạn trong biến môi trường SCRAPELESS_KEY.
  • Goose sau đó tự gọi các công cụ. Khi nhận được một nhiệm vụ, đại lý chọn công cụ Scrapeless phù hợp, chạy nó và trả lời từ dữ liệu được trả về — không cần mã dán.
  • Bắt đầu miễn phí. Tài khoản Scrapeless mới bao gồm tín dụng miễn phí — đăng ký tại app.scrapeless.com.

Goose, đại lý mã nguồn mở từ Block, viết và chạy mã, điều khiển quy trình làm việc, và tự gọi dịch vụ bên ngoài. Điều nó không thể làm ngay lập tức là nhìn thấy web trực tiếp — kiến thức của nó dừng lại tại điểm cắt đào tạo của mô hình. Goose lấp đầy khoảng trống đó giống như mọi máy chủ MCP khác: bằng cách kết nối với Giao thức Ngữ cảnh Mô hình để hiện thực hóa các công cụ. Hướng dẫn này kết nối Goose với máy chủ MCP Scrapeless, để đại lý có thể tìm kiếm Google và lấy dữ liệu của các trang như một phần trong lý luận của nó. Mỗi lệnh, tên công cụ, và kết quả bên dưới đều được ghi lại từ một phiên chạy thực tế.

Tính năng của Tích hợp này

Máy chủ Scrapeless MCP là một máy chủ stdio: Goose khởi động nó như một quá trình con và giao tiếp MCP — một giao thức JSON-RPC — thông qua đầu vào và đầu ra chuẩn. Sau khi kết nối, Goose có:

  • Tìm kiếm trực tiếpgoogle_searchgoogle_trends để có kết quả theo thời gian thực và dữ liệu về sự quan tâm.
  • Trích xuất trangscrape_html, scrape_markdown, và scrape_screenshot biến bất kỳ URL nào thành HTML, Markdown sạch, hoặc hình ảnh.
  • Điều khiển trình duyệt đám mây — 16 công cụ browser_* (browser_goto, browser_click, browser_type, browser_get_text, browser_snapshot, và nhiều hơn nữa) điều khiển một trình duyệt được quản lý cho các trang cần tương tác.

Đại lý quyết định công cụ nào trong số này sẽ được gọi; bạn mô tả nhiệm vụ bằng ngôn ngữ dễ hiểu.

Điều kiện tiên quyết

  • Goose đã được cài đặt (CLI hoặc máy để bàn) — xem dự án Goose để biết trình cài đặt.
  • Node.js với npx có sẵn, để Goose có thể khởi động máy chủ với npx -y scrapeless-mcp-server.
  • Một khóa API Scrapeless — nhận một khóa trên gói miễn phí tại app.scrapeless.com.
  • Một nhà cung cấp mô hình đã được cấu hình trong Goose (quá trình lý luận của đại lý dựa trên mô hình bạn đã chọn).

Thêm Máy chủ Scrapeless MCP vào Goose

Có hai cách để đăng ký tiện ích mở rộng. Đối với thiết lập vĩnh viễn, thêm nó vào config.yaml của Goose (trên Linux, ~/.config/goose/config.yaml), dưới extensions:

yaml Copy
extensions:
  scrapeless:
    name: scrapeless
    type: stdio
    cmd: npx
    args:
      - -y
      - scrapeless-mcp-server@0.4.9
    envs:
      SCRAPELESS_KEY: your-scrapeless-api-key
    enabled: true
    bundled: false
    timeout: 300
    description: Công cụ tìm kiếm và thu thập thông tin trên web Scrapeless

Trên ứng dụng máy để bàn, các giá trị tương tự được nhập vào Extensions → Thêm tiện ích mở rộng tùy chỉnh: tên scrapeless, lệnh npx -y scrapeless-mcp-server, và biến môi trường SCRAPELESS_KEY.

Đối với một lần chạy đơn lẻ, bỏ qua tệp cấu hình và truyền tiện ích mở rộng trực tiếp. Cờ --with-extension nhận một lệnh đầy đủ với các biến môi trường của nó:

bash Copy
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
  --text "Tìm kiếm Google cho 'web scraping' và cho tôi kết quả đầu tiên."

Những gì Goose thấy: danh sách công cụ

Khi kết nối, Goose thực hiện bắt tay MCP và tải các công cụ của máy chủ. Máy chủ Scrapeless MCP (giao thức 2024-11-05) quảng bá 21 công cụ:

text Copy
google_search      google_trends      scrape_html        scrape_markdown
scrape_screenshot  browser_create     browser_goto       browser_click
browser_type       browser_press_key  browser_get_text   browser_get_html
browser_snapshot   browser_screenshot browser_scroll     browser_scroll_to
browser_go_back    browser_go_forward browser_wait       browser_wait_for
browser_close

Dữ liệu trả về đầu tiên năm trực tiếp; tập hợp browser_* điều khiển phiên làm việc liên tục trên Trình duyệt Scrapeless — tạo một phiên, điều hướng, hành động, đọc, và đóng. Để biết thêm về các nhiệm vụ đại lý được xây dựng trên các công cụ này, xem 5 trường hợp sử dụng Scrapeless MCP.

Sử dụng Dựa trên Lời nhắc

Với phần mở rộng đã được đăng ký, bạn giao một nhiệm vụ cho Goose và nó sẽ chọn công cụ. Hỏi nó thực hiện một tìm kiếm:

bash Copy
goose run --no-session \
  --text "Sử dụng công cụ google_search của scrapeless để tìm kiếm Google cho 'web scraping'. Báo cáo số lượng kết quả tự nhiên đã nhận về và tiêu đề chính xác của kết quả tự nhiên đầu tiên."

Goose bắt đầu một phiên trên mô hình của bạn, gọi công cụ, và trả lời từ kết quả. Chạy trực tiếp cho thấy đại lý gọi công cụ và báo cáo dữ liệu thực tế:

text Copy
▸ google_search  (q: web scraping)

Tìm kiếm Google cho "web scraping" đã trả về 8 kết quả tự nhiên.
Tiêu đề chính xác của kết quả tự nhiên đầu tiên là "Web scraping" từ Wikipedia.

Đại lý đã chọn google_search, truyền truy vấn, và đọc số lượng và tiêu đề đầu tiên từ phản hồi có cấu trúc — không cần mã phân tích ở phía bạn.

Kết luận

Goose chỉ có khả năng như các công cụ mà nó có thể tiếp cận, và máy chủ Scrapeless MCP cung cấp cho nó 21 công cụ: tìm kiếm, xu hướng, ba bộ chuyển đổi trang thành dữ liệu, và một bộ công cụ trình duyệt đám mây đầy đủ. Đăng ký máy chủ như một phần mở rộng stdio — trong config.yaml hoặc trực tiếp với --with-extension — đặt SCRAPELESS_KEY, và Goose sẽ gọi đúng công cụ cho từng nhiệm vụ và trả lời từ dữ liệu web trực tiếp. Toàn bộ tích hợp là một mục nhập phần mở rộng; mọi thao tác mà đại lý thực hiện với nó đều là một lời nhắc.

Sẵn sàng cho đại lý Goose của bạn nhận dữ liệu web trực tiếp? Bắt đầu miễn phí từ bảng điều khiển Scrapeless, đọc tài liệu máy chủ MCP, hoặc so sánh các gói trên giá Scrapeless.

Câu hỏi thường gặp

Q: Goose là gì?
A: Goose là một đại lý AI mã nguồn mở từ Block chạy trên dòng lệnh và như một ứng dụng máy tính để bàn. Nó thực hiện các nhiệm vụ một cách tự động và kết nối với các công cụ bên ngoài thông qua Giao thức Ngữ cảnh Mô hình, vì vậy khả năng của nó tăng lên với mỗi máy chủ MCP mà bạn thêm vào.

Q: Goose kết nối với Scrapeless như thế nào?
A: Goose khởi động máy chủ Scrapeless MCP như một quy trình con stdio (npx -y scrapeless-mcp-server) và giao tiếp MCP qua đầu vào/đầu ra tiêu chuẩn. Bạn chỉ cần đăng ký một lần như một phần mở rộng trong config.yaml hoặc trực tiếp với goose run --with-extension.

Q: Các công cụ nào mà máy chủ Scrapeless MCP cung cấp?
A: Hai mươi một công cụ: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, và mười sáu hành động browser_* để điều khiển trình duyệt đám mây (điều hướng, nhấp, gõ, đọc văn bản hoặc HTML, chụp màn hình, cuộn, chờ, và đóng).

Q: Tôi nên đặt khóa API Scrapeless của mình ở đâu?
A: Trong biến môi trường SCRAPELESS_KEY cho phần mở rộng — hoặc trong khối envs trong config.yaml hoặc như một phần của chuỗi lệnh --with-extension. Goose sẽ truyền nó cho quy trình con máy chủ.

Q: Tôi vẫn cần một nhà cung cấp mô hình không?
A: Có. Scrapeless cung cấp các công cụ; nhà cung cấp mô hình riêng của Goose thực hiện việc lập luận để quyết định khi nào gọi chúng. Cấu hình nhà cung cấp của bạn trong Goose như bình thường.

Q: Có phải đại lý tự động gọi các công cụ không?
A: Có. Khi phần mở rộng đã được đăng ký, bạn mô tả nhiệm vụ bằng ngôn ngữ đơn giản và Goose chọn công cụ Scrapeless phù hợp, thực hiện nó, và trả lời từ dữ liệu đã trả về.

Q: Goose có thể tương tác với các trang, không chỉ truy cập chúng không?
A: Có. Các công cụ browser_* điều khiển một phiên trình duyệt đám mây liên tục — browser_create, browser_goto, browser_click, browser_type, browser_get_text, và browser_close — vì vậy đại lý có thể làm việc qua các trang yêu cầu tương tác.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục