Ngỗng + Không vết xước: Cung cấp dữ liệu web trực tiếp cho AI Agent của Block thông qua MCP.
Lead Scraping Automation Engineer
Tóm tắt:
- Goose là đại lý AI mã nguồn mở của Block, và nó kết nối với các công cụ bên ngoài thông qua Giao thức Ngữ cảnh Mô hình (MCP). Việc thêm máy chủ Scrapeless MCP cung cấp cho Goose khả năng tìm kiếm và lấy thông tin trên web một cách trực tiếp mà nó không có sẵn.
- Máy chủ Scrapeless MCP cung cấp 21 công cụ —
google_search,google_trends,scrape_html,scrape_markdown,scrape_screenshot, và 16 hành độngbrowser_*để điều khiển trình duyệt đám mây. - Bạn thêm nó như một tiện ích mở rộng stdio, có thể trong
config.yamlcủa Goose hoặc theo cách nhập trực tiếp vớigoose run --with-extension, chỉ định đếnnpx -y scrapeless-mcp-servervới khóa Scrapeless của bạn trong biến môi trườngSCRAPELESS_KEY. - Goose sau đó tự gọi các công cụ. Khi nhận được một nhiệm vụ, đại lý chọn công cụ Scrapeless phù hợp, chạy nó và trả lời từ dữ liệu được trả về — không cần mã dán.
- Bắt đầu miễn phí. Tài khoản Scrapeless mới bao gồm tín dụng miễn phí — đăng ký tại app.scrapeless.com.
Goose, đại lý mã nguồn mở từ Block, viết và chạy mã, điều khiển quy trình làm việc, và tự gọi dịch vụ bên ngoài. Điều nó không thể làm ngay lập tức là nhìn thấy web trực tiếp — kiến thức của nó dừng lại tại điểm cắt đào tạo của mô hình. Goose lấp đầy khoảng trống đó giống như mọi máy chủ MCP khác: bằng cách kết nối với Giao thức Ngữ cảnh Mô hình để hiện thực hóa các công cụ. Hướng dẫn này kết nối Goose với máy chủ MCP Scrapeless, để đại lý có thể tìm kiếm Google và lấy dữ liệu của các trang như một phần trong lý luận của nó. Mỗi lệnh, tên công cụ, và kết quả bên dưới đều được ghi lại từ một phiên chạy thực tế.
Tính năng của Tích hợp này
Máy chủ Scrapeless MCP là một máy chủ stdio: Goose khởi động nó như một quá trình con và giao tiếp MCP — một giao thức JSON-RPC — thông qua đầu vào và đầu ra chuẩn. Sau khi kết nối, Goose có:
- Tìm kiếm trực tiếp —
google_searchvàgoogle_trendsđể có kết quả theo thời gian thực và dữ liệu về sự quan tâm. - Trích xuất trang —
scrape_html,scrape_markdown, vàscrape_screenshotbiến bất kỳ URL nào thành HTML, Markdown sạch, hoặc hình ảnh. - Điều khiển trình duyệt đám mây — 16 công cụ
browser_*(browser_goto,browser_click,browser_type,browser_get_text,browser_snapshot, và nhiều hơn nữa) điều khiển một trình duyệt được quản lý cho các trang cần tương tác.
Đại lý quyết định công cụ nào trong số này sẽ được gọi; bạn mô tả nhiệm vụ bằng ngôn ngữ dễ hiểu.
Điều kiện tiên quyết
- Goose đã được cài đặt (CLI hoặc máy để bàn) — xem dự án Goose để biết trình cài đặt.
- Node.js với
npxcó sẵn, để Goose có thể khởi động máy chủ vớinpx -y scrapeless-mcp-server. - Một khóa API Scrapeless — nhận một khóa trên gói miễn phí tại app.scrapeless.com.
- Một nhà cung cấp mô hình đã được cấu hình trong Goose (quá trình lý luận của đại lý dựa trên mô hình bạn đã chọn).
Thêm Máy chủ Scrapeless MCP vào Goose
Có hai cách để đăng ký tiện ích mở rộng. Đối với thiết lập vĩnh viễn, thêm nó vào config.yaml của Goose (trên Linux, ~/.config/goose/config.yaml), dưới extensions:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: your-scrapeless-api-key
enabled: true
bundled: false
timeout: 300
description: Công cụ tìm kiếm và thu thập thông tin trên web Scrapeless
Trên ứng dụng máy để bàn, các giá trị tương tự được nhập vào Extensions → Thêm tiện ích mở rộng tùy chỉnh: tên scrapeless, lệnh npx -y scrapeless-mcp-server, và biến môi trường SCRAPELESS_KEY.
Đối với một lần chạy đơn lẻ, bỏ qua tệp cấu hình và truyền tiện ích mở rộng trực tiếp. Cờ --with-extension nhận một lệnh đầy đủ với các biến môi trường của nó:
bash
goose run --with-extension "SCRAPELESS_KEY=your-key npx -y scrapeless-mcp-server@0.4.9" \
--text "Tìm kiếm Google cho 'web scraping' và cho tôi kết quả đầu tiên."
Những gì Goose thấy: danh sách công cụ
Khi kết nối, Goose thực hiện bắt tay MCP và tải các công cụ của máy chủ. Máy chủ Scrapeless MCP (giao thức 2024-11-05) quảng bá 21 công cụ:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
Dữ liệu trả về đầu tiên năm trực tiếp; tập hợp browser_* điều khiển phiên làm việc liên tục trên Trình duyệt Scrapeless — tạo một phiên, điều hướng, hành động, đọc, và đóng. Để biết thêm về các nhiệm vụ đại lý được xây dựng trên các công cụ này, xem 5 trường hợp sử dụng Scrapeless MCP.
Sử dụng Dựa trên Lời nhắc
Với phần mở rộng đã được đăng ký, bạn giao một nhiệm vụ cho Goose và nó sẽ chọn công cụ. Hỏi nó thực hiện một tìm kiếm:
bash
goose run --no-session \
--text "Sử dụng công cụ google_search của scrapeless để tìm kiếm Google cho 'web scraping'. Báo cáo số lượng kết quả tự nhiên đã nhận về và tiêu đề chính xác của kết quả tự nhiên đầu tiên."
Goose bắt đầu một phiên trên mô hình của bạn, gọi công cụ, và trả lời từ kết quả. Chạy trực tiếp cho thấy đại lý gọi công cụ và báo cáo dữ liệu thực tế:
text
▸ google_search (q: web scraping)
Tìm kiếm Google cho "web scraping" đã trả về 8 kết quả tự nhiên.
Tiêu đề chính xác của kết quả tự nhiên đầu tiên là "Web scraping" từ Wikipedia.
Đại lý đã chọn google_search, truyền truy vấn, và đọc số lượng và tiêu đề đầu tiên từ phản hồi có cấu trúc — không cần mã phân tích ở phía bạn.
Kết luận
Goose chỉ có khả năng như các công cụ mà nó có thể tiếp cận, và máy chủ Scrapeless MCP cung cấp cho nó 21 công cụ: tìm kiếm, xu hướng, ba bộ chuyển đổi trang thành dữ liệu, và một bộ công cụ trình duyệt đám mây đầy đủ. Đăng ký máy chủ như một phần mở rộng stdio — trong config.yaml hoặc trực tiếp với --with-extension — đặt SCRAPELESS_KEY, và Goose sẽ gọi đúng công cụ cho từng nhiệm vụ và trả lời từ dữ liệu web trực tiếp. Toàn bộ tích hợp là một mục nhập phần mở rộng; mọi thao tác mà đại lý thực hiện với nó đều là một lời nhắc.
Sẵn sàng cho đại lý Goose của bạn nhận dữ liệu web trực tiếp? Bắt đầu miễn phí từ bảng điều khiển Scrapeless, đọc tài liệu máy chủ MCP, hoặc so sánh các gói trên giá Scrapeless.
Câu hỏi thường gặp
Q: Goose là gì?
A: Goose là một đại lý AI mã nguồn mở từ Block chạy trên dòng lệnh và như một ứng dụng máy tính để bàn. Nó thực hiện các nhiệm vụ một cách tự động và kết nối với các công cụ bên ngoài thông qua Giao thức Ngữ cảnh Mô hình, vì vậy khả năng của nó tăng lên với mỗi máy chủ MCP mà bạn thêm vào.
Q: Goose kết nối với Scrapeless như thế nào?
A: Goose khởi động máy chủ Scrapeless MCP như một quy trình con stdio (npx -y scrapeless-mcp-server) và giao tiếp MCP qua đầu vào/đầu ra tiêu chuẩn. Bạn chỉ cần đăng ký một lần như một phần mở rộng trong config.yaml hoặc trực tiếp với goose run --with-extension.
Q: Các công cụ nào mà máy chủ Scrapeless MCP cung cấp?
A: Hai mươi một công cụ: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, và mười sáu hành động browser_* để điều khiển trình duyệt đám mây (điều hướng, nhấp, gõ, đọc văn bản hoặc HTML, chụp màn hình, cuộn, chờ, và đóng).
Q: Tôi nên đặt khóa API Scrapeless của mình ở đâu?
A: Trong biến môi trường SCRAPELESS_KEY cho phần mở rộng — hoặc trong khối envs trong config.yaml hoặc như một phần của chuỗi lệnh --with-extension. Goose sẽ truyền nó cho quy trình con máy chủ.
Q: Tôi vẫn cần một nhà cung cấp mô hình không?
A: Có. Scrapeless cung cấp các công cụ; nhà cung cấp mô hình riêng của Goose thực hiện việc lập luận để quyết định khi nào gọi chúng. Cấu hình nhà cung cấp của bạn trong Goose như bình thường.
Q: Có phải đại lý tự động gọi các công cụ không?
A: Có. Khi phần mở rộng đã được đăng ký, bạn mô tả nhiệm vụ bằng ngôn ngữ đơn giản và Goose chọn công cụ Scrapeless phù hợp, thực hiện nó, và trả lời từ dữ liệu đã trả về.
Q: Goose có thể tương tác với các trang, không chỉ truy cập chúng không?
A: Có. Các công cụ browser_* điều khiển một phiên trình duyệt đám mây liên tục — browser_create, browser_goto, browser_click, browser_type, browser_get_text, và browser_close — vì vậy đại lý có thể làm việc qua các trang yêu cầu tương tác.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



