Goose + Scrapeless: Dê ao Agente de IA da Block Dados da Web ao Vivo via MCP
Lead Scraping Automation Engineer
TL;DR:
- Goose é o agente de IA de código aberto do Block, e alcança ferramentas externas através do Protocolo de Contexto do Modelo (MCP). Adicionar o servidor MCP Scrapeless dá ao Goose busca na web ao vivo e scraping que ele não possui por conta própria.
- O servidor MCP Scrapeless fornece 21 ferramentas —
google_search,google_trends,scrape_html,scrape_markdown,scrape_screenshote 16 açõesbrowser_*para controlar um navegador na nuvem. - Você o adiciona como uma extensão stdio, seja no
config.yamldo Goose ou inline comgoose run --with-extension, apontando paranpx -y scrapeless-mcp-servercom sua chave Scrapeless na variável de ambienteSCRAPELESS_KEY. - O Goose então chama as ferramentas por conta própria. Dada uma tarefa, o agente escolhe a ferramenta Scrapeless certa, executa e responde com os dados retornados — sem código auxiliar.
- Comece grátis. Novas contas Scrapeless incluem créditos gratuitos — inscreva-se em app.scrapeless.com.
Goose, o agente de código aberto do Block, escreve e executa código, dirige fluxos de trabalho e chama serviços externos por conta própria. O que ele não pode fazer de imediato é ver a web ao vivo — seu conhecimento é interrompido no corte de treinamento do modelo. O Goose fecha essa lacuna da mesma maneira que todos os anfitriões MCP fazem: conectando-se a servidores do Protocolo de Contexto do Modelo que expõem ferramentas. Este guia conecta o Goose ao servidor MCP Scrapeless, para que o agente possa pesquisar no Google e raspar páginas como parte de seu raciocínio. Cada comando, nome de ferramenta e resultado abaixo foi capturado de uma execução ao vivo.
O Que Esta Integração Permite
O servidor MCP Scrapeless é um servidor stdio: o Goose o lança como um subprocesso e fala MCP — um protocolo JSON-RPC — via entrada e saída padrão. Uma vez conectado, o Goose ganha:
- Busca ao vivo —
google_searchegoogle_trendspara resultados em tempo real e dados de interesse. - Extração de páginas —
scrape_html,scrape_markdownescrape_screenshottransformam qualquer URL em HTML, Markdown limpo ou uma imagem. - Controle de navegador na nuvem — 16 ferramentas
browser_*(browser_goto,browser_click,browser_type,browser_get_text,browser_snapshot, e mais) controlam um navegador gerenciado para páginas que precisam de interação.
O agente decide qual deles chamar; você descreve a tarefa em linguagem simples.
Pré-requisitos
- Goose instalado (CLI ou desktop) — veja o projeto Goose para o instalador.
- Node.js com
npxdisponível, para que o Goose possa lançar o servidor comnpx -y scrapeless-mcp-server. - Uma chave API Scrapeless — obtenha uma no plano gratuito em app.scrapeless.com.
- Um provedor de modelo configurado no Goose (o raciocínio do agente opera no seu modelo escolhido).
Adicione o Servidor MCP Scrapeless ao Goose
Existem duas maneiras de registrar a extensão. Para uma configuração permanente, adicione-a ao config.yaml do Goose (no Linux, ~/.config/goose/config.yaml), sob extensions:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: sua-chave-api-scrapeless
enabled: true
bundled: false
timeout: 300
description: Ferramentas de busca na web e scraping do Scrapeless
No aplicativo desktop, os mesmos valores vão em Extensões → Adicionar extensão personalizada: nome scrapeless, comando npx -y scrapeless-mcp-server, e uma variável de ambiente SCRAPELESS_KEY.
Para uma execução única, pule o arquivo de configuração e passe a extensão inline. A flag --with-extension aceita um comando completo com suas variáveis de ambiente:
bash
goose run --with-extension "SCRAPELESS_KEY=sua-chave npx -y scrapeless-mcp-server@0.4.9" \
--text "Pesquise no Google por 'web scraping' e me dê o primeiro resultado."
O Que o Goose Vê: a Lista de Ferramentas
Ao se conectar, o Goose executa o handshake do MCP e carrega as ferramentas do servidor. O servidor MCP Scrapeless (protocolo 2024-11-05) anuncia 21 ferramentas:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
Os primeiros cinco retornam dados diretamente; o conjunto browser_* impulsiona uma sessão persistente no Scrapeless Scraping Browser — crie uma, navegue, atue, leia e feche. Para mais tarefas de agente baseadas nestas ferramentas, veja 5 casos de uso do Scrapeless MCP.
Uso Impulsionado por Prompt
Com a extensão registrada, você atribui uma tarefa ao Goose e ele seleciona a ferramenta. Pedindo para ele fazer uma pesquisa:
bash
goose run --no-session \
--text "Use a ferramenta scrapeless google_search para buscar no Google por 'web scraping'. Informe quantos resultados orgânicos retornaram e o título exato do primeiro resultado orgânico."
Goose inicia uma sessão em seu modelo, chama a ferramenta e responde com o resultado. A execução ao vivo mostrou o agente invocando a ferramenta e relatando dados reais:
text
▸ google_search (q: web scraping)
A pesquisa no Google para "web scraping" retornou 8 resultados orgânicos.
O título exato do primeiro resultado orgânico é "Web scraping" da Wikipedia.
O agente escolheu google_search, passou a consulta e leu a contagem e o primeiro título de volta da resposta estruturada — sem código de análise do seu lado.
Conclusão
Goose é tão capaz quanto as ferramentas que pode acessar, e o servidor Scrapeless MCP fornece 21 delas: pesquisa, tendências, três conversores de página para dados e um conjunto completo de ferramentas de navegador em nuvem. Registre o servidor como uma extensão stdio — em config.yaml ou em linha com --with-extension — defina SCRAPELESS_KEY, e Goose chama a ferramenta certa para cada tarefa e responde com dados da web ao vivo. Toda a integração é uma entrada de extensão; tudo o que o agente faz com ela é um prompt.
Pronto para dar ao seu agente Goose dados da web ao vivo? Comece gratuitamente no painel do Scrapeless, leia a documentação do servidor MCP, ou compare planos na precificação do Scrapeless.
FAQ
Q: O que é Goose?
A: Goose é um agente de IA de código aberto da Block que opera na linha de comando e como um aplicativo desktop. Ele executa tarefas de forma autônoma e se conecta a ferramentas externas através do Model Context Protocol, então suas habilidades crescem com cada servidor MCP que você adiciona.
Q: Como o Goose se conecta ao Scrapeless?
A: Goose inicia o servidor Scrapeless MCP como um subprocesso stdio (npx -y scrapeless-mcp-server) e se comunica com o MCP por meio de entrada/saída padrão. Você o registra uma vez como uma extensão em config.yaml ou em linha com goose run --with-extension.
Q: Quais ferramentas o servidor Scrapeless MCP fornece?
A: Vinte e uma ferramentas: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot, e dezesseis ações browser_* para conduzir um navegador em nuvem (navegar, clicar, digitar, ler texto ou HTML, capturar tela, rolar, esperar e fechar).
Q: Onde coloco minha chave da API do Scrapeless?
A: Na variável de ambiente SCRAPELESS_KEY para a extensão — seja no bloco envs em config.yaml ou como parte da string de comando --with-extension. Goose a passa para o subprocesso do servidor.
Q: Eu ainda preciso de um provedor de modelo?
A: Sim. O Scrapeless fornece as ferramentas; o próprio provedor de modelo do Goose faz o raciocínio que decide quando chamá-las. Configure seu provedor no Goose como de costume.
Q: O agente chama as ferramentas automaticamente?
A: Sim. Assim que a extensão é registrada, você descreve a tarefa em linguagem simples e Goose seleciona a ferramenta Scrapeless apropriada, a executa e responde com os dados retornados.
Q: O Goose pode interagir com páginas, não apenas obtê-las?
A: Sim. As ferramentas browser_* conduzem uma sessão de navegador em nuvem persistente — browser_create, browser_goto, browser_click, browser_type, browser_get_text e browser_close — para que o agente possa trabalhar em páginas que requerem interação.
Na Scorretless, acessamos apenas dados disponíveis ao público, enquanto cumprem estritamente as leis, regulamentos e políticas de privacidade do site aplicáveis. O conteúdo deste blog é apenas para fins de demonstração e não envolve atividades ilegais ou infratoras. Não temos garantias e negamos toda a responsabilidade pelo uso de informações deste blog ou links de terceiros. Antes de se envolver em qualquer atividade de raspagem, consulte seu consultor jurídico e revise os termos de serviço do site de destino ou obtenha as permissões necessárias.



