Goose + Scrapeless: Proporcionar datos web en vivo del agente de IA de Block a través de MCP.
Lead Scraping Automation Engineer
TL;DR:
- Goose es el agente de IA de código abierto de Block, y accede a herramientas externas a través del Protocolo de Contexto del Modelo (MCP). Agregar el servidor MCP de Scrapeless le da a Goose búsqueda en la web en vivo y extracción que no tiene por sí mismo.
- El servidor MCP de Scrapeless incluye 21 herramientas —
google_search,google_trends,scrape_html,scrape_markdown,scrape_screenshoty 16 accionesbrowser_*para controlar un navegador en la nube. - Se agrega como una extensión stdio, ya sea en el
config.yamlde Goose o en línea congoose run --with-extension, apuntando anpx -y scrapeless-mcp-servercon tu clave de Scrapeless en la variable de entornoSCRAPELESS_KEY. - Goose luego llama a las herramientas por su cuenta. Dada una tarea, el agente elige la herramienta de Scrapeless correcta, la ejecuta y responde con los datos devueltos — sin código de pegamento.
- Comienza gratis. Las nuevas cuentas de Scrapeless incluyen créditos gratuitos — regístrate en app.scrapeless.com.
Goose, el agente de código abierto de Block, escribe y ejecuta código, impulsa flujos de trabajo y llama a servicios externos por su cuenta. Lo que no puede hacer desde el principio es ver la web en vivo — su conocimiento se detiene en el corte de entrenamiento del modelo. Goose cierra esa brecha de la misma manera que lo hace cada host de MCP: conectándose a servidores del Protocolo de Contexto del Modelo que exponen herramientas. Esta guía conecta Goose al servidor MCP Scrapeless, para que el agente pueda buscar en Google y extraer páginas como parte de su razonamiento. Cada comando, nombre de herramienta y resultado a continuación se capturó de una ejecución en vivo.
Lo que esta integración permite
El servidor MCP de Scrapeless es un servidor stdio: Goose lo inicia como un subproceso y habla MCP — un protocolo de JSON-RPC — a través de la entrada y salida estándar. Una vez conectado, Goose obtiene:
- Búsqueda en vivo —
google_searchygoogle_trendspara resultados en tiempo real y datos de interés. - Extracción de páginas —
scrape_html,scrape_markdownyscrape_screenshotconvierten cualquier URL en HTML, Markdown limpio o una imagen. - Control del navegador en la nube — 16 herramientas
browser_*(browser_goto,browser_click,browser_type,browser_get_text,browser_snapshot, y más) controlan un navegador administrado para páginas que requieren interacción.
El agente decide cuál de estas llamar; describes la tarea en lenguaje natural.
Requisitos previos
- Goose instalado (CLI o escritorio) — consulta el proyecto Goose para obtener el instalador.
- Node.js con
npxdisponible, para que Goose pueda iniciar el servidor connpx -y scrapeless-mcp-server. - Una clave API de Scrapeless — obtén una en el plan gratuito en app.scrapeless.com.
- Un proveedor de modelo configurado en Goose (el razonamiento del agente se ejecuta en tu modelo elegido).
Agregar el servidor MCP de Scrapeless a Goose
Hay dos formas de registrar la extensión. Para una configuración permanente, agrégala al config.yaml de Goose (en Linux, ~/.config/goose/config.yaml), bajo extensions:
yaml
extensions:
scrapeless:
name: scrapeless
type: stdio
cmd: npx
args:
- -y
- scrapeless-mcp-server@0.4.9
envs:
SCRAPELESS_KEY: tu-clave-api-scrapeless
enabled: true
bundled: false
timeout: 300
description: Herramientas de búsqueda y extracción en la web de Scrapeless
En la aplicación de escritorio, los mismos valores se ingresan en Extensiones → Agregar extensión personalizada: nombre scrapeless, comando npx -y scrapeless-mcp-server, y una variable de entorno SCRAPELESS_KEY.
Para una ejecución única, omite el archivo de configuración y pasa la extensión en línea. La opción --with-extension acepta un comando completo con sus variables de entorno:
bash
goose run --with-extension "SCRAPELESS_KEY=tu-clave npx -y scrapeless-mcp-server@0.4.9" \
--text "Buscar Google para 'web scraping' y darme el primer resultado."
Lo que Goose ve: la lista de herramientas
Al conectarse, Goose realiza el apretón de manos MCP y carga las herramientas del servidor. El servidor MCP de Scrapeless (protocolo 2024-11-05) anuncia 21 herramientas:
text
google_search google_trends scrape_html scrape_markdown
scrape_screenshot browser_create browser_goto browser_click
browser_type browser_press_key browser_get_text browser_get_html
browser_snapshot browser_screenshot browser_scroll browser_scroll_to
browser_go_back browser_go_forward browser_wait browser_wait_for
browser_close
Los primeros cinco devuelven datos directamente; el conjunto browser_* impulsa una sesión persistente en el Navegador de Raspado de Scrapeless: crea una, navega, actúa, lee y cierra. Para más tareas de agente basadas en estas herramientas, consulta 5 casos de uso de Scrapeless MCP.
Uso Impulsado por Solicitudes
Con la extensión registrada, le das a Goose una tarea y selecciona la herramienta. Pidiéndole que ejecute una búsqueda:
bash
goose run --no-session \
--text "Utiliza la herramienta de búsqueda de google_scrapeless para buscar en Google 'web scraping'. Informa cuántos resultados orgánicos se obtuvieron y el título exacto del primer resultado orgánico."
Goose inicia una sesión en tu modelo, llama a la herramienta y responde a partir del resultado. La ejecución en vivo mostró al agente invocando la herramienta e informando datos reales:
text
▸ google_search (q: web scraping)
La búsqueda en Google para "web scraping" devolvió 8 resultados orgánicos.
El título exacto del primer resultado orgánico es "Web scraping" de Wikipedia.
El agente eligió google_search, pasó la consulta y leyó el conteo y el primer título de la respuesta estructurada — sin código de análisis de tu parte.
Conclusión
Goose es tan capaz como las herramientas a las que puede acceder, y el servidor Scrapeless MCP le proporciona 21 de ellas: búsqueda, tendencias, tres convertidores de página a datos, y un conjunto completo de herramientas de navegador en la nube. Registra el servidor como una extensión de stdio — en config.yaml o en línea con --with-extension — establece SCRAPELESS_KEY, y Goose llama a la herramienta correcta para cada tarea y responde con datos del web en tiempo real. Toda la integración es una entrada de extensión; todo lo que el agente hace con ella es una solicitud.
¿Listo para darle a tu agente Goose datos web en vivo? Comienza gratis desde el tablero de Scrapeless, lee la documentación del servidor MCP, o compara planes en precios de Scrapeless.
Preguntas Frecuentes
P: ¿Qué es Goose?
R: Goose es un agente de IA de código abierto de Block que se ejecuta en la línea de comandos y como una aplicación de escritorio. Ejecuta tareas de forma autónoma y se conecta a herramientas externas a través del Protocolo de Contexto del Modelo, por lo que sus habilidades crecen con cada servidor MCP que agregas.
P: ¿Cómo se conecta Goose a Scrapeless?
R: Goose lanza el servidor MCP de Scrapeless como un subprocesso de stdio (npx -y scrapeless-mcp-server) y habla MCP a través de la entrada/salida estándar. Lo registras una vez como una extensión en config.yaml o en línea con goose run --with-extension.
P: ¿Qué herramientas proporciona el servidor MCP de Scrapeless?
R: Veintiuna herramientas: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot y dieciséis acciones browser_* para manejar un navegador en la nube (navegar, hacer clic, escribir, leer texto o HTML, tomar capturas de pantalla, desplazarse, esperar y cerrar).
P: ¿Dónde pongo mi clave de API de Scrapeless?
R: En la variable de entorno SCRAPELESS_KEY para la extensión — ya sea en el bloque envs en config.yaml o como parte de la cadena de comando --with-extension. Goose la pasa al subprocesso del servidor.
P: ¿Todavía necesito un proveedor de modelo?
R: Sí. Scrapeless proporciona las herramientas; el propio proveedor de modelo de Goose realiza el razonamiento que decide cuándo llamarlas. Configura tu proveedor en Goose como de costumbre.
P: ¿El agente llama a las herramientas automáticamente?
R: Sí. Una vez que la extensión está registrada, describes la tarea en lenguaje natural y Goose selecciona la herramienta Scrapeless apropiada, la ejecuta y responde con los datos devueltos.
P: ¿Puede Goose interactuar con las páginas, no solo obtenerlas?
R: Sí. Las herramientas browser_* impulsan una sesión de navegador en la nube persistente — browser_create, browser_goto, browser_click, browser_type, browser_get_text, y browser_close — por lo que el agente puede trabajar a través de páginas que requieren interacción.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



