Volver al blog

Goose + Scrapeless: Proporcionar datos web en vivo del agente de IA de Block a través de MCP.

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

16-Jul-2026

TL;DR:

  • Goose es el agente de IA de código abierto de Block, y accede a herramientas externas a través del Protocolo de Contexto del Modelo (MCP). Agregar el servidor MCP de Scrapeless le da a Goose búsqueda en la web en vivo y extracción que no tiene por sí mismo.
  • El servidor MCP de Scrapeless incluye 21 herramientasgoogle_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot y 16 acciones browser_* para controlar un navegador en la nube.
  • Se agrega como una extensión stdio, ya sea en el config.yaml de Goose o en línea con goose run --with-extension, apuntando a npx -y scrapeless-mcp-server con tu clave de Scrapeless en la variable de entorno SCRAPELESS_KEY.
  • Goose luego llama a las herramientas por su cuenta. Dada una tarea, el agente elige la herramienta de Scrapeless correcta, la ejecuta y responde con los datos devueltos — sin código de pegamento.
  • Comienza gratis. Las nuevas cuentas de Scrapeless incluyen créditos gratuitos — regístrate en app.scrapeless.com.

Goose, el agente de código abierto de Block, escribe y ejecuta código, impulsa flujos de trabajo y llama a servicios externos por su cuenta. Lo que no puede hacer desde el principio es ver la web en vivo — su conocimiento se detiene en el corte de entrenamiento del modelo. Goose cierra esa brecha de la misma manera que lo hace cada host de MCP: conectándose a servidores del Protocolo de Contexto del Modelo que exponen herramientas. Esta guía conecta Goose al servidor MCP Scrapeless, para que el agente pueda buscar en Google y extraer páginas como parte de su razonamiento. Cada comando, nombre de herramienta y resultado a continuación se capturó de una ejecución en vivo.

Lo que esta integración permite

El servidor MCP de Scrapeless es un servidor stdio: Goose lo inicia como un subproceso y habla MCP — un protocolo de JSON-RPC — a través de la entrada y salida estándar. Una vez conectado, Goose obtiene:

  • Búsqueda en vivogoogle_search y google_trends para resultados en tiempo real y datos de interés.
  • Extracción de páginasscrape_html, scrape_markdown y scrape_screenshot convierten cualquier URL en HTML, Markdown limpio o una imagen.
  • Control del navegador en la nube — 16 herramientas browser_* (browser_goto, browser_click, browser_type, browser_get_text, browser_snapshot, y más) controlan un navegador administrado para páginas que requieren interacción.

El agente decide cuál de estas llamar; describes la tarea en lenguaje natural.

Requisitos previos

  • Goose instalado (CLI o escritorio) — consulta el proyecto Goose para obtener el instalador.
  • Node.js con npx disponible, para que Goose pueda iniciar el servidor con npx -y scrapeless-mcp-server.
  • Una clave API de Scrapeless — obtén una en el plan gratuito en app.scrapeless.com.
  • Un proveedor de modelo configurado en Goose (el razonamiento del agente se ejecuta en tu modelo elegido).

Agregar el servidor MCP de Scrapeless a Goose

Hay dos formas de registrar la extensión. Para una configuración permanente, agrégala al config.yaml de Goose (en Linux, ~/.config/goose/config.yaml), bajo extensions:

yaml Copy
extensions:
  scrapeless:
    name: scrapeless
    type: stdio
    cmd: npx
    args:
      - -y
      - scrapeless-mcp-server@0.4.9
    envs:
      SCRAPELESS_KEY: tu-clave-api-scrapeless
    enabled: true
    bundled: false
    timeout: 300
    description: Herramientas de búsqueda y extracción en la web de Scrapeless

En la aplicación de escritorio, los mismos valores se ingresan en Extensiones → Agregar extensión personalizada: nombre scrapeless, comando npx -y scrapeless-mcp-server, y una variable de entorno SCRAPELESS_KEY.

Para una ejecución única, omite el archivo de configuración y pasa la extensión en línea. La opción --with-extension acepta un comando completo con sus variables de entorno:

bash Copy
goose run --with-extension "SCRAPELESS_KEY=tu-clave npx -y scrapeless-mcp-server@0.4.9" \
  --text "Buscar Google para 'web scraping' y darme el primer resultado."

Lo que Goose ve: la lista de herramientas

Al conectarse, Goose realiza el apretón de manos MCP y carga las herramientas del servidor. El servidor MCP de Scrapeless (protocolo 2024-11-05) anuncia 21 herramientas:

text Copy
google_search      google_trends      scrape_html        scrape_markdown
scrape_screenshot  browser_create     browser_goto       browser_click
browser_type       browser_press_key  browser_get_text   browser_get_html
browser_snapshot   browser_screenshot browser_scroll     browser_scroll_to
browser_go_back    browser_go_forward browser_wait       browser_wait_for
browser_close

Los primeros cinco devuelven datos directamente; el conjunto browser_* impulsa una sesión persistente en el Navegador de Raspado de Scrapeless: crea una, navega, actúa, lee y cierra. Para más tareas de agente basadas en estas herramientas, consulta 5 casos de uso de Scrapeless MCP.

Uso Impulsado por Solicitudes

Con la extensión registrada, le das a Goose una tarea y selecciona la herramienta. Pidiéndole que ejecute una búsqueda:

bash Copy
goose run --no-session \
  --text "Utiliza la herramienta de búsqueda de google_scrapeless para buscar en Google 'web scraping'. Informa cuántos resultados orgánicos se obtuvieron y el título exacto del primer resultado orgánico."

Goose inicia una sesión en tu modelo, llama a la herramienta y responde a partir del resultado. La ejecución en vivo mostró al agente invocando la herramienta e informando datos reales:

text Copy
▸ google_search  (q: web scraping)

La búsqueda en Google para "web scraping" devolvió 8 resultados orgánicos.
El título exacto del primer resultado orgánico es "Web scraping" de Wikipedia.

El agente eligió google_search, pasó la consulta y leyó el conteo y el primer título de la respuesta estructurada — sin código de análisis de tu parte.

Conclusión

Goose es tan capaz como las herramientas a las que puede acceder, y el servidor Scrapeless MCP le proporciona 21 de ellas: búsqueda, tendencias, tres convertidores de página a datos, y un conjunto completo de herramientas de navegador en la nube. Registra el servidor como una extensión de stdio — en config.yaml o en línea con --with-extension — establece SCRAPELESS_KEY, y Goose llama a la herramienta correcta para cada tarea y responde con datos del web en tiempo real. Toda la integración es una entrada de extensión; todo lo que el agente hace con ella es una solicitud.

¿Listo para darle a tu agente Goose datos web en vivo? Comienza gratis desde el tablero de Scrapeless, lee la documentación del servidor MCP, o compara planes en precios de Scrapeless.

Preguntas Frecuentes

P: ¿Qué es Goose?
R: Goose es un agente de IA de código abierto de Block que se ejecuta en la línea de comandos y como una aplicación de escritorio. Ejecuta tareas de forma autónoma y se conecta a herramientas externas a través del Protocolo de Contexto del Modelo, por lo que sus habilidades crecen con cada servidor MCP que agregas.

P: ¿Cómo se conecta Goose a Scrapeless?
R: Goose lanza el servidor MCP de Scrapeless como un subprocesso de stdio (npx -y scrapeless-mcp-server) y habla MCP a través de la entrada/salida estándar. Lo registras una vez como una extensión en config.yaml o en línea con goose run --with-extension.

P: ¿Qué herramientas proporciona el servidor MCP de Scrapeless?
R: Veintiuna herramientas: google_search, google_trends, scrape_html, scrape_markdown, scrape_screenshot y dieciséis acciones browser_* para manejar un navegador en la nube (navegar, hacer clic, escribir, leer texto o HTML, tomar capturas de pantalla, desplazarse, esperar y cerrar).

P: ¿Dónde pongo mi clave de API de Scrapeless?
R: En la variable de entorno SCRAPELESS_KEY para la extensión — ya sea en el bloque envs en config.yaml o como parte de la cadena de comando --with-extension. Goose la pasa al subprocesso del servidor.

P: ¿Todavía necesito un proveedor de modelo?
R: Sí. Scrapeless proporciona las herramientas; el propio proveedor de modelo de Goose realiza el razonamiento que decide cuándo llamarlas. Configura tu proveedor en Goose como de costumbre.

P: ¿El agente llama a las herramientas automáticamente?
R: Sí. Una vez que la extensión está registrada, describes la tarea en lenguaje natural y Goose selecciona la herramienta Scrapeless apropiada, la ejecuta y responde con los datos devueltos.

P: ¿Puede Goose interactuar con las páginas, no solo obtenerlas?
R: Sí. Las herramientas browser_* impulsan una sesión de navegador en la nube persistente — browser_create, browser_goto, browser_click, browser_type, browser_get_text, y browser_close — por lo que el agente puede trabajar a través de páginas que requieren interacción.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar