Cómo integrar el servidor Scrapeless MCP en ZeroClaw: Una guía paso a paso.
Specialist in Anti-Bot Strategies
Conclusiones clave:
- Un bloque TOML conecta el navegador en la nube con un agente Rust local. ZeroClaw es un entorno de ejecución de agente AI de un solo binario que se comunica con proveedores de LLM, escucha en más de 30 canales y actúa a través de herramientas. Agregar el Servidor MCP de Scrapeless es un bloque
[mcp]de cuatro líneas en~/.zeroclaw/config.toml: sin instalación de SDK, sin demonio que gestionar, sin cambio de código en el lado del agente. - Veinte herramientas MCP, dos superficies. El Servidor MCP de Scrapeless expone
google_search,google_trends, el conjunto completo de primitivas del navegador en la nubebrowser_*, yscrape_html/scrape_markdown/scrape_screenshot. El transporte Stdio se ejecuta localmente a través denpx -y scrapeless-mcp-server; el HTTP transmitible apunta ahttps://api.scrapeless.com/mcp. - Las habilidades de MCP y del Agente son complementarias, no alternativas. El servidor MCP le proporciona a ZeroClaw las herramientas; las habilidades de Scrapeless OpenClaw —
webunlocker-skillyllm-chat-scraper-skill— le dan el cómo para las API subyacentes de Scrapeless. ZeroClaw migró de OpenClaw y lee el mismo formatoSKILL.md, por lo que las habilidades se colocan en~/.zeroclaw/workspace/skills/y se pueden invocar a través dezeroclaw skills list. - Navegador en la nube anti-detección, proxies residenciales en más de 195 países. Scrapeless maneja la representación de JavaScript, salida de proxy residencial, aleatorización de huellas digitales (UA, zona horaria, WebGL, lienzo) y persistencia de sesiones a nivel de plataforma, por lo que el agente ZeroClaw se concentra en la tarea en lugar de en el sistema de evasión.
- Descubrir → extraer funciona en cualquier sitio. Usa
google_searchpara localizar la página,scrape_markdownpara extraer texto limpio de un SPA renderizado por JS, las herramientasbrowser_*para flujos paginados o interactivos, ygoogle_trendspara contexto de series temporales. El agente las compone; nada en el protocolo es específico para el objetivo. - Gratis para comenzar. Las nuevas cuentas de Scrapeless incluyen un tiempo de ejecución MCP gratuito: inscríbete en app.scrapeless.com.
Introducción: de un agente Rust local a acceso web en vivo
ZeroClaw es un entorno de ejecución de agente Rust que funciona completamente en la máquina del operador. Un binario, una configuración TOML, las claves del operador, el espacio de trabajo del operador. Se comunica con aproximadamente 20 proveedores de LLM, alcanza el mundo a través de Discord, Telegram, Matrix, correo electrónico, voz, webhooks y una CLI, y actúa a través de herramientas de shell, navegador, HTTP, hardware y MCP-server. El repositorio de 31k estrellas envía un modelo de seguridad construido en torno a la autonomía supervisada, sandbox de nivel OS (Landlock, Bubblewrap, Seatbelt, Docker) y recibos de herramienta criptográfica en cada acción.
El límite fundamental de cualquier entorno de ejecución de agente local es el mismo que enfrenta cada LLM: el conocimiento del modelo se congela en el corte de entrenamiento. Para investigación, monitoreo, generación de leads, inteligencia competitiva y RAG contra datos de editores en vivo, ese límite aparece en el momento en que el agente tiene que leer una página que no existía cuando se entrenó el modelo. El navegador y las herramientas HTTP integradas de ZeroClaw cubren páginas benignas y búsquedas de documentación; las páginas comerciales detrás de Cloudflare, Akamai, reCAPTCHA o filtrado de reputación IP son una superficie diferente que esas herramientas no fueron diseñadas para abordar.
Esta publicación describe cómo integrar Scrapeless en ZeroClaw a través de ambas superficies de integración que admite el entorno de ejecución: el Servidor MCP de Scrapeless (la forma canónica de exponer nuevas herramientas al agente) y las habilidades de Scrapeless OpenClaw (archivos de conocimiento canónicos que el agente carga para utilizar esas herramientas de manera efectiva). Los dos se complementan entre sí: el servidor MCP es lo que el agente llama; las habilidades son lo que le indica cuándo y cómo llamar a las APIs subyacentes de Scrapeless. Para la misma primitiva de Scrapeless expuesta a través de otros clientes, el tutorial del servidor MCP describe Claude Desktop / Cursor / Codex CLI, y la publicación de integración de Hermes cubre el camino directo-CDP para agentes que ya utilizan el Protocolo de Herramientas de Desarrollo de Chrome.
¿Qué es ZeroClaw?
ZeroClaw es un único binario Rust que inicia un entorno de ejecución de agente en la máquina del operador. Los mantenedores lo describen como "tú posees el agente, tú posees los datos, tú posees la máquina en la que se ejecuta". El entorno de ejecución está estructurado en torno a cuatro piezas móviles:
- Canales (más de 30 adaptadores). Mensajes entrantes de Discord, Telegram, Matrix, correo electrónico, voz, webhooks, la CLI y el puente IDE de ACP, todos dirigidos al mismo bucle de agente.
- Proveedores (aproximadamente 20 backends LLM). Anthropic, OpenAI, Ollama, cualquier punto final compatible con OpenAI. Cadenas de respaldo y enrutamiento mantienen al agente en funcionamiento cuando un proveedor falla.
- Herramientas (shell, navegador, HTTP, hardware, MCP). La superficie de acción. Los servidores MCP se registran como herramientas de primera clase junto a las integradas.
- Política de seguridad y motor SOP. La autonomía predeterminada es
supervisada: las operaciones de riesgo medio requieren aprobación, las de alto riesgo están bloqueadas. Los Procedimientos Operativos Estándar se activan en eventos MQTT, webhook, cron o periféricos con puertas de aprobación y ejecuciones reanudables.
La configuración se encuentra en un solo lugar: ~/.zeroclaw/config.toml. El espacio de trabajo — habilidades, memoria, registros, estado de MCP — se encuentra en ~/.zeroclaw/workspace/. Los operadores que migran de OpenClaw pueden importar el espacio de trabajo directamente; el formato de habilidad es el mismo.
Por qué agregar acceso web a su agente ZeroClaw
Los LLM que impulsan ZeroClaw comparten la misma limitación: fecha de corte de entrenamiento. En un entorno de rápida evolución que produce tres modos de fallo observables: respuestas desactualizadas, hechos imaginados y llamadas a herramientas contra URLs que desde entonces han cambiado o devuelto 404.
ZeroClaw incluye herramientas http y navegador integradas, y cubren una amplia superficie. No están optimizadas para la web comercial: SPA renderizadas por JS, intersticiales anti-bot, desafíos CAPTCHA y contenido geográficamente restringido se interpone entre el agente y los datos que el operador realmente desea. La integración de Scrapeless convierte esos modos de fallo en llamadas normales a herramientas:
- Investigación en tiempo real a través de
google_search(Google, con parámetros de localizacióngl+hl) ygoogle_trends(datos de interés en series temporales). - Validación cruzada de fuentes mediante
scrape_markdowncontra múltiples URLs de resultado en una única ejecución del agente. - Recolección de datos en vivo de sitios pesados en JS — páginas de precios, listados de mercado, páginas de reseñas, directorios públicos — a través de los primitivos del navegador en la nube
browser_*. - Consultas geobaseadas al asignar sesiones en un país específico, de modo que el agente vea lo que vería un usuario local.
Cómo extender ZeroClaw con Scrapeless: dos superficies
Scrapeless soporta ZeroClaw a través de dos superficies, utilizadas juntas:
- Servidor MCP de Scrapeless — el servidor oficial que expone 20 herramientas de navegador en la nube, SERP y raspado a través del Protocolo de Contexto de Modelo.
- Habilidades de OpenClaw de Scrapeless — archivos de conocimiento con formato
SKILL.mdque enseñan al agente cómo utilizar de manera efectiva la API Universitaria de Raspado de Scrapeless y el Chat Scraper de LLM. ZeroClaw importa las habilidades de OpenClaw directamente.
El servidor MCP es lo que el agente invoca. Las habilidades son lo que el agente lee para decidir cuándo y cómo invocar. No son alternativas: instalados juntos, el agente tiene tanto las herramientas como el manual.
Servidor MCP de Scrapeless
El servidor MCP incluye 20 herramientas de manera predeterminada. El conjunto central:
| Herramienta | Qué hace |
|---|---|
google_search |
Recuperación de SERP con parámetros de localización gl / hl. |
google_trends |
Datos de búsqueda en tendencia e interés en series temporales. |
scrape_markdown |
Renderizar una URL a través del navegador en la nube, devolver Markdown. |
scrape_html |
Lo mismo, devolviendo HTML completo renderizado. |
scrape_screenshot |
Capturar una captura de pantalla de alta calidad de cualquier página. |
browser_create |
Asignar (o reutilizar) una sesión de navegador en la nube. |
browser_goto |
Navegar la sesión a una URL. |
browser_click / browser_type / browser_press_key |
Controlar elementos interactivos de la página. |
browser_scroll / browser_scroll_to |
Activar contenido cargado de forma perezosa. |
browser_get_html / browser_get_text |
Extraer de la página actual del navegador en la nube. |
browser_screenshot / browser_snapshot |
Capturar el estado para revisión o procesamiento posterior. |
browser_wait_for / browser_wait |
Esperar por selectores o duraciones fijas. |
browser_close |
Liberar la sesión. |
Se soportan dos transportes. Stdio (npx -y scrapeless-mcp-server) es el predeterminado adecuado para una estación de trabajo que ejecuta ZeroClaw localmente; HTTP transmitible (https://api.scrapeless.com/mcp) es el predeterminado adecuado cuando el agente se ejecuta en un host remoto y el operador quiere que el servidor MCP sea alojado por Scrapeless en lugar de generado por cada invocación.
Habilidades de OpenClaw de Scrapeless
Las habilidades son archivos SKILL.md con un pequeño tiempo de ejecución de Python que envuelve una API de Scrapeless específica. Ambos se distribuyen en la organización oficial de GitHub de Scrapeless:
| Habilidad | Qué le enseña al agente |
|---|---|
webunlocker-skill |
Impulsar la API Universitaria de Raspado de Scrapeless — obtener HTML / texto plano / Markdown / capturas de pantalla / contenido estructurado con solución automática de CAPTCHA (reCAPTCHA, Cloudflare Turnstile, reto de Cloudflare), renderizado por JS, salida a través de proxy residencial con --country, reintento y soporte para POST + encabezados personalizados. |
llm-chat-scraper-skill |
Recoger respuestas de chat estructuradas de ChatGPT, Gemini, Perplexity y Grok — útil para monitoreo de búsqueda de IA y flujos de trabajo de medición GEO. |
ZeroClaw hereda el formato de habilidades de OpenClaw. Las habilidades se clonan en ~/.zeroclaw/workspace/skills/, se enumeran con zeroclaw skills list, y se ponen a disposición del agente en la siguiente sesión de zeroclaw agent.
Lo Que Puedes Hacer Con Ello
- Agente de monitoreo diario. Programa un SOP de ZeroClaw que se ejecute cada mañana:
google_searchpara palabras clave rastreadas,scrape_markdownde los tres mejores resultados, resume, entrega a través del adaptador del canal de Discord. - Seguimiento de visibilidad de AI-search. Con la habilidad de LLM Chat Scraper, extrae las respuestas que ChatGPT, Gemini, Perplexity y Grok producen para comandos relevantes a la marca de manera periódica; rastrea la presencia y el sentimiento a lo largo del tiempo.
- Generación de leads a partir de directorios públicos. Haz que el navegador en la nube recorra un directorio público paginado, elimina duplicados por dominio, entrega los registros a la memoria del agente.
- Relleno de formularios autenticados con humanos en el circuito. Lleva un formulario de incorporación de proveedores o de solicitud de empleo hasta la pantalla de revisión final, toma una captura de pantalla de toda la página, detente antes de enviar para que un humano pueda aprobar.
- Precios de competidores geobound. Asigna la sesión a un país específico, muestra la página de precios localizada, compara con la instantánea anterior, notifica a un canal cuando un umbral se activa.
- RAG contra datos de editores en vivo. Renderiza páginas de editores a texto limpio a través de
scrape_markdown, incrusta en la memoria SQLite + embeddings de ZeroClaw, recupera para futuros turnos. - Eludir Cloudflare para objetivos de investigación benignos. La habilidad Web Unlocker maneja automáticamente las páginas Turnstile y Challenge; el agente solo ve una carga útil limpia en Markdown.
En Scrapeless, solo accedemos a datos públicamente disponibles cumpliendo estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de esta publicación es solo para fines de demostración.
Por Qué Scrapeless
Scrapeless es un navegador en la nube anti-detección más una API de scraping universal más una API SERP más un LLM Chat Scraper, todo detrás de una clave API. Para ZeroClaw específicamente, ofrece:
- Un servidor MCP nativo — sin instalación de SDK, sin código de adaptador. El bloque MCP en
~/.zeroclaw/config.tomles toda la integración. - Renderización de JavaScript del lado de la nube para que SPAs, feeds de desplazamiento infinito y paneles cargados de manera diferida sean objetivos de primer nivel para las herramientas
browser_*yscrape_markdown. - Proxies residenciales en más de 195 países para que las consultas geobound devuelvan los listados que vería un usuario local.
- Impresión digital anti-detección en cada sesión — UA, zona horaria, idioma, resolución de pantalla, WebGL, lienzo aleatorizado por sesión.
- Resolución automática de CAPTCHA para reCAPTCHA, Cloudflare Turnstile y Cloudflare Challenge a través de la superficie de Web Unlocker.
- Una única superficie de gestión — una clave API, un panel, créditos de tiempo en ejecución gratuitos en el plan de nueva cuenta.
Obtén la clave API en el plan gratuito en app.scrapeless.com. La superficie completa de la herramienta MCP está documentada en github.com/scrapeless-ai/scrapeless-mcp-server; la superficie de la API en docs.scrapeless.com.
Requisitos Previos
- Un host tipo UNIX. Linux, macOS o WSL2 en Windows. ZeroClaw publica builds para Windows, pero el script de instalación y los scripts de habilidad asumen un shell POSIX — el camino más suave es Linux / macOS / WSL2.
- Node.js 18 o más reciente para el transporte stdio de MCP (
npx -y scrapeless-mcp-server). - Python 3.10 o más reciente para las habilidades de OpenClaw (se envían como scripts de Python en
scripts/). - Toolchain de Rust si se instala desde fuente; la ruta del binario precompilado no necesita nada extra.
- Una cuenta Scrapeless y clave API — regístrate en app.scrapeless.com y copia la clave de Configuración → Gestión de Clave API.
- Una clave de proveedor LLM — Anthropic, OpenAI, Ollama o cualquier punto final compatible con OpenAI. El asistente de incorporación de ZeroClaw lo conecta.
gitpara clonar los repositorios de habilidades.jqes opcional — útil al canalizar salida de CLI, no requerido para el camino de MCP.
Instalar ZeroClaw
La configuración completa son dos sub-pasos.
1. Ejecuta el instalador
bash
curl -fsSL https://raw.githubusercontent.com/zeroclaw-labs/zeroclaw/master/install.sh | bash
El instalador pregunta si debe buscar un binario preconstruido (~segundos) o construir desde la fuente (más lento, personalizable). Ambos terminan de la misma manera: zeroclaw onboard se inicia automáticamente. Para omitir el asistente al final, pasa --skip-onboard y ejecuta zeroclaw onboard más tarde.
Verifica que el binario esté en la ruta:
bash
zeroclaw --version
La salida debería parecerse a zeroclaw 0.7.5 o más reciente.
2. Completa el asistente de incorporación
bash
zeroclaw onboard
El asistente guía a través de la selección de proveedor, cableado de canal, modo de autonomía y personalización. Para esta integración, importan dos configuraciones:
- Proveedor — elige cualquiera de los proveedores LLM que ya esté configurado (OpenAI, Anthropic, Ollama, un gateway compatible con OpenAI). Pega la clave API cuando se te solicite.
- Autonomía —
supervisadoes el valor predeterminado seguro; el agente solicitará confirmación antes de invocar herramientas de riesgo medio. Las herramientas de MCP cuentan como riesgo medio por defecto. Para un entorno de desarrollo donde la solicitud sea problemática, el asistente también expone el modoyolo, que el operador debe activar solo en una máquina de confianza.
Confirma que el entorno de ejecución está activo iniciando un chat:
bash
zeroclaw agent
Un "¡Hola!" debería devolver una finalización normal. Si lo hace, el entorno de ejecución está sano y el siguiente paso es conectar el servidor MCP.
Conectar ZeroClaw al Servidor MCP de Scrapeless
1. Prueba inicial del servidor MCP fuera de ZeroClaw
Antes de agregar el bloque MCP a config.toml, confirma que el servidor se inicie de forma independiente. ZeroClaw carga los servidores MCP de manera diferida al iniciar el agente, por lo que una configuración rota solo aparece la primera vez que se ejecuta el agente; es mejor capturarlo ahora:
bash
SCRAPELESS_KEY="<TU_CLAVE_SCRAPELESS>" npx -y scrapeless-mcp-server
En la primera ejecución, npx descarga scrapeless-mcp-server del registro y el servidor se inicia a través de stdio. El proceso se mantiene adjunto; presiona Ctrl-C para liberarlo. Si imprimió un cartel de inicio y está esperando solicitudes MCP, las credenciales y el paquete funcionan.
Obtén tu clave API en el plan gratuito: app.scrapeless.com
2. Agregar el bloque MCP a ~/.zeroclaw/config.toml
ZeroClaw lee la configuración del servidor MCP desde un bloque [mcp] en la configuración global. Agrega (o fusiona) lo siguiente:
toml
# ~/.zeroclaw/config.toml
[mcp]
enabled = true
deferred_loading = true
servers = [
{ name = "scrapeless", command = "npx", transport = "stdio", args = ["-y", "scrapeless-mcp-server"], env = { SCRAPELESS_KEY = "<TU_CLAVE_SCRAPELESS>" }, headers = {} }
]
Notas:
-
enabled = trueactiva el subsistema MCP. Las versiones recientes de ZeroClaw lo tienen desactivado por defecto. -
deferred_loading = truemantiene rápido el inicio del demonio; ZeroClaw creanpxsolo cuando el agente realmente inicia una sesión. -
env.SCRAPELESS_KEYes la superficie de autenticación: la misma clave que se utilizó en la prueba inicial del paso 1. -
Para el transporte HTTP alojado en lugar de stdio, intercambia la entrada por:
toml{ name = "scrapeless", transport = "http", url = "https://api.scrapeless.com/mcp", headers = { "x-api-token" = "<TU_CLAVE_SCRAPELESS>" } }La pila de cliente MCP de ZeroClaw admite tres valores de transporte:
stdio,httpysse, con validación que imponecommand/argspara stdio yurl/headerspara transportes remotos (según el problema #1380 de ZeroClaw). El transporte HTTP es el valor predeterminado correcto cuando ZeroClaw se ejecuta en un host remoto (un VPS o un contenedor) y el operador no quiere quenpxse ejecute allí.
3. Verifica la conexión desde dentro de ZeroClaw
Reinicia la sesión del agente para que recoja la nueva configuración y cargue de forma diferida el servidor MCP:
bash
zeroclaw agent
En un chat nuevo, pregunta:
¿Qué herramientas MCP de Scrapeless tienes disponibles?
El agente debería enumerar las 20 herramientas mencionadas anteriormente — google_search, google_trends, el conjunto browser_*, scrape_html, scrape_markdown, scrape_screenshot. Si la respuesta dice cero herramientas, la causa más común es enabled = false en [mcp]; la segunda causa más común es un error tipográfico en SCRAPELESS_KEY.
Instalar las Habilidades Scrapeless OpenClaw
El servidor MCP son las herramientas. Las habilidades son el libro de jugadas. Ambas habilidades de Scrapeless funcionan con ZeroClaw porque el entorno de ejecución admite directamente el formato de habilidad OpenClaw.
1. Permitir scripts de habilidades en ~/.zeroclaw/config.toml
Ambas habilidades de Scrapeless incluyen directorios scripts/ que el agente ejecuta. Establece allow_scripts = true en la sección [skills]:
toml
# ~/.zeroclaw/config.toml
[skills]
allow_scripts = true
allow_scripts está desactivado por defecto por seguridad. Activarlo otorga a ZeroClaw permiso para ejecutar scripts empaquetados con habilidades bajo la política de autonomía ya en vigor; las invocaciones de scripts de riesgo medio aún solicitan aprobación en modo supervisado.
2. Clonar los repositorios de habilidades
bash
mkdir -p ~/.zeroclaw/workspace/skills
git clone https://github.com/scrapeless-ai/webunlocker-skill ~/.zeroclaw/workspace/skills/webunlocker-skill
git clone https://github.com/scrapeless-ai/llm-chat-scraper-skill ~/.zeroclaw/workspace/skills/llm-chat-scraper-skill
3. Instalar las dependencias de Python y el token API
La habilidad Web Unlocker incluye un requirements.txt:
bash
cd ~/.zeroclaw/workspace/skills/webunlocker-skill
pip install -r requirements.txt
cp .env.example .env
# Luego edita .env y establece X_API_TOKEN=<TU_CLAVE_SCRAPELESS>
Repite para la habilidad LLM Chat Scraper si está dentro del alcance del agente.
4. Verifica que las habilidades sean visibles para ZeroClaw
bash
zeroclaw skills list
La salida debe incluir webunlocker-skill y llm-chat-scraper-skill. Si faltan, la causa más común es que la clonación se realizó en ~/.zeroclaw/skills/ en lugar de ~/.zeroclaw/workspace/skills/ — esta última es la ruta que vigila el tiempo de ejecución.
ZeroClaw + Scrapeless en Acción
Un ejemplo práctico realista: un informe diario de inteligencia competitiva sobre un tema que el operador sigue. El agente localiza fuentes frescas, extrae el contenido y produce un resumen estructurado, entregado al canal al que el agente está vinculado.
En zeroclaw agent, pega:
Construye un informe de inteligencia competitiva sobre "marcos de agentes AI" para los últimos 7 días.
1. Usa la herramienta MCP `google_search` de Scrapeless para encontrar las 5 noticias / entradas de blog más relevantes publicadas esta semana. Usa gl=us, hl=en.
2. Para cada URL de resultado, usa `scrape_markdown` para extraer el cuerpo del artículo. Descartar la navegación y los anuncios.
3. Usa `google_trends` para obtener la curva de interés de 7 días para la consulta "marcos de agentes AI" para tener la señal de demanda junto con la señal de oferta.
4. Produce un informe estructurado en Markdown con:
- Los 3 principales temas a través de los 5 artículos, cada uno con un resumen de una frase y la URL de origen.
- La dirección de la tendencia de 7 días (arriba / plano / abajo) y el día pico.
- Un llamado de "qué cambió esta semana" — cualquier novedad respecto al informe de la semana pasada.
Si una página objetivo bloquea el navegador en la nube, retrasa a `browser_create` +
`browser_goto` + `browser_get_text` solo para esa URL. No sustituyas contenido sintético; si no se puede recuperar una fuente, enumérala bajo "fuentes no recuperadas".
El plan del agente, en un inglés sencillo:
- Llama a
google_search(q="marcos de agentes AI", gl="us", hl="en")y elige los cinco resultados más frescos que parezcan fuentes primarias (omite las páginas agregadoras). - Itera las URLs a través de
scrape_markdowny mantiene el texto del cuerpo limpio en la memoria de trabajo. - Llama a
google_trends(q="marcos de agentes AI", date="now 7-d")para la curva de interés. - Resume en un informe de Markdown.
- Para cualquier URL que devuelva un intersticial anti-bot a través de
scrape_markdown, vuelve a intentar a través de la cadenabrowser_create→browser_goto→browser_get_text, que calienta una sesión del navegador en la nube y espera la hidratación antes de extraer.
Antes de cada llamada de herramienta, el modo de autonomía supervised de ZeroClaw solicita aprobación: Y para aprobación instantánea, A para recordar el permiso para futuras llamadas a herramientas en la misma sesión.
Para enviar el aviso sin ingresar al chat interactivo:
bash
zeroclaw agent --message "Construye un informe de inteligencia competitiva sobre marcos de agentes AI para los últimos 7 días..."
Para convertir esto en una ejecución programada en lugar de un aviso ad-hoc, registra un SOP en un cronograma y vincúlalo al adaptador de canal a través del cual el agente debería entregar el informe (Discord, Telegram, correo electrónico). Las herramientas MCP y la habilidad permanecen igual; solo cambia el desencadenante.
Lo Que Recibes de Vuelta
El informe regresa como una carga útil en Markdown a lo largo de las líneas del siguiente — capturado de una ejecución real del aviso anterior contra cinco resultados en vivo de SERP para "marcos de agentes AI 2026":
markdown
# Marcos de Agentes AI — Informe Semanal (semana del 12-May-2026)
## Temas (últimos 7 días)
1. **LangGraph es el estándar de producción consensuado.** Las tres comparaciones profundas publicadas esta semana (Towards AI, GuruSup, Alice Labs) clasifican a LangGraph como #1 para cargas de trabajo de producción. Las razones citadas convergen: ejecución de gráficos determinista, puntos de control nativos en la intervención humana y observabilidad de primera clase a través de LangSmith.
Fuente: https://pub.towardsai.net/top-ai-agent-frameworks-in-2026-a-production-ready-comparison-7ba5e39ad56d
2. **MCP está emergiendo como el estándar de integración de herramientas entre marcos.** El Protocolo de Contexto del Modelo de Anthropic — ahora regido por la Fundación Linux con OpenAI, Google, Microsoft, AWS y Salesforce en la lista de apoyadores — se menciona como el estándar de agente a herramienta en dos de las tres comparaciones.
Fuente: https://gurusup.com/blog/best-multi-agent-frameworks-2026
3. **La división AutoGen / AG2 es el gran desarrollo de 2025–2026.** Microsoft reescribió AutoGen como v0.4+ con una nueva API; la comunidad continuó la línea de v0.2 como AG2 (ag2.ai). Tanto Alice Labs como GuruSup destacan esto como un momento de "escoger deliberadamente" para los equipos que evalúan marcos de debate de múltiples agentes.
Fuente: https://alicelabs.ai/en/insights/best-ai-agent-frameworks-2026
## Señal de demanda
- Tendencia de 7 días: no disponible (google_trends devolvió un error transitorio en este run — intenta de nuevo en el próximo cronograma)
## Qué cambió esta semana
- Alice Labs agregó Claude Agent SDK como un nuevo participante en el #2, desplazando a CrewAI al #3 — la primera clasificación que hemos visto elevar el SDK oficial de Anthropic por encima de los generalistas de múltiples agentes.
- El estado del fork de AutoGen / AG2 se mencionó en 2 de 3 artículos, subiendo desde 0 la semana pasada.
## Fuentes no recuperadas
- (ninguna — alicelabs.ai SPA requirió la ruta de retroceso browser_*; recuperada)
La estructura sigue el aviso; los valores son lo que la cadena de herramientas verificada devolvió realmente el día en que se ejecutó el informe. Algunas observaciones honestas basadas en la ejecución en vivo:
scrape_markdownlimpia la mayoría de las páginas de editores correctamente. Hacia AI y GuruSup devolvieron cuerpos de Markdown limpios en el primer intento. Las aplicaciones web altamente renderizadas con JS (alicelabs.ai es una SPA de Webflow / Vite en esta ejecución) devolvieron la estructura HTML renderizada en su lugar; el agente se recuperó a través de la cadenabrowser_create→browser_goto→browser_get_text, que devolvió una instantánea de página completamente estructurada que incluía la lista clasificada, los puntos clave, las preguntas frecuentes y la marca de tiempo de actualización de mayo de 2026.google_trendses interés, no volumen — y a veces es transitorio. En la ejecución de verificación, la llamada de Tendencias en upstream devolvió un error decarga fallida; el aviso maneja esto reportando la brecha en lugar de sustituir datos sintéticos. La postura de reintento adecuada es la próxima ejecución programada, no un reintento inmediato dentro del mismo turno del agente.- La frescura por fuente varía. Algunos editores rellenan las marcas de tiempo cuando actualizan artículos; si "frescura" importa absolutamente, verifica la fecha de publicación en el cuerpo del artículo, no en el fragmento de SERP. (La página de Alice Labs en esta ejecución muestra tanto una fecha de publicación de abril de 2026 como una fecha de actualización de mayo de 2026 en el cuerpo).
- Los intersticiales anti-bot y las estructuras SPA son normales, no excepciones. Presupuesta para el retroceso
browser_*en cualquier aviso que toque sitios comerciales a gran escala; la ejecución de verificación encontró uno en tres URL y la recuperación fue sin incidentes.
Conclusión: un agente que lee la web en vivo
La integración de ZeroClaw + Scrapeless se reduce a cuatro movimientos que el operador ejecuta una vez: instalar ZeroClaw, registrar el servidor MCP de Scrapeless en ~/.zeroclaw/config.toml, colocar las habilidades de OpenClaw en ~/.zeroclaw/workspace/skills/, y verificar con zeroclaw skills list y un aviso de listado de herramientas en zeroclaw agent. Después de eso, cada turno del agente que toca la web — investigación, monitoreo, generación de leads, ingestión de RAG, seguimiento de visibilidad de búsqueda AI — pasa por el navegador en la nube, los proxies residenciales y la API de SERP detrás de una clave API.
Para el mismo primitivo de Scrapeless en otros clientes, el tutorial del servidor MCP cubre Claude Desktop / Cursor / Codex CLI, el post de integración de Hermes cubre CDP directo, y el post de integración de LangChain cubre agentes de Python. El patrón en todos ellos es el mismo: fija una región residencial, mantén la sesión caliente en flujos de varios pasos, trata los intersticiales anti-bot como un caso de reintento en lugar de una excepción, y deja que el agente componga google_search → scrape_markdown → browser_* en lo que el aviso realmente pida.
¿Listo para construir tu canal de datos potenciado por IA?
Únete a nuestra comunidad para reclamar un plan gratuito y conectarte con desarrolladores que construyen canales de agentes locales sobre Scrapeless: Discord · Telegram.
Regístrate en app.scrapeless.com para obtener un tiempo de ejecución MCP gratuito y adapta los patrones anteriores a los flujos de trabajo que el agente de ZeroClaw ya ejecuta.
FAQ
Q1. ¿Funciona el servidor MCP de Scrapeless en Windows, o solo en Linux / macOS?
El servidor MCP es un paquete de Node.js — se ejecuta donde sea que corra Node 18+, incluyendo Windows. El instalador de ZeroClaw asume un shell POSIX, por lo que el camino más fluido en Windows es WSL2. La variante de transporte HTTP (dirigiendo ZeroClaw a https://api.scrapeless.com/mcp) elimina por completo la dependencia local de npx y es la opción más fácil para implementaciones de ZeroClaw alojadas.
Q2. ¿Stdio o HTTP transmitible — cuál es el transporte por defecto correcto?
Para un workstation que ejecuta ZeroClaw localmente, stdio. El ciclo de vida es simple: ZeroClaw genera npx -y scrapeless-mcp-server al iniciar el agente, lo detiene al detener el agente. Para ZeroClaw en un VPS o en un contenedor, HTTP. El endpoint alojado por Scrapeless elimina la necesidad de empaquetar npx y Node en la imagen de tiempo de ejecución.
Q3. ¿Es legal raspar datos web públicos?
Generalmente sí, cuando los datos son públicamente visibles y el flujo de trabajo respeta los términos de servicio de cada sitio y las jurisdicciones aplicables. La postura legal varía según el país, el sitio y el caso de uso (investigación, reventa comercial, datos de entrenamiento). Revisa los Términos de Servicio del sitio objetivo antes de escalar un flujo de trabajo contra él, y consulta a un abogado para casos de uso de alto volumen o regulados.
Q4. ¿Se superponen el servidor MCP y las habilidades de OpenClaw?
Son complementarios. El servidor MCP le proporciona al agente herramientas — superficies concretas y llamables (google_search, scrape_markdown, browser_*). Las habilidades le dan al agente conocimiento — cómo se comporta la API de Scraping Universal Scraping, cuándo recurrir a la renderización JS, qué tipo de respuesta solicitar, cómo encadenar la resolución de CAPTCHA con la selección de país. Instalados juntos, el agente tiene ambos.
P5. ¿Qué sucede cuando una página objetivo devuelve un intersticial anti-bot?
Para scrape_markdown contra la mayoría de las páginas, el navegador en la nube resuelve el desafío de manera transparente. Para las páginas que aún devuelven un intersticial, la solución estándar es browser_create → browser_goto → browser_wait_for (un selector conocido posterior al desafío) → browser_get_text. Presupuesto para este retroceso en cualquier solicitud que toque sitios comerciales; el ejemplo de solicitud anterior muestra la estructura.
P6. ¿Cómo interactúa el modo de autonomía de ZeroClaw con las llamadas a herramientas de MCP?
Bajo supervised (el predeterminado), el agente pregunta antes de invocar cada herramienta de MCP por primera vez. El operador puede otorgar aprobación de una sola vez (Y) o aprobación de recordar-esta-herramienta (A). Bajo yolo, el agente invoca herramientas sin preguntar; ese modo es apropiado solo en una caja de desarrollo confiable.
P7. ¿Puede el agente componer llamadas a Scrapeless en flujos de varios pasos en una sola vuelta?
Sí — ese es el punto de diseño. Un único turno del agente típicamente encadena google_search (localizar), scrape_markdown (extraer de la URL canónica), y browser_* (recaer para páginas interactivas o protegidas por anti-bot). ZeroClaw transmite las llamadas a herramientas intermedias en el mismo contexto de conversación.
P8. ¿Dónde vive la clave de la API de Scrapeless?
Para la ruta MCP, en env.SCRAPELESS_KEY dentro de ~/.zeroclaw/config.toml (o en el encabezado x-api-token de HTTP transmitible). Para la ruta de habilidad, en el archivo .env dentro de cada directorio de habilidad como X_API_TOKEN. Las dos rutas son independientes; rotar la clave significa actualizar ambas ubicaciones.
P9. ¿Puede un SOP de ZeroClaw ejecutar la misma solicitud en un horario?
Sí. Registre un SOP con un desencadenador cron que ejecute la misma solicitud que el operador pegaría en zeroclaw agent --message "...". Vincule el SOP a un adaptador de canal (Discord, Telegram, correo electrónico) y el resumen se entrega automáticamente. Los SOP en modo supervised aún restringen las llamadas a herramientas de riesgo medio detrás de la aprobación; para ejecuciones programadas no atendidas, el SOP necesita configurarse bajo un modo de autonomía más permisivo o con permisos de herramienta preotorgados.
P10. ¿Qué pasa con los otros productos de Scrapeless — Scraping Browser, Universal Scraping API, SERP API?
El servidor MCP agrupa las primitivas de navegador en la nube, SERP y scraping más comunes en una única superficie de MCP. Para flujos de trabajo que necesitan el conjunto completo de primitivas del Scraping Browser directamente (CDP, huellas digitales personalizadas, persistencia de sesión a granularidad de session_ttl), conecte el punto final del Scraping Browser CDP en la herramienta browser incorporada de ZeroClaw. Los dos enfoques se componen; no entran en conflicto.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



