¿Cómo raspar datos en Make automáticamente?
Senior Web Scraping Engineer
Recientemente hemos lanzado una integración oficial en Make, ahora disponible como una aplicación pública. Este tutorial te mostrará cómo crear un flujo de trabajo automatizado poderoso que combina nuestra API de Búsqueda de Google con Web Unlocker para extraer datos de los resultados de búsqueda, procesarlos con Claude AI y enviarlos a un webhook.
Lo que Construiremos
En este tutorial, crearemos un flujo de trabajo que:
- Se activa automáticamente cada día utilizando la programación integrada
- Busca en Google consultas específicas usando la API de Búsqueda de Google de Scrapeless
- Procesa cada URL individualmente con Iterator
- Extrae contenido de cada URL con Scrapeless WebUnlocker
- Analiza el contenido con Anthropic Claude AI
- Envía los datos procesados a un webhook (Discord, Slack, base de datos, etc.)
Requisitos Previos
- Una cuenta en Make.com
- Una clave API de Scrapeless (obtén una en scrapeless.com)

- Una clave API de Anthropic Claude
- Un endpoint de webhook (webhook de Discord, Zapier, endpoint de base de datos, etc.)
- Comprensión básica de los flujos de trabajo de Make.com
Vista General del Flujo de Trabajo Completo
Tu flujo de trabajo final se verá así:
Búsqueda de Google de Scrapeless (con programación integrada) → Iterator → Scrapeless WebUnlocker → Anthropic Claude → Webhook HTTP

Paso 1: Añadiendo la Búsqueda de Google de Scrapeless con Programación Integrada
Comenzaremos añadiendo el módulo de Búsqueda de Google de Scrapeless con programación integrada.
- Crea un nuevo escenario en Make.com
- Haz clic en el botón "+" para añadir el primer módulo
- Busca "Scrapeless" en la biblioteca de módulos
- Selecciona Scrapeless y elige la acción Buscar en Google

Configurando la Búsqueda en Google con Programación

Configuración de Conexión:
- Crea una conexión ingresando tu clave API de Scrapeless
- Haz clic en "Agregar" y sigue la configuración de conexión
Parámetros de Búsqueda:
- Consulta de Búsqueda: Ingresa tu consulta objetivo (por ejemplo, "noticias de inteligencia artificial")
- Idioma:
en(inglés) - País:
US(Estados Unidos)

Configuración de Programación:

- Haz clic en el ícono de reloj en el módulo para abrir la programación
- Ejecutar escenario: Selecciona "A intervalos regulares"
- Minutos: Establece en
1440(para ejecución diaria) o tu intervalo preferido - Programación avanzada: Utiliza "Agregar elemento" para establecer horarios/días específicos si es necesario
Paso 2: Procesando Resultados con Iterator
La Búsqueda de Google devuelve múltiples URLs en una matriz. Usaremos Iterator para procesar cada resultado de forma individual.
- Agrega un módulo Iterator después de la Búsqueda en Google
- Configura el campo Array para procesar los resultados de búsqueda

Configuración de Iterator:
- Array:
{{1.result.organic_results}}
Esto creará un bucle que procesa cada resultado de búsqueda por separado, permitiendo una mejor gestión de errores y un procesamiento individual.
Paso 3: Añadiendo Scrapeless WebUnlocker
Ahora añadiremos el módulo WebUnlocker para extraer contenido de cada URL.
- Agrega otro módulo Scrapeless
- Selecciona la acción Extraer URL (WebUnlocker)
- Utiliza la misma conexión de Scrapeless

Configuración de WebUnlocker:
- Conexión: Usa tu conexión de Scrapeless existente
- URL Objetivo:
{{2.link}}(mapeado desde la salida de Iterator) - Renderizar Js: Sí
- Sin Cabeza: Sí
- País: Mundial
- Instrucciones de Js:
[{"wait":1000}](esperar a que se cargue la página) - Bloquear: Configura para bloquear recursos innecesarios para una extracción más rápida

Paso 4: Procesamiento AI con Anthropic Claude
Agrega Claude AI para analizar y resumir el contenido extraído.
- Agrega un módulo Anthropic Claude
- Selecciona la acción Hacer una Llamada API
- Crea una nueva conexión con tu clave API de Claude

Configuración de Claude:
- Conexión: Crear conexión con tu clave API de Anthropic
- Prompt: Configurar para analizar el contenido raspado
- Modelo: claude-3-sonnet-20240229 / claude-3-opus-20240229 o tu modelo preferido
- Max Tokens: 1000-4000 dependiendo de tus necesidades
URL
/v1/messages
Encabezado 1
Clave : Content-TypeValor : application/json
Encabezado 2
Clave : anthropic-versionValor : 2023-06-01
Ejemplo de solicitud copiar y pegar en el cuerpo:
{
"model": "claude-3-sonnet-20240229",
"max_tokens": 1000,
"messages": [
{
"role": "user",
"content": "Analiza este contenido web y proporciona un resumen en inglés con los puntos clave:\n\nTítulo: {{14.title}}\nURL: {{14.link}}\nDescripción: {{14.snippet}}\nContenido: {{13.content}}\n\nConsulta de búsqueda: {{1.result.search_information.query_displayed}}"
}
]
}
- No olvides cambiar el número
14por el número de tu módulo.

Paso 5: Integración del Webhook
Finalmente, envía los datos procesados a tu punto final de webhook.
- Agrega un módulo HTTP
- Configúralo para enviar una solicitud POST a tu webhook

Configuración HTTP:
- URL: Tu punto final de webhook (Discord, Slack, base de datos, etc.)
- Método: POST
- Encabezados:
Content-Type: application/json - Tipo de Cuerpo: Raw (JSON)
Ejemplo de Carga Útil del Webhook:
{
"embeds": [
{
"title": "{{14.title}}",
"description": "*{{15.body.content[0].text}}*",
"url": "{{14.link}}",
"color": 3447003,
"footer": {
"text": "Análisis completo"
}
}
]
}
Resultados en Ejecución

Referencia de Módulo y Flujo de Datos
Flujo de Datos a Través de Módulos:
- Módulo 1 (Búsqueda en Google Scrapeless): Devuelve
result.organic_results[] - Módulo 14 (Iterador): Procesa cada resultado, produce elementos individuales
- Módulo 13 (WebUnlocker): Raspa
{{14.link}}, devuelve contenido - Módulo 15 (Claude AI): Analiza
{{13.content}}, devuelve resumen - Módulo 16 (Webhook HTTP): Envía los datos estructurados finales
Mapeos Clave:
- Array del Iterador:
{{1.result.organic_results}} - URL del WebUnlocker:
{{14.link}} - Contenido de Claude:
{{13.content}} - Datos del Webhook: Combinación de todos los módulos anteriores
Probando Tu Flujo de Trabajo
- Ejecutar una vez para probar el escenario completo
- Verificar cada módulo:
- La búsqueda de Google devuelve resultados orgánicos
- El iterador procesa cada resultado individualmente
- WebUnlocker raspa contenido con éxito
- Claude proporciona un análisis significativo
- El webhook recibe datos estructurados
- Verificar la calidad de los datos en tu destino de webhook
- Comprobar la programación - asegurarte de que se ejecute en tus intervalos preferidos
Consejos Avanzados de Configuración
Manejo de Errores
- Agregar rutas de Manejo de Errores después de cada módulo
- Usar Filtros para omitir URLs no válidas o contenido vacío
- Configurar lógica de Reintento para fallos temporales
Beneficios de Este Flujo de Trabajo
- Totalmente Automatizado: Se ejecuta diariamente sin intervención manual
- Mejora con IA: El contenido se analiza y resume automáticamente
- Salida Flexible: El webhook puede integrarse con cualquier sistema
- Escalable: Procesa múltiples URLs de manera eficiente
- Control de Calidad: Múltiples pasos de filtrado y validación
- Notificaciones en Tiempo Real: Entrega inmediata a tu plataforma preferida
Casos de Uso
Perfecto para:
- Monitoreo de Contenido: Rastrear menciones de tu marca o competencia
- Agregación de Noticias: Resúmenes automáticos de noticias sobre temas específicos
- Investigación de Mercado: Monitorear tendencias y desarrollos en la industria
- Generación de Leads: Encontrar y analizar oportunidades comerciales potenciales
- Monitoreo de SEO: Rastrear cambios en resultados de búsqueda para palabras clave objetivo
- Automatización de Investigaciones: Recopilar y resumir contenido académico o de la industria
Conclusión
Este flujo de trabajo automatizado combina el poder de Google Search de Scrapeless y WebUnlocker con las capacidades de análisis de Claude AI, todo orquestado a través de la interfaz visual de Make. El resultado es un sistema de descubrimiento de contenido inteligente que funciona automáticamente y entrega datos enriquecidos y analizados directamente a tu plataforma preferida a través de webhook.
El flujo de trabajo se ejecutará en tu programación, descubriendo, raspando, analizando y entregando automáticamente información relevante del contenido sin intervención manual.
¡Es hora de construir tu primer Agente de IA en Make utilizando Scrapeless!
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



