Volver al blog

Cómo construir un agente de búsqueda de empleo automatizado con Scrapeless y Google Sheets

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

04-Jul-2025

Mantenerse al día con nuevas ofertas de trabajo es esencial para los buscadores de empleo, reclutadores y entusiastas de la tecnología. En lugar de verificar manualmente sitios web, puedes automatizar todo el proceso: raspando bolsas de trabajo a intervalos regulares y guardando los resultados en Google Sheets para un fácil seguimiento y compartición.

Esta guía te mostrará cómo construir un agente de búsqueda de empleo automatizado utilizando Scrapeless, n8n y Google Sheets. Crearás un flujo de trabajo que raspa ofertas de trabajo de la página de trabajos de Y Combinator cada 6 horas, extrae datos estructurados y los almacena en una hoja de cálculo.


Requisitos previos

Antes de comenzar, asegúrate de tener:

  • n8n: Una plataforma de automatización sin código (autoalojada o en la nube).
  • API de Scrapeless: Obtén tu clave API de Scrapeless.
    1. Inicia sesión en el Panel de Scrapeless.
    2. Luego haz clic en "Configuración" a la izquierda -> selecciona "Gestión de Claves API" -> haz clic en "Crear Clave API". Finalmente, haz clic en la Clave API que creaste para copiarla.
clave de api scrapeless
  • Cuenta de Google Sheets: Para guardar y visualizar los datos de trabajo.
  • Sitio web objetivo: Este ejemplo utiliza la página de trabajos de Y Combinator.

Cómo construir un agente de búsqueda de empleo automatizado con Scrapeless y Google Sheets

1. Activador programado: Ejecutar cada 6 horas

Tipo de nodo: Activador programado

Configuraciones:

  • Campo de intervalo: horas
  • Valor de intervalo: 6
Activador programado

Este nodo asegura que tu flujo de trabajo se ejecute automáticamente cada 6 horas sin intervención manual.


2. Rastreador Scrapeless: Raspar ofertas de trabajo

Tipo de nodo: Nodo Scrapeless

Configuraciones:

  • Recurso: crawler
  • Operación: crawl
  • URL: https://www.ycombinator.com/jobs
  • Limitar páginas de rastreo: 2
  • Credenciales: Tu clave API de Scrapeless
Nodo Scrapeless

Salida: Un arreglo de objetos que contiene datos ricos de trabajo en formato Markdown.


3. Extraer contenido Markdown

Tipo de nodo: Nodo de código JavaScript

Propósito: Extraer solo el campo markdown de los resultados de rastreo en bruto.

Copy
const raw = items[0].json;
const output = raw.map(obj => ({
  json: {
    markdown: obj.markdown,
  }
}));
return output;
Extraer contenido Markdown

4. Analizar Markdown: Extraer introducción y lista de trabajos

Tipo de nodo: Nodo de código JavaScript

Propósito: Dividir el markdown en una introducción y una lista estructurada de títulos de trabajo y enlaces.

Copy
return items.map(item => {
  const md = item.json.markdown;
  const splitRegex = /^#{1,3}\s*.+jobs added recently\s*$/im;
  const parts = md.split(splitRegex);
  const introSectionRaw = parts[0] || '';
  const jobsSectionRaw = parts.slice(1).join('') || '';
  const intro = introSectionRaw.replace(/^#+\s*/gm, '').trim();

  const jobs = [];
  const re = /\-\s*\[(?!\!)([^\]]+)\]\((https?:\/\/[^\)]+)\)/g;
  let match;
  while ((match = re.exec(jobsSectionRaw))) {
    jobs.push({
      title: match[1].trim(),
      link: match[2].trim(),
    });
  }

  return {
    json: {
      intro,
      jobs,
    },
  };
});
Nodo de código JavaScript

5. Aplanar trabajos para exportación

Tipo de nodo: Nodo de código JavaScript

Propósito: Convertir cada trabajo en una fila separada para facilitar la exportación.

Copy
const output = [];
items.forEach(item => {
  const intro = item.json.intro;
  const jobs = item.json.jobs || [];
  jobs.forEach(job => {
    output.push({
      json: {
        intro,
        jobTitle: job.title,
        jobLink: job.link,
      },
    });
  });
});
return output;
Nodo de código JavaScript

6. Añadir a Google Sheets

Tipo de nodo: Nodo de Google Sheets

Configuraciones:

  • Operación: append
  • URL del documento: También puedes seleccionar directamente el nombre de la hoja de Google que creaste (método recomendado)
  • Nombre de la hoja: Links (ID de pestaña: gid=0)
  • Mapeo de columnas:
    • title{{ $json.jobTitle }}
    • link{{ $json.jobLink }}
  • Convertir tipos: false
  • OAuth: Conectar tu cuenta de Google Sheets

Los datos finales se añaden automáticamente a tu hoja para su seguimiento o análisis adicional.

Añadir a Google Sheets

7. Ejemplo de resultado de salida

Ejemplo de resultado de salida

Diagrama del flujo de trabajo

Diagrama de flujo
Cómo construir un agente buscador de empleo automatizado con Scrapeless y Google Sheets

Cada nodo es modular y personalizable. Puedes cambiar el sitio web, la frecuencia de raspado o la lógica de formateo de datos según sea necesario.


Ideas de Personalización

  • Raspado de Más Sitios: Reemplaza la URL con LinkedIn, AngelList u otras bolsas de trabajo.
  • Agregar Notificaciones: Envía actualizaciones de trabajo a Slack, Discord o correo electrónico.
  • Mejorar con IA: Utiliza nodos GPT para generar resúmenes de trabajos o etiquetas de palabras clave.

Casos de Uso Empresariales Aplicables

Este agente buscador de empleo automatizado se puede aplicar a varios escenarios de negocios, incluyendo:

  • Agencias de Reclutamiento: Monitorear continuamente bolsas de trabajo de nicho y páginas de carrera de empresas para descubrir nuevas ofertas para su grupo de talentos.
  • Incubadoras y Aceleradoras de Startups: Rastrear actividades de contratación de empresas en su portafolio (como startups de Y Combinator) y mantenerse informado sobre la demanda del mercado.
  • Equipos de Recursos Humanos y Talento: Automatizar inteligencia competitiva al rastrear publicaciones de trabajo de empresas rivales o líderes de la industria.
  • Plataformas Agregadoras de Empleo: Agregar trabajos de múltiples fuentes y simplificar la publicación en sus propias plataformas sin raspado manual.
  • Comunidades de Trabajo Freelance y Remoto: Curar nuevas publicaciones de trabajo para boletines, foros comunitarios o bolsas de trabajo dirigidas a audiencias específicas.
  • Equipos de Investigación de Mercado: Analizar tendencias de contratación en diversas industrias para obtener información sobre el crecimiento del mercado, pilas tecnológicas en demanda o roles emergentes.

Este flujo de trabajo es especialmente útil para empresas que necesitan inteligencia de mercado laboral regular, estructurada y escalable, ahorrando innumerables horas de esfuerzo manual y asegurando la precisión de los datos.


Flujo de Trabajo del Agente Buscador de Empleo Automatizado

Flujo de Trabajo del Agente Buscador de Empleo Automatizado
n8n_workflow.json
• 37 KB
Scrapeless

Conclusión

Con Scrapeless, n8n y Google Sheets, puedes construir fácilmente un agente buscador de empleo completamente automatizado que raspas listas de trabajo, limpia los datos y los guarda en una hoja de cálculo. Esta configuración es flexible, rentable e ideal para individuos, reclutadores o equipos que desean monitorear trabajos en tiempo real sin esfuerzo manual.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar