Cómo construir un agente de búsqueda de empleo automatizado con Scrapeless y Google Sheets
Advanced Data Extraction Specialist
Mantenerse al día con nuevas ofertas de trabajo es esencial para los buscadores de empleo, reclutadores y entusiastas de la tecnología. En lugar de verificar manualmente sitios web, puedes automatizar todo el proceso: raspando bolsas de trabajo a intervalos regulares y guardando los resultados en Google Sheets para un fácil seguimiento y compartición.
Esta guía te mostrará cómo construir un agente de búsqueda de empleo automatizado utilizando Scrapeless, n8n y Google Sheets. Crearás un flujo de trabajo que raspa ofertas de trabajo de la página de trabajos de Y Combinator cada 6 horas, extrae datos estructurados y los almacena en una hoja de cálculo.
Requisitos previos
Antes de comenzar, asegúrate de tener:
- n8n: Una plataforma de automatización sin código (autoalojada o en la nube).
- API de Scrapeless: Obtén tu clave API de Scrapeless.
- Inicia sesión en el Panel de Scrapeless.
- Luego haz clic en "Configuración" a la izquierda -> selecciona "Gestión de Claves API" -> haz clic en "Crear Clave API". Finalmente, haz clic en la Clave API que creaste para copiarla.

- Cuenta de Google Sheets: Para guardar y visualizar los datos de trabajo.
- Sitio web objetivo: Este ejemplo utiliza la página de trabajos de Y Combinator.
Cómo construir un agente de búsqueda de empleo automatizado con Scrapeless y Google Sheets
1. Activador programado: Ejecutar cada 6 horas
Tipo de nodo: Activador programado
Configuraciones:
- Campo de intervalo:
horas - Valor de intervalo:
6

Este nodo asegura que tu flujo de trabajo se ejecute automáticamente cada 6 horas sin intervención manual.
2. Rastreador Scrapeless: Raspar ofertas de trabajo
Tipo de nodo: Nodo Scrapeless
Configuraciones:
- Recurso:
crawler - Operación:
crawl - URL:
https://www.ycombinator.com/jobs - Limitar páginas de rastreo: 2
- Credenciales:
Tu clave API de Scrapeless

Salida: Un arreglo de objetos que contiene datos ricos de trabajo en formato Markdown.
3. Extraer contenido Markdown
Tipo de nodo: Nodo de código JavaScript
Propósito: Extraer solo el campo markdown de los resultados de rastreo en bruto.
const raw = items[0].json;
const output = raw.map(obj => ({
json: {
markdown: obj.markdown,
}
}));
return output;

4. Analizar Markdown: Extraer introducción y lista de trabajos
Tipo de nodo: Nodo de código JavaScript
Propósito: Dividir el markdown en una introducción y una lista estructurada de títulos de trabajo y enlaces.
return items.map(item => {
const md = item.json.markdown;
const splitRegex = /^#{1,3}\s*.+jobs added recently\s*$/im;
const parts = md.split(splitRegex);
const introSectionRaw = parts[0] || '';
const jobsSectionRaw = parts.slice(1).join('') || '';
const intro = introSectionRaw.replace(/^#+\s*/gm, '').trim();
const jobs = [];
const re = /\-\s*\[(?!\!)([^\]]+)\]\((https?:\/\/[^\)]+)\)/g;
let match;
while ((match = re.exec(jobsSectionRaw))) {
jobs.push({
title: match[1].trim(),
link: match[2].trim(),
});
}
return {
json: {
intro,
jobs,
},
};
});

5. Aplanar trabajos para exportación
Tipo de nodo: Nodo de código JavaScript
Propósito: Convertir cada trabajo en una fila separada para facilitar la exportación.
const output = [];
items.forEach(item => {
const intro = item.json.intro;
const jobs = item.json.jobs || [];
jobs.forEach(job => {
output.push({
json: {
intro,
jobTitle: job.title,
jobLink: job.link,
},
});
});
});
return output;

6. Añadir a Google Sheets
Tipo de nodo: Nodo de Google Sheets
Configuraciones:
- Operación:
append - URL del documento: También puedes seleccionar directamente el nombre de la hoja de Google que creaste (método recomendado)
- Nombre de la hoja:
Links(ID de pestaña:gid=0) - Mapeo de columnas:
title←{{ $json.jobTitle }}link←{{ $json.jobLink }}
- Convertir tipos:
false - OAuth: Conectar tu cuenta de Google Sheets
Los datos finales se añaden automáticamente a tu hoja para su seguimiento o análisis adicional.

7. Ejemplo de resultado de salida

Diagrama del flujo de trabajo


Cada nodo es modular y personalizable. Puedes cambiar el sitio web, la frecuencia de raspado o la lógica de formateo de datos según sea necesario.
Ideas de Personalización
- Raspado de Más Sitios: Reemplaza la URL con LinkedIn, AngelList u otras bolsas de trabajo.
- Agregar Notificaciones: Envía actualizaciones de trabajo a Slack, Discord o correo electrónico.
- Mejorar con IA: Utiliza nodos GPT para generar resúmenes de trabajos o etiquetas de palabras clave.
Casos de Uso Empresariales Aplicables
Este agente buscador de empleo automatizado se puede aplicar a varios escenarios de negocios, incluyendo:
- Agencias de Reclutamiento: Monitorear continuamente bolsas de trabajo de nicho y páginas de carrera de empresas para descubrir nuevas ofertas para su grupo de talentos.
- Incubadoras y Aceleradoras de Startups: Rastrear actividades de contratación de empresas en su portafolio (como startups de Y Combinator) y mantenerse informado sobre la demanda del mercado.
- Equipos de Recursos Humanos y Talento: Automatizar inteligencia competitiva al rastrear publicaciones de trabajo de empresas rivales o líderes de la industria.
- Plataformas Agregadoras de Empleo: Agregar trabajos de múltiples fuentes y simplificar la publicación en sus propias plataformas sin raspado manual.
- Comunidades de Trabajo Freelance y Remoto: Curar nuevas publicaciones de trabajo para boletines, foros comunitarios o bolsas de trabajo dirigidas a audiencias específicas.
- Equipos de Investigación de Mercado: Analizar tendencias de contratación en diversas industrias para obtener información sobre el crecimiento del mercado, pilas tecnológicas en demanda o roles emergentes.
Este flujo de trabajo es especialmente útil para empresas que necesitan inteligencia de mercado laboral regular, estructurada y escalable, ahorrando innumerables horas de esfuerzo manual y asegurando la precisión de los datos.
Flujo de Trabajo del Agente Buscador de Empleo Automatizado
Conclusión
Con Scrapeless, n8n y Google Sheets, puedes construir fácilmente un agente buscador de empleo completamente automatizado que raspas listas de trabajo, limpia los datos y los guarda en una hoja de cálculo. Esta configuración es flexible, rentable e ideal para individuos, reclutadores o equipos que desean monitorear trabajos en tiempo real sin esfuerzo manual.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



