Escritor de Blog Potenciado por IA utilizando Scrapeless y la Base de Datos Pinecone
Senior Web Scraping Engineer
Debes ser un creador de contenido experimentado. Como equipo de una startup, el contenido actualizado a diario del producto es demasiado rico. No solo necesitas elaborar una gran cantidad de blogs de drenaje para aumentar rápidamente el tráfico del sitio web, sino que también necesitas preparar de 2 a 3 blogs por semana que estén sujetos a la promoción de actualizaciones del producto.
En comparación con gastar mucho dinero para aumentar el presupuesto de puja de anuncios pagos a cambio de posiciones de visualización más altas y más exposición, el marketing de contenidos sigue teniendo ventajas irremplazables: amplio rango de contenido, bajo costo de prueba para adquisición de clientes, alta eficiencia de producción, inversión de energía relativamente baja, rica base de conocimiento de experiencia en el campo, etc.
Sin embargo, ¿cuáles son los resultados de una gran cantidad de marketing de contenido?
Desafortunadamente, muchos artículos están profundamente enterrados en la décima página de búsqueda de Google.
¿Hay alguna buena manera de evitar el fuerte impacto de los artículos de "bajo tráfico" tanto como sea posible? ¿Alguna vez has querido crear un escritor SEO autoupdate que clone el conocimiento de los blogs de mejor rendimiento y genere contenido fresco a gran escala?
En esta guía, te guiaremos a través de la construcción de un flujo de trabajo totalmente automatizado para la generación de contenido SEO utilizando n8n, Scrapeless, Gemini (puedes elegir otros como Claude/OpenRouter si lo deseas) y Pinecone. Este flujo de trabajo utiliza un sistema de Generación Aumentada por Recuperación (RAG) para recoger, almacenar y generar contenido basado en blogs de alto tráfico existentes.
Tutorial de YouTube: https://www.youtube.com/watch?v=MmitAOjyrT4
¿Qué hace este flujo de trabajo?
Este flujo de trabajo implicará cuatro pasos:
- Parte 1: Llamar a Crawl de Scrapeless para rastrear todas las subpáginas del sitio web objetivo y usar Scrape para analizar profundamente todo el contenido de cada página.
- Parte 2: Almacenar los datos rastreados en Pinecone Vector Store.
- Parte 3: Usar el nodo Búsqueda en Google de Scrapeless para analizar completamente el valor del tema o las palabras clave objetivo.
- Parte 4: Transmitir instrucciones a Gemini, integrar contenido contextual de la base de datos preparada a través de RAG y producir blogs objetivo o responder preguntas.

Si no has oído hablar de Scrapeless, es una empresa de infraestructura líder enfocada en potenciar agentes de IA, flujos de trabajo de automatización y rastreo web. Scrapeless proporciona los bloques de construcción esenciales que permiten a desarrolladores y empresas crear sistemas inteligentes y autónomos de manera eficiente.
En su núcleo, Scrapeless ofrece herramientas a nivel de navegador y APIs basadas en protocolos, como navegador en la nube sin cabeza, API de SERP profunda y APIs de rastreo universal, que sirven como una base unificada y modular para agentes de IA y plataformas de automatización.
Realmente está construido para aplicaciones de IA porque los modelos de IA no siempre están actualizados con muchas cosas, ya sean eventos actuales o nuevas tecnologías.
Además de n8n, también se puede llamar a través de API, y hay nodos en plataformas principales como Make:
También puedes usarlo directamente en el sitio web oficial.
Para usar Scrapeless en n8n:
- Ve a Configuraciones > Nodos de la comunidad
- Busca n8n-nodes-scrapeless e instálalo.
Necesitamos instalar primero el nodo de la comunidad de Scrapeless en n8n:


Conexión de Credenciales
Clave API de Scrapeless
En este tutorial, utilizaremos el servicio de Scrapeless. Asegúrate de haberte registrado y obtener la clave API.
- Regístrate en el sitio web de Scrapeless para obtener tu clave API y reclamar la prueba gratuita.
- Luego, puedes abrir el nodo de Scrapeless, pegar tu clave API en la sección de credenciales y conectarlo.

Índice y Clave API de Pinecone
Después de rastrear los datos, integraremos y procesaremos toda la información y recopilaremos todos los datos en la base de datos de Pinecone. Necesitamos preparar la clave API de Pinecone y el índice con anticipación.
Crear Clave API
Después de iniciar sesión, haz clic en Claves API → Haz clic en Crear clave API → Completa el nombre de la clave API → Crear clave. Ahora, puedes configurarlo en las credenciales de n8n.
⚠️ Después de completar la creación, copia y guarda tu clave API. Por razones de seguridad de datos, Pinecone ya no mostrará la clave API creada.

Crear Índice
Clic en Índice e ingresa a la página de creación. Establece el nombre del índice → Selecciona modelo para Configuración → Establece la Dimensión adecuada → Crear índice.
2 configuraciones de dimensión comunes:
- Google Gemini Embedding-001 → 768 dimensiones
- OpenAI's text-embedding-3-small → 1536 dimensiones

Fase 1: Raspar y rastrear sitios web para la Base de Conocimiento

La primera etapa es agregar directamente todo el contenido del blog. Rastrear contenido de un área grande permite a nuestro Agente de IA obtener fuentes de datos de todos los campos, asegurando así la calidad de los artículos finales.
- El nodo de Scrapeless rastrea la página del artículo y recopila todas las URL de las publicaciones del blog.
- Luego recorre cada URL, raspa el contenido del blog y organiza los datos.
- Cada publicación del blog se incrusta usando tu modelo de IA y se almacena en Pinecone.
- En nuestro caso, raspamos 25 publicaciones del blog en solo unos minutos, ¡sin mover un dedo!
Nodo de raspeo de Scrapeless
Este nodo se utiliza para rastrear todo el contenido del sitio web de blogs objetivo, incluyendo metadatos, contenido de subpáginas y exportarlo en formato Markdown. Este es un rastreo de contenido a gran escala que no podemos lograr rápidamente a través de codificación manual.
Configuración:
- Conecta tu clave API de Scrapeless
- Recurso:
Rastreador - Operación:
Rastrear - Ingresa tu sitio web objetivo para raspar. Aquí usamos https://www.scrapeless.com/es/blog como referencia.

Nodo de Código
Después de obtener los datos del blog, necesitamos analizar los datos y extraer la información estructurada que necesitamos de ellos.

Lo siguiente es el código que utilicé. Puedes referirte a él directamente:
JavaScript
return items.map(item => {
const md = $input.first().json['0'].markdown;
if (typeof md !== 'string') {
console.warn('El contenido Markdown no es una cadena:', md);
return {
json: {
title: '',
mainContent: '',
extractedLinks: [],
error: 'El contenido Markdown no es una cadena'
}
};
}
const articleTitleMatch = md.match(/^#\s*(.*)/m);
const title = articleTitleMatch ? articleTitleMatch[1].trim() : 'No se encontró título';
let mainContent = md.replace(/^#\s*.*(\r?\n)+/, '').trim();
const extractedLinks = [];
const linkRegex = /\[([^\]]+)\]\((https?:\/\/[^\s#)]+)\)/g;
let match;
while ((match = linkRegex.exec(mainContent))) {
extractedLinks.push({
text: match[1].trim(),
url: match[2].trim(),
});
}
return {
json: {
title,
mainContent,
extractedLinks,
},
};
});
Nodo: Separar
El nodo Separar puede ayudarnos a integrar los datos limpios y extraer las URL y el contenido de texto que necesitamos.

Bucle sobre Elementos + Raspeo de Scrapeless

Bucle sobre Elementos
Usa el nodo Bucle sobre Tiempo con el Raspeo de Scrapeless para realizar repetidamente tareas de rastreo, y analizar en profundidad todos los elementos obtenidos anteriormente.

Raspeo de Scrapeless
El nodo de raspeo se utiliza para rastrear todo el contenido contenido en la URL obtenida previamente. De esta manera, cada URL puede ser analizada en profundidad. Se devuelve el formato markdown y se integran los metadatos y otra información.

Fase 2. Almacenar datos en Pinecone
Hemos extraído con éxito todo el contenido de la página de blog de Scrapeless. Ahora necesitamos acceder a la Tienda de Vectores Pinecone para almacenar esta información para poder usarla más tarde.

Nodo: Agregar
Para almacenar datos en la base de conocimiento de manera conveniente, necesitamos usar el nodo Agregar para integrar todo el contenido.
- Agregar:
Todos los datos de los elementos (en una sola lista) - Poner salida en campo:
data - Incluir:
Todos los campos

Nodo: Convertir a Archivo
¡Genial! Todos los datos se han integrado con éxito. Ahora necesitamos convertir los datos adquiridos a un formato de texto que pueda ser leído directamente por Pinecone. Para hacer esto, solo agrega una Convertir a Archivo.
Nodo: Almacén de vectores de Pinecone
Ahora necesitamos configurar la base de conocimientos. Los nodos utilizados son:
Almacén de Vectores de PineconeGoogle GeminiCargador de Datos PredeterminadoDivisor de Texto Recursivo de Caracteres
Los cuatro nodos anteriores integrarán y rastrearán recursivamente los datos que hemos obtenido. Luego, todos se integran en la base de conocimientos de Pinecone.
Fase 3. Análisis SERP usando IA
Para asegurarte de que estás escribiendo contenido que clasifique, realizamos un análisis SERP en vivo:
- Usa el Scrapeless Deep SerpApi para obtener resultados de búsqueda para tu palabra clave elegida
- Ingresa tanto la palabra clave como la intención de búsqueda (por ejemplo, Raspado, tendencias de Google, API)
- Los resultados son analizados por un LLM y resumidos en un informe HTML
Nodo: Editar Campos
¡La base de conocimientos está lista! Ahora es el momento de determinar nuestras palabras clave objetivo. Completa las palabras clave objetivo en el cuadro de contenido y agrega la intención.
Nodo: Búsqueda de Google
El nodo de Búsqueda de Google llama al Deep SerpApi de Scrapeless para recuperar palabras clave objetivo.
Nodo: Cadena LLM
Construir una Cadena LLM con Gemini puede ayudarnos a analizar los datos obtenidos en los pasos anteriores y explicar al LLM la entrada de referencia y la intención que necesitamos usar para que el LLM pueda generar comentarios que satisfagan mejor las necesidades.
Nodo: Markdown
Dado que LLM generalmente exporta en formato Markdown, como usuarios no podemos obtener directamente los datos que más necesitamos con claridad, así que agrega un nodo de Markdown para convertir los resultados devueltos por el LLM en HTML.
Nodo: HTML
Ahora necesitamos usar el nodo HTML para estandarizar los resultados: utiliza el formato de Blog/Informe para mostrar intuitivamente el contenido relevante.
- Operación:
Generar Plantilla HTML
El siguiente código es necesario:
XML
<!DOCTYPE html>
<html lang="es">
<head>
<meta charset="UTF-8" />
<title>Resumen del Informe</title>
<link href="https://fonts.googleapis.com/css2?family=Inter:wght@400;600;700&display=swap" rel="stylesheet">
<style>
body {
margin: 0;
padding: 0;
font-family: 'Inter', sans-serif;
background: #f4f6f8;
display: flex;
align-items: center;
justify-content: center;
min-height: 100vh;
}
.container {
background-color: #ffffff;
max-width: 600px;
width: 90%;
padding: 32px;
border-radius: 16px;
box-shadow: 0 10px 30px rgba(0, 0, 0, 0.1);
text-align: center;
}
h1 {
color: #ff6d5a;
font-size: 28px;
font-weight: 700;
margin-bottom: 12px;
}
h2 {
color: #606770;
font-size: 20px;
font-weight: 600;
margin-bottom: 24px;
}
.content {
color: #333;
font-size: 16px;
line-height: 1.6;
white-space: pre-wrap;
}
@media (max-width: 480px) {
.container {
padding: 20px;
}
h1 {
font-size: 24px;
}
h2 {
font-size: 18px;
}
}
</style>
</head>
<body>
<div class="container">
<h1>Informe de Datos</h1>
<h2>Procesado a través de Automatización</h2>
<div class="content">{{ $json.data }}</div>
</div>
<script>
console.log("¡Hola Mundo!");
</script>
</body>
</html>
Este informe incluye:
- Palabras clave de alto rango y frases de cola larga
- Tendencias de intención de búsqueda del usuario
- Títulos de blog y ángulos sugeridos
- Agrupación de palabras clave
Fase 4. Generación del Blog con IA + RAG
Ahora que has recopilado y almacenado el conocimiento y investigado tus palabras clave, es momento de generar tu blog.
- Construye un aviso utilizando información del informe SERP
- Llama a un agente de IA (por ejemplo, Claude, Gemini o OpenRouter)
- El modelo recupera el contexto relevante de Pinecone y escribe un post completo del blog.
A diferencia de la salida AI genérica, el resultado aquí incluye ideas, frases y un tono específicos del contenido original de Scrapeless, gracias a RAG.
Los Pensamientos Finales
Este motor de contenido SEO de extremo a extremo demuestra el poder de n8n + Scrapeless + Base de Datos Vectorial + LLMs.
Puedes:
- Reemplazar la Página de Blog de Scrapeless por cualquier otro blog
- Cambiar Pinecone por otras tiendas vectoriales
- Usar OpenAI, Claude o Gemini como tu motor de escritura
- Construir tuberías de publicación personalizadas (por ejemplo, auto-publicar en CMS o Notion)
👉 Comienza hoy instalando el nodo de la comunidad de Scrapeless y empieza a generar blogs a gran escala — no se requiere programación.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



