Volver al blog

Escritor de Blog Potenciado por IA utilizando Scrapeless y la Base de Datos Pinecone

Alex Johnson
Alex Johnson

Senior Web Scraping Engineer

17-Jul-2025

Debes ser un creador de contenido experimentado. Como equipo de una startup, el contenido actualizado a diario del producto es demasiado rico. No solo necesitas elaborar una gran cantidad de blogs de drenaje para aumentar rápidamente el tráfico del sitio web, sino que también necesitas preparar de 2 a 3 blogs por semana que estén sujetos a la promoción de actualizaciones del producto.

En comparación con gastar mucho dinero para aumentar el presupuesto de puja de anuncios pagos a cambio de posiciones de visualización más altas y más exposición, el marketing de contenidos sigue teniendo ventajas irremplazables: amplio rango de contenido, bajo costo de prueba para adquisición de clientes, alta eficiencia de producción, inversión de energía relativamente baja, rica base de conocimiento de experiencia en el campo, etc.

Sin embargo, ¿cuáles son los resultados de una gran cantidad de marketing de contenido?

Desafortunadamente, muchos artículos están profundamente enterrados en la décima página de búsqueda de Google.

¿Hay alguna buena manera de evitar el fuerte impacto de los artículos de "bajo tráfico" tanto como sea posible? ¿Alguna vez has querido crear un escritor SEO autoupdate que clone el conocimiento de los blogs de mejor rendimiento y genere contenido fresco a gran escala?

En esta guía, te guiaremos a través de la construcción de un flujo de trabajo totalmente automatizado para la generación de contenido SEO utilizando n8n, Scrapeless, Gemini (puedes elegir otros como Claude/OpenRouter si lo deseas) y Pinecone. Este flujo de trabajo utiliza un sistema de Generación Aumentada por Recuperación (RAG) para recoger, almacenar y generar contenido basado en blogs de alto tráfico existentes.

Tutorial de YouTube: https://www.youtube.com/watch?v=MmitAOjyrT4

¿Qué hace este flujo de trabajo?

Este flujo de trabajo implicará cuatro pasos:

  • Parte 1: Llamar a Crawl de Scrapeless para rastrear todas las subpáginas del sitio web objetivo y usar Scrape para analizar profundamente todo el contenido de cada página.
  • Parte 2: Almacenar los datos rastreados en Pinecone Vector Store.
  • Parte 3: Usar el nodo Búsqueda en Google de Scrapeless para analizar completamente el valor del tema o las palabras clave objetivo.
  • Parte 4: Transmitir instrucciones a Gemini, integrar contenido contextual de la base de datos preparada a través de RAG y producir blogs objetivo o responder preguntas.

Si no has oído hablar de Scrapeless, es una empresa de infraestructura líder enfocada en potenciar agentes de IA, flujos de trabajo de automatización y rastreo web. Scrapeless proporciona los bloques de construcción esenciales que permiten a desarrolladores y empresas crear sistemas inteligentes y autónomos de manera eficiente.

En su núcleo, Scrapeless ofrece herramientas a nivel de navegador y APIs basadas en protocolos, como navegador en la nube sin cabeza, API de SERP profunda y APIs de rastreo universal, que sirven como una base unificada y modular para agentes de IA y plataformas de automatización.

Realmente está construido para aplicaciones de IA porque los modelos de IA no siempre están actualizados con muchas cosas, ya sean eventos actuales o nuevas tecnologías.

Además de n8n, también se puede llamar a través de API, y hay nodos en plataformas principales como Make:

También puedes usarlo directamente en el sitio web oficial.

Para usar Scrapeless en n8n:

  1. Ve a Configuraciones > Nodos de la comunidad
  2. Busca n8n-nodes-scrapeless e instálalo.

Necesitamos instalar primero el nodo de la comunidad de Scrapeless en n8n:

Nodo Scrapeless
Nodo Scrapeless

Conexión de Credenciales

Clave API de Scrapeless

En este tutorial, utilizaremos el servicio de Scrapeless. Asegúrate de haberte registrado y obtener la clave API.

  • Regístrate en el sitio web de Scrapeless para obtener tu clave API y reclamar la prueba gratuita.
  • Luego, puedes abrir el nodo de Scrapeless, pegar tu clave API en la sección de credenciales y conectarlo.
Clave API de Scrapeless

Índice y Clave API de Pinecone

Después de rastrear los datos, integraremos y procesaremos toda la información y recopilaremos todos los datos en la base de datos de Pinecone. Necesitamos preparar la clave API de Pinecone y el índice con anticipación.

Crear Clave API

Después de iniciar sesión, haz clic en Claves API → Haz clic en Crear clave API → Completa el nombre de la clave APICrear clave. Ahora, puedes configurarlo en las credenciales de n8n.

⚠️ Después de completar la creación, copia y guarda tu clave API. Por razones de seguridad de datos, Pinecone ya no mostrará la clave API creada.

Crear clave API de Pinecone

Crear Índice
Clic en Índice e ingresa a la página de creación. Establece el nombre del índice → Selecciona modelo para Configuración → Establece la Dimensión adecuada → Crear índice.
2 configuraciones de dimensión comunes:

  • Google Gemini Embedding-001 → 768 dimensiones
  • OpenAI's text-embedding-3-small → 1536 dimensiones
Crear Índice

Fase 1: Raspar y rastrear sitios web para la Base de Conocimiento

Fase 1: Raspar y rastrear sitios web para la Base de Conocimiento

La primera etapa es agregar directamente todo el contenido del blog. Rastrear contenido de un área grande permite a nuestro Agente de IA obtener fuentes de datos de todos los campos, asegurando así la calidad de los artículos finales.

  • El nodo de Scrapeless rastrea la página del artículo y recopila todas las URL de las publicaciones del blog.
  • Luego recorre cada URL, raspa el contenido del blog y organiza los datos.
  • Cada publicación del blog se incrusta usando tu modelo de IA y se almacena en Pinecone.
  • En nuestro caso, raspamos 25 publicaciones del blog en solo unos minutos, ¡sin mover un dedo!

Nodo de raspeo de Scrapeless

Este nodo se utiliza para rastrear todo el contenido del sitio web de blogs objetivo, incluyendo metadatos, contenido de subpáginas y exportarlo en formato Markdown. Este es un rastreo de contenido a gran escala que no podemos lograr rápidamente a través de codificación manual.

Configuración:

  • Conecta tu clave API de Scrapeless
  • Recurso: Rastreador
  • Operación: Rastrear
  • Ingresa tu sitio web objetivo para raspar. Aquí usamos https://www.scrapeless.com/es/blog como referencia.
Nodo de raspeo de Scrapeless

Nodo de Código

Después de obtener los datos del blog, necesitamos analizar los datos y extraer la información estructurada que necesitamos de ellos.

Nodo de Código

Lo siguiente es el código que utilicé. Puedes referirte a él directamente:

JavaScript Copy
return items.map(item => {
  const md = $input.first().json['0'].markdown; 

  if (typeof md !== 'string') {
    console.warn('El contenido Markdown no es una cadena:', md);
    return {
      json: {
        title: '',
        mainContent: '',
        extractedLinks: [],
        error: 'El contenido Markdown no es una cadena'
      }
    };
  }

  const articleTitleMatch = md.match(/^#\s*(.*)/m);
  const title = articleTitleMatch ? articleTitleMatch[1].trim() : 'No se encontró título';

  let mainContent = md.replace(/^#\s*.*(\r?\n)+/, '').trim();

  const extractedLinks = [];
  const linkRegex = /\[([^\]]+)\]\((https?:\/\/[^\s#)]+)\)/g; 
  let match;
  while ((match = linkRegex.exec(mainContent))) {
    extractedLinks.push({
      text: match[1].trim(),
      url: match[2].trim(),
    });
  }

  return {
    json: {
      title,
      mainContent,
      extractedLinks,
    },
  };
});

Nodo: Separar

El nodo Separar puede ayudarnos a integrar los datos limpios y extraer las URL y el contenido de texto que necesitamos.

Nodo: Separar

Bucle sobre Elementos + Raspeo de Scrapeless

Bucle sobre Elementos + Raspeo de Scrapeless

Bucle sobre Elementos

Usa el nodo Bucle sobre Tiempo con el Raspeo de Scrapeless para realizar repetidamente tareas de rastreo, y analizar en profundidad todos los elementos obtenidos anteriormente.

Bucle sobre Elementos

Raspeo de Scrapeless

El nodo de raspeo se utiliza para rastrear todo el contenido contenido en la URL obtenida previamente. De esta manera, cada URL puede ser analizada en profundidad. Se devuelve el formato markdown y se integran los metadatos y otra información.

Raspeo de Scrapeless

Fase 2. Almacenar datos en Pinecone

Hemos extraído con éxito todo el contenido de la página de blog de Scrapeless. Ahora necesitamos acceder a la Tienda de Vectores Pinecone para almacenar esta información para poder usarla más tarde.

Fase 2. Almacenar datos en Pinecone

Nodo: Agregar

Para almacenar datos en la base de conocimiento de manera conveniente, necesitamos usar el nodo Agregar para integrar todo el contenido.

  • Agregar: Todos los datos de los elementos (en una sola lista)
  • Poner salida en campo: data
  • Incluir: Todos los campos
Agregar

Nodo: Convertir a Archivo

¡Genial! Todos los datos se han integrado con éxito. Ahora necesitamos convertir los datos adquiridos a un formato de texto que pueda ser leído directamente por Pinecone. Para hacer esto, solo agrega una Convertir a Archivo.

Nodo: Almacén de vectores de Pinecone

Ahora necesitamos configurar la base de conocimientos. Los nodos utilizados son:

  • Almacén de Vectores de Pinecone
  • Google Gemini
  • Cargador de Datos Predeterminado
  • Divisor de Texto Recursivo de Caracteres

Los cuatro nodos anteriores integrarán y rastrearán recursivamente los datos que hemos obtenido. Luego, todos se integran en la base de conocimientos de Pinecone.

Fase 3. Análisis SERP usando IA

Para asegurarte de que estás escribiendo contenido que clasifique, realizamos un análisis SERP en vivo:

  1. Usa el Scrapeless Deep SerpApi para obtener resultados de búsqueda para tu palabra clave elegida
  2. Ingresa tanto la palabra clave como la intención de búsqueda (por ejemplo, Raspado, tendencias de Google, API)
  3. Los resultados son analizados por un LLM y resumidos en un informe HTML

Nodo: Editar Campos

¡La base de conocimientos está lista! Ahora es el momento de determinar nuestras palabras clave objetivo. Completa las palabras clave objetivo en el cuadro de contenido y agrega la intención.

Nodo: Búsqueda de Google

El nodo de Búsqueda de Google llama al Deep SerpApi de Scrapeless para recuperar palabras clave objetivo.

Nodo: Cadena LLM

Construir una Cadena LLM con Gemini puede ayudarnos a analizar los datos obtenidos en los pasos anteriores y explicar al LLM la entrada de referencia y la intención que necesitamos usar para que el LLM pueda generar comentarios que satisfagan mejor las necesidades.

Nodo: Markdown

Dado que LLM generalmente exporta en formato Markdown, como usuarios no podemos obtener directamente los datos que más necesitamos con claridad, así que agrega un nodo de Markdown para convertir los resultados devueltos por el LLM en HTML.

Nodo: HTML

Ahora necesitamos usar el nodo HTML para estandarizar los resultados: utiliza el formato de Blog/Informe para mostrar intuitivamente el contenido relevante.

  • Operación: Generar Plantilla HTML

El siguiente código es necesario:

XML Copy
<!DOCTYPE html>
<html lang="es">
<head>
  <meta charset="UTF-8" />
  <title>Resumen del Informe</title>
  <link href="https://fonts.googleapis.com/css2?family=Inter:wght@400;600;700&display=swap" rel="stylesheet">
  <style>
    body {
      margin: 0;
      padding: 0;
      font-family: 'Inter', sans-serif;
      background: #f4f6f8;
      display: flex;
      align-items: center;
      justify-content: center;
      min-height: 100vh;
    }

    .container {
      background-color: #ffffff;
      max-width: 600px;
      width: 90%;
      padding: 32px;
      border-radius: 16px;
      box-shadow: 0 10px 30px rgba(0, 0, 0, 0.1);
      text-align: center;
    }

    h1 {
      color: #ff6d5a;
      font-size: 28px;
      font-weight: 700;
      margin-bottom: 12px;
    }

    h2 {
      color: #606770;
      font-size: 20px;
      font-weight: 600;
      margin-bottom: 24px;
    }

    .content {
      color: #333;
      font-size: 16px;
      line-height: 1.6;
      white-space: pre-wrap;
    }

    @media (max-width: 480px) {
      .container {
        padding: 20px;
      }

      h1 {
        font-size: 24px;
      }

      h2 {
        font-size: 18px;
      }
    }
  </style>
</head>
<body>
  <div class="container">
    <h1>Informe de Datos</h1>
    <h2>Procesado a través de Automatización</h2>
    <div class="content">{{ $json.data }}</div>
  </div>

  <script>
    console.log("¡Hola Mundo!");
  </script>
</body>
</html>

Este informe incluye:

  • Palabras clave de alto rango y frases de cola larga
  • Tendencias de intención de búsqueda del usuario
  • Títulos de blog y ángulos sugeridos
  • Agrupación de palabras clave

Fase 4. Generación del Blog con IA + RAG

Ahora que has recopilado y almacenado el conocimiento y investigado tus palabras clave, es momento de generar tu blog.

  1. Construye un aviso utilizando información del informe SERP
  2. Llama a un agente de IA (por ejemplo, Claude, Gemini o OpenRouter)
  3. El modelo recupera el contexto relevante de Pinecone y escribe un post completo del blog.
    A diferencia de la salida AI genérica, el resultado aquí incluye ideas, frases y un tono específicos del contenido original de Scrapeless, gracias a RAG.

Los Pensamientos Finales

Este motor de contenido SEO de extremo a extremo demuestra el poder de n8n + Scrapeless + Base de Datos Vectorial + LLMs.
Puedes:

  • Reemplazar la Página de Blog de Scrapeless por cualquier otro blog
  • Cambiar Pinecone por otras tiendas vectoriales
  • Usar OpenAI, Claude o Gemini como tu motor de escritura
  • Construir tuberías de publicación personalizadas (por ejemplo, auto-publicar en CMS o Notion)

👉 Comienza hoy instalando el nodo de la comunidad de Scrapeless y empieza a generar blogs a gran escala — no se requiere programación.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar