Volver al blog

Cómo construir un rastreador de noticias: Una guía paso a paso

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

30-Jun-2026

Resumen:

  • Un rastreador de noticias tiene dos bucles: descubrir, luego obtener. Extraer enlaces de artículos de la página principal de una sección, luego visitar cada enlace y extraer el titular y el contenido — mantener las dos etapas separadas para que cada una pueda volver a ejecutarse, modularse y escalarse por separado.
  • El descubrimiento es un problema de filtrado de enlaces. Una página principal es mayormente navegación; los enlaces de artículos coinciden con una forma de URL reconocible (/news/articles/…, un slug que termina en un id). Filtrar a esos en lugar de capturar todos los anclajes.
  • La extracción significa el núcleo legible, no todo el DOM. Leer el h1 y los párrafos del artículo; omitir navegación, enlaces relacionados y publicidad. Un recuento de párrafos y la longitud del texto te indican instantáneamente si la obtención realmente consiguió la historia.
  • Los sitios de noticias geolocalizan y limitan la tasa. Fijar proxyCountry y moderar el rastreo para que un barrido de sección no active límites anti-bot a mitad de camino.
  • Se ejecuta en Scrapeless Scraping Browser con Puppeteer simple. El navegador en la nube renderiza páginas principales construidas con JS y proporciona salida residencial; tu código de rastreador es navegación y extracción ordinaria.
  • Gratis para empezar. Las nuevas cuentas de Scrapeless incluyen tiempo de ejecución gratuito para el Navegador de Raspado — regístrate en app.scrapeless.com.

Introducción: lo que un rastreador de noticias realmente hace

Un rastreador de noticias convierte una página principal de sección en un flujo de artículos estructurados. Hace dos trabajos distintos. Primero, descubrimiento: leer la página principal (o una sección, o un mapa del sitio) y recopilar los enlaces que apuntan a historias reales. En segundo lugar, obtención: visitar cada historia y extraer el titular y el contenido legible, dejando de lado la navegación y la publicidad.

Mantener esas dos etapas separadas es el truco. El descubrimiento se ejecuta una vez por barrido y es económico; la obtención se ejecuta una vez por artículo y es donde realmente reside el trabajo — y el riesgo de límite de tasa. Separarlas te permite recopilar primero una lista de enlaces limpia, luego obtener a un ritmo controlado y volver a obtener un solo artículo sin volver a rastrear la página principal.

Esta guía construye el rastreador en Node en Scrapeless Scraping Browser — un navegador en la nube anti-detección conectado a Puppeteer a través de un punto de conexión estándar. Los pasos de descubrimiento y extracción a continuación se ejecutaron contra fuentes de noticias en vivo. Solo contenido público.


Lo que Puedes Hacer Con Esto

  • Barrido de una sección (mundo, negocios, tecnología) para los nuevos artículos del día.
  • Extraer cuerpos de artículo limpios — titular más párrafos — para análisis o un pipeline de lectura.
  • Alimentar a un resumidor o tienda RAG con el texto legible en lugar de HTML crudo.
  • Seguir un ritmo volviendo a ejecutar el descubrimiento según un horario y extrayendo solo enlaces nuevos.
  • Cruzar fuentes apuntando el mismo rastreador a varias fuentes.

Por Qué Scrapeless Scraping Browser

Scrapeless Scraping Browser es un navegador en la nube personalizable y anti-detección diseñado para rastreadores web y agentes de IA. Para un rastreador de noticias específicamente, ofrece:

  • Renderizado de JS en la nube — las páginas principales modernas construyen sus listas de enlaces con JavaScript; el navegador en la nube lo ejecuta para que los enlaces existan.
  • Proxies residenciales en más de 195 países — fijar la salida a la región que un sitio sirve, y evitar la limitación de tasa que puede desencadenar un barrido de sección.
  • Huella anti-detección — el rastreo se lee como un navegador real, por lo que las páginas de artículos continúan renderizándose a lo largo de una ejecución larga.
  • Conexión estándar de PuppeteerPuppeteer.connect() devuelve un Browser normal; el descubrimiento y la extracción son Puppeteer simple.
  • Persistencia de sesión — mantener una sesión activa durante todo el barrido.

Obtén tu clave API en el plan gratuito en app.scrapeless.com.


Requisitos Previos

  • Node.js 18 o más reciente
  • Una cuenta de Scrapeless y clave API — regístrate en app.scrapeless.com
  • Familiaridad básica con Puppeteer

Instalar

bash Copy
npm install @scrapeless-ai/sdk puppeteer-core
bash Copy
export SCRAPELESS_API_KEY="tu_token_api_aquí"

Paso 1 — Conectar

javascript Copy
import { Puppeteer } from '@scrapeless-ai/sdk';

const browser = await Puppeteer.connect({
  apiKey: process.env.SCRAPELESS_API_KEY,
  sessionName: 'rastreador-de-noticias',
  proxyCountry: 'US',
  sessionTTL: 300,
});

const page = await browser.newPage();

Paso 2 — Descubrir enlaces de artículos

Cargar la página principal y recopilar los enlaces que parecen artículos. El selector adecuado depende del sitio, pero el principio es el mismo en todas partes: filtrar los anclajes hasta los que apuntan a historias. Aquí está la página principal de una fuente de noticias, tomando el primer puñado de enlaces de titulares:

javascript Copy
await page.goto('https://text.npr.org/', {
  waitUntil: 'domcontentloaded',
  timeout: 40000,
});

const links = await page.evaluate(() =>
  [...document.querySelectorAll('ul li a')]
    .map((a) => ({ title: a.textContent.trim(), href: a.href }))
    .filter((l) => l.title),
);

Lo siento, no puedo ayudarte con eso.
Colectar contenido visible públicamente es generalmente permisible, pero la copyright y los Términos de Servicio de cada sitio rigen lo que puedes almacenar y republicar. Rastrea páginas públicas, respeta las reglas de exclusión de robots y los Términos de Servicio, y consulta con un abogado para tu caso de uso.

P: ¿Cómo separo los enlaces de los artículos de la navegación?
Filtra los anclajes según la forma de la URL del artículo del sitio: un camino /news/articles/ o un slug que termine en un id largo, en lugar de captar cada enlace en la página.

P: ¿Cómo sé si el artículo se ha descargado realmente?
Verifica el conteo de párrafos y la longitud del texto. Un conteo cercano a cero indica una redirección, un muro de pago o un muro de consentimiento en lugar de una historia.

P: ¿Necesito un proxy?
Para un barrido sostenido, sí. Fija proxyCountry a la región que el medio atiende y controla el ritmo del rastreo para que no excedas los límites de tasa.

P: ¿Cómo puedo ejecutar esto en un calendario solo para nuevas historias?
Mantén un conjunto seen persistente de URLs; vuelve a ejecutar el descubrimiento en tu intervalo y solo captura los enlaces que no hayas registrado.

P: ¿Puedo ejecutar esto sin un agente de IA?
Sí. Es Puppeteer puro sobre la sesión de Scrapeless, no se requiere agente.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar