Volver al blog

Cómo raspar Google News con Python

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

06-Mar-2025

¿Qué es Google Noticias?

Google Noticias es un servicio de agregación de noticias lanzado por Google. Recopila, organiza y muestra los últimos informes de noticias de los principales sitios web de noticias de todo el mundo. Los usuarios pueden filtrar por palabras clave, temas, regiones, fuentes de publicación, etc., y el algoritmo de Google Noticias recomendará contenido de noticias personalizado en función de los intereses y hábitos de navegación de los usuarios.
Qué es Google Noticias

Los datos de Google Noticias provienen principalmente de organizaciones de noticias autorizadas, blogs, anuncios gubernamentales, etc., por lo que es una fuente importante de información global en tiempo real.

¿Qué datos puedes obtener de Google Noticias?

  • Título de la noticia (título) – el contenido principal del artículo

  • Enlace de la noticia (enlace) – la URL de origen original del artículo

  • Fecha de publicación (fecha) – el momento en que se publicó el artículo (hace unos minutos, hace unas horas o una hora específica)

  • Fragmento de noticias (fragmento) – una breve vista previa del contenido del artículo

  • Fuente de noticias (fuente) – la organización de medios donde se publicó el artículo, como CNN, BBC, NYTimes

  • Categoría de noticias (categoría) – la categoría a la que pertenece el artículo, como tecnología, deportes, finanzas, salud, etc.

  • Enlace de la imagen (miniatura) – el enlace a la imagen que acompaña al artículo

  • Noticias relacionadas (noticias relacionadas) – enlaces a informes similares o relacionados

  • Contenido de video (video) – noticias en video incluidas
    ....

¿Por qué rastrear datos de Google Noticias?

Existen muchos escenarios de aplicación práctica para el rastreo de datos de Google Noticias. Estos son algunos de los usos más comunes:

  1. Análisis de mercado e inteligencia empresarial
  2. Análisis financiero y de inversión
  3. SEO y marketing de contenidos
  4. Investigación de aprendizaje automático e IA
  5. Aplicaciones de agregación de medios y noticias

Cómo raspar datos de Google Noticias con Python

Paso 1: Crear un entorno de rastreo de datos de Google Noticias

Primero, necesitamos crear un entorno de rastreo de datos y preparar las siguientes herramientas:

  1. Python: https://www.python.org/downloads/ Este es el software principal para ejecutar Python. Puedes descargar la versión que necesitamos desde el enlace del sitio web oficial, como se muestra en la imagen a continuación, pero se recomienda no descargar la última versión. Puedes descargar 1 o 2 versiones anteriores a la última versión.
Python
  1. IDE de Python: Cualquier IDE que admita Python servirá, pero recomendamos PyCharm, que es un software de herramienta de desarrollo IDE diseñado específicamente para Python. Con respecto a la versión de PyCharm, recomendamos la edición comunitaria gratuita de PyCharm.
IDE de Python
  1. Pip: Puedes usar el índice de paquetes de Python para instalar las bibliotecas que necesitas para ejecutar tus programas con un solo comando.
Pip

Nota: Si eres un usuario de Windows, no olvides marcar la opción "Agregar python.exe a PATH" en el asistente de instalación. Esto permitirá que Windows use Python y comandos en la terminal. Dado que Python 3.4 o posterior lo incluye de forma predeterminada, no necesitas instalarlo manualmente.

Instalar python

A través de los pasos anteriores, se configura el entorno para rastrear datos de Google Noticias. A continuación, puedes usar PyCharm descargado combinado con Scraperless para rastrear datos de Google Noticias.

Paso 2: Usar PyCharm y Scrapeless para raspar datos de Google Noticias

  1. Inicia PyCharm y selecciona Archivo>Nuevo proyecto… en la barra de menú.
Iniciar PyCharm y seleccionar Archivo
  1. Luego, en la ventana que aparece, selecciona Pure Python en el menú de la izquierda y configura tu proyecto de la siguiente manera:

Nota: En el cuadro rojo a continuación, selecciona la ruta de instalación de Python descargada en el primer paso de la configuración del entorno

Seleccionar Pure Python
  1. Puedes crear un proyecto llamado python-scraper, marcar la opción "Crear secuencia de comandos de bienvenida main.py en la carpeta" y hacer clic en el botón "Crear". Después de que PyCharm configure el proyecto por un tiempo, deberías ver lo siguiente:
Crear un proyecto llamado python-scraper
  1. Luego, haz clic derecho para crear un nuevo archivo de Python.
Crear un nuevo archivo de Python
  1. Para verificar que todo funciona correctamente, abre la pestaña Terminal en la parte inferior de la pantalla y escribe: python main.py. Después de ejecutar este comando, deberías obtener: Hola, PyCharm.

Paso 3: Obtener la clave API de Scrapeless

Ahora puedes copiar directamente el código de Scrapeless en PyCharm y ejecutarlo, para que puedas obtener los datos en formato JSON de Google Noticias. Sin embargo, primero debes obtener la clave API de Scrapeless. Los pasos son los siguientes:

Si aún no tienes una cuenta, regístrate en Scrapeless](https://app.scrapeless.com/passport/login?utm_source=official&utm_medium=blog&utm_campaign=scrapegooglenews). Después de registrarte, inicia sesión en tu panel.

En tu panel de Scrapeless, navega a Administración de claves API y haz clic en Crear clave API. Obtendrás tu clave API. Simplemente coloca el ratón sobre ella y haz clic para copiarla. Esta clave se utilizará para autenticar tu solicitud al llamar a la API de Scrapeless.

Paso 4: Cómo integrar la API de Scrapeless en tu herramienta de raspado

Una vez que tengas la clave API, puedes comenzar a integrar la API de Scrapeless en tu propia herramienta de raspado. Aquí tienes un ejemplo de cómo llamar a la API de Scrapeless y recuperar datos usando Python y requests.

Código de ejemplo para rastrear información de Google Noticias usando la API de Scrapeless:

Copy
import json
import requests

class Payload:
    def __init__(self, actor, input_data):
        self.actor = actor
        self.input = input_data

def send_request():
    host = "api.scrapeless.com"
    url = f"https://{host}/api/v1/scraper/request"
    token = "your_token"

    headers = {
        "x-api-token": token
    }

    input_data = {
        "engine": "google_news",
        "q": "pizza",
        "gl": "us",
        "hl": "en",
    }

    payload = Payload("scraper.google.news", input_data)

    json_payload = json.dumps(payload.__dict__)

    response = requests.post(url, headers=headers, data=json_payload)

    if response.status_code != 200:
        print("Error:", response.status_code, response.text)
        return

    print("body", response.text)


if __name__ == "__main__":
    send_request()

¿Cansado de lidiar con bloqueos de IP, CAPTCHA y estructuras HTML que cambian constantemente?
Con la API de Google Noticias de Scrapeless, puedes evitar restricciones, extraer datos de noticias en tiempo real y ahorrar horas de tiempo de desarrollo, ¡todo con una simple llamada a la API!

¿Por qué elegir Scrapeless en lugar de rasparlo tú mismo?

¿Por qué elegir Scrapeless?

✅ Precio súper bajo, solo $0.1 por cada 1.000 consultas

En comparación con la creación de tu propio rastreador, el mantenimiento de IP proxy y la omisión de mecanismos anti-rastreo, el precio de SerpApi es muy competitivo, solo $0.1 por cada 1.000 consultas, lo que reduce en gran medida el costo de adquisición de datos.

✅ Respuesta súper rápida, devuelve datos en 3 segundos

Scrapeless tiene capacidades de rastreo de datos súper rápidas y puede devolver datos JSON estructurados en 3 segundos después de la solicitud, lo que es mucho más rápido que la velocidad de procesamiento de los rastreadores tradicionales.

✅ Sin mantenimiento, sin necesidad de preocuparse por el bloqueo de IP y los mecanismos anti-rastreo

Google detectará el tráfico anormal y bloqueará las IP, e incluso requerirá la verificación del código de verificación. Scrapeless maneja todos los problemas anti-rastreo para garantizar que las solicitudes de API siempre estén disponibles y no activarán CAPTCHA o bloqueos de IP.

✅ Búsqueda precisa, filtra los datos de noticias a demanda

Puedes filtrar las noticias por palabras clave, tiempo de publicación, fuente de noticias y otras condiciones para obtener los datos más relevantes y evitar interferencias de información inútil.

API de Google Noticias de Scrapeless
🔹 Precio súper bajo: solo $0.1 por cada 1.000 consultas
🔹 Velocidad súper rápida: datos devueltos en 3 segundos
🔹 Estable y eficiente: sin bloqueo de IP, sin necesidad de mantenimiento
👉 Prueba Scrapeless ahora para raspar fácilmente los datos de Google Noticias.

Scrapeless Deep SerpAPI: Una solución de rastreo de datos más rápida y amplia

Scrapeless Deep SerpAPI

Si necesitas una solución de adquisición de datos más completa y eficiente, ¡Scrapeless Deep SerpAPI definitivamente vale la pena probarla!

✅ Mayor cobertura de datos: más de 20 interfaces de escenarios de la API de búsqueda de Google
✅ Actualizaciones de datos en tiempo real: los datos de las últimas 24 horas están disponibles en cualquier momento
✅ Coste ultrabajo: solo $0.10 por cada 1.000 consultas
✅ Respuesta súper rápida: los datos se devuelven en 1-2 segundos, superando con creces las API tradicionales
👉 Prueba Scrapeless Deep SerpAPI ahora y rastrea fácilmente los datos de búsqueda de Google.

Soporte para desarrolladores gratuito:
Integra Scrapeless Deep SerpApi en tu herramienta de IA, aplicación o proyecto (ya admitimos Dify y admitiremos Langchain, Langflow, FlowiseAI y otros frameworks en el futuro).
Comparte los resultados de tu integración en las redes sociales y obtendrás de 1 a 12 meses de soporte gratuito para desarrolladores, hasta 500 000 usos por mes.
¡Aprovecha esta oportunidad para mejorar tu proyecto y disfrutar de más soporte para el desarrollo!

Conclusión

En este artículo, exploramos cómo raspar Google Noticias usando Python. Cabe señalar que al raspar contenido, debes seguir las políticas y restricciones de uso de Google para garantizar el cumplimiento legal.

Recursos relacionados

Cómo raspar datos de vuelos de Kayak
Cómo usar Selenium con PowerShell
Raspar empleos de Google para crear fácilmente listas de empleos usando Scrapeless

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar