Volver al blog

Cómo extraer resultados de reseñas de productos de Google con Python

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

21-Mar-2025

Mientras la ola digital barre el mundo, Google, como uno de los motores de búsqueda más grandes del mundo, esconde una enorme cantidad de datos valiosos en su página de resultados de búsqueda (SERP). Estos datos no son solo una simple lista de información, sino también la clave para comprender la dinámica del mercado, analizar a la competencia y entender el comportamiento del consumidor.

Sin embargo, no es fácil rastrear de manera eficiente y efectiva los resultados de búsqueda de Google. La estructura de la página de Google Product es compleja y cambiante, y cuenta con un potente mecanismo anti-rastreadores, lo que hace que los métodos tradicionales de rastreo de datos a menudo sean difíciles de implementar. Para superar estos desafíos, es particularmente importante una canalización de datos potente, escalable y flexible que pueda adaptarse a los cambios estructurales de Google. Tanto si planeas construir tu propio modelo de lenguaje grande (LLM) como si deseas obtener información de primera mano sobre el comportamiento del consumidor en el mercado, un rastreador de búsqueda de Google confiable es indispensable.

En este artículo, nos centraremos en cómo usar Python y la biblioteca BeautifulSoup para construir un rastreador de resultados de reseñas de productos de Google desde cero. Con esta herramienta, podrás extraer automáticamente datos valiosos y descubrir información que se puede utilizar directamente para la toma de decisiones en el océano de datos del motor de búsqueda.

Casos de uso del raspado de resultados de productos de Google


El raspado de resultados de productos de Google se ha convertido en un medio importante para que las empresas e investigadores obtengan información sobre el mercado. Al analizar estos datos, las empresas pueden comprender las tendencias del mercado, las preferencias de los consumidores y la dinámica de la competencia, desarrollando así estrategias comerciales más efectivas. A continuación, se muestran algunos escenarios de uso comunes:

  • Investigación de mercado y análisis de tendencias.
  • Análisis de la competencia
  • Desarrollo y optimización de productos
  • Información sobre el comportamiento del consumidor
  • Monitoreo y ajuste de precios
  • Protección de marca y gestión de la reputación
  • Comercio electrónico y optimización de la venta minorista en línea
  • Investigación académica y análisis de datos
  • Formulación y supervisión de políticas públicas

Dificultades en el rastreo de reseñas de productos de Google


La extracción de reseñas de productos de Google presenta varios desafíos, incluyendo los siguientes:

Medidas anti-raspado

  • Google utiliza CAPTCHA y bloqueo de IP para evitar bots.
  • Requiere proxies y rotación de agentes de usuario para evitarlo.

Contenido dinámico renderizado con JavaScript

  • Las reseñas se cargan dinámicamente mediante JavaScript.
  • Necesita herramientas como Puppeteer o Selenium para extraer datos.

Cambios frecuentes en la estructura del DOM

  • Google actualiza su estructura HTML con regularidad.
  • Los rastreadores requieren mantenimiento constante.

Método 1: Raspar resultados de reseñas de productos de Google con Scrapeless


Raspar reseñas de productos de Google en Python requiere manejar desafíos como la carga dinámica de contenido y los mecanismos anti-raspado. Esta sección explora métodos y herramientas eficaces para extraer datos de reseñas de manera eficiente.

Paso 1: Crear un entorno de rastreo de datos de productos de Google

Primero, necesitamos crear un entorno de rastreo de datos y preparar las siguientes herramientas:

1. Python: Este es el software principal para ejecutar Python. Puedes descargar la versión que necesitamos desde el enlace del sitio web oficial, como se muestra en la imagen a continuación, pero se recomienda no descargar la última versión. Puedes descargar 1 o 2 versiones anteriores a la última.

install python

2. IDE de Python: Cualquier IDE que admita Python funcionará, pero recomendamos PyCharm, que es un software de herramienta de desarrollo IDE diseñado específicamente para Python. Con respecto a la versión de PyCharm, recomendamos la edición gratuita de PyCharm Community.

Python IDE

3. Pip: Puedes usar el índice de paquetes de Python para instalar las bibliotecas que necesitas para ejecutar tus programas con un solo comando.

Nota: Si eres un usuario de Windows, no olvides marcar la opción "Agregar python.exe a PATH" en el asistente de instalación. Esto permitirá que Windows use Python y comandos en la terminal. Dado que Python 3.4 o posterior lo incluye de forma predeterminada, no necesitas instalarlo manualmente.

A través de los pasos anteriores, se configura el entorno para rastrear datos de productos de Google. A continuación, puedes usar PyCharm descargado combinado con Scraperless para rastrear datos de productos de Google.

Paso 2: Usar PyCharm y Scrapeless para raspar datos de productos de Google

  1. Inicia PyCharm y selecciona Archivo>Nuevo proyecto… en la barra de menú.

  2. Luego, en la ventana que aparece, selecciona Pure Python en el menú de la izquierda y configura tu proyecto de la siguiente manera:

Nota: En el cuadro rojo a continuación, selecciona la ruta de instalación de Python descargada en el primer paso de la configuración del entorno.

python install
  1. Puedes crear un proyecto llamado python-scraper, marcar la opción "Crear script de bienvenida main.py en la carpeta" y hacer clic en el botón "Crear". Después de que PyCharm configure el proyecto durante un tiempo, deberías ver lo siguiente:
python install
  1. Luego, haz clic con el botón derecho para crear un nuevo archivo de Python.

  2. Para verificar que todo funciona correctamente, abre la pestaña Terminal en la parte inferior de la pantalla y escribe: python main.py. Después de ejecutar este comando, deberías obtener: Hola, PyCharm.

Paso 3: Obtener la clave API de Scrapeless

Ahora puedes copiar directamente el código de Scrapeless en PyCharm y ejecutarlo, para que puedas obtener los datos en formato JSON de Google Job. Sin embargo, primero debes obtener la clave API de Scrapeless. Los pasos son los siguientes:

  • Si aún no tienes una cuenta, regístrate en Scrapeless. Después de registrarte, inicia sesión en tu panel de control.
  • En tu panel de control de Scrapeless, navega a Administración de claves API y haz clic en Crear clave API. Obtendrás tu clave API. Simplemente coloca el ratón sobre ella y haz clic para copiarla. Esta clave se utilizará para autenticar tu solicitud al llamar a la API de Scrapeless.

Protegemos firmemente la privacidad del sitio web. Todos los datos de este blog son públicos y solo se utilizan como demostración del proceso de rastreo. No guardamos ninguna información ni datos.

get api key

¡Únete a Scrapeless y obtén 20,000 consultas gratuitas!

Regístrate en Scrapeless hoy y disfruta de 20,000 consultas gratuitas. ¡Comienza a rastrear reseñas de productos de Google y desbloquea información valiosa con facilidad! No te lo pierdas: ¡regístrate ahora y experimenta el poder de Scrapeless de forma gratuita!

Paso 4: Cómo integrar la API de Scrapeless en tu herramienta de raspado

Una vez que tengas la clave API, puedes comenzar a integrar la API de Scrapeless en tu propia herramienta de raspado. Aquí hay un ejemplo de cómo llamar a la API de Scrapeless y recuperar datos usando Python y requests.

Código de ejemplo para rastrear información de productos de Google usando la API de Scrapeless:

Copy
import json
import requests

class Payload:
    def __init__(self, actor, input_data):
        self.actor = actor
        self.input = input_data

def send_request():
    host = "api.scrapeless.com"
    url = f"https://{host}/api/v1/scraper/request"
    token = "your_token"

    headers = {
        "x-api-token": token
    }

    input_data = {
        "engine": "google_product",
        "product_id": "4172129135583325756",
        "gl": "us",
        "hl": "en",
    }

    payload = Payload("scraper.google.product", input_data)

    json_payload = json.dumps(payload.__dict__)

    response = requests.post(url, headers=headers, data=json_payload)

    if response.status_code != 200:
        print("Error:", response.status_code, response.text)
        return

    print("body", response.text)


if __name__ == "__main__":
    send_request()

Basándote en la salida de este código, puedes encontrar toda la información sobre las reseñas de productos de Google.

También puedes consultar la documentación de los parámetros de la API oficial de Scrapeless

La siguiente es una lista parcial de resultados, que incluye información de comentarios de usuarios.

Copy
body {"product_results":{"product_id":"4172129135583325756","title":"Apple iPhone 12 Pro - 128 GB - Silver - AT\u0026T","price":["$314.84","$298.00","$325.33"],"reviews":14303,"rating":4.4,"extensions":["Smartphone","Dual SIM","5G","With Wireless Charging","With Fast Charging","AT\u0026T","Dual Lens","iOS","GSM","CDMA"],"description":"5G goes Pro. A14 Bionic rockets past every other smartphone chip. The iPhone 12 Pro features a 6.1” Super Retina XDR display, LiDAR scanner for ultrafast and accurate depth maps of whatever space you're in and MagSafe wireless charging. The Pro camera system takes low-light ...More5G goes Pro. A14 Bionic rockets past every other smartphone chip. The iPhone 12 Pro features a 6.1” Super Retina XDR display, LiDAR scanner for ultrafast and accurate depth maps of whatever space you're in and MagSafe wireless charging. The Pro camera system takes low-light photography to the next level with Night mode available in both the Wide and Ultra Wide cameras, so it’s better than ever at capturing incredible low-light shots. And Ceramic Shield delivers four times better drop performance.Less","media":[{"type":"image","link":"https://encrypted-tbn0.gstatic.com/shopping?q=tbn:ANd9GcStw-jdTZtGmdXcVKCqweq6wxzU5tpRTTbl6stPV97GpGVR6XY\u0026usqp=CAY"},{"type":"image","link":"https://encrypted-tbn1.gstatic.com/shopping?q=tbn:ANd9GcR0wJ1fsUOPAGDMtjdtx1zsd5ZWUXwnNe70fmZszERkEihkYCKnZoGJ3Y4lqSQTyR4soiTVWFVzllzYTHJBTRXegTR7Pj83RA\u0026usqp=CAY"},{"type":"image","link":"https://encrypted-tbn1.gstatic.com/shopping?q=tbn:ANd9GcR4L66Gss9O5HSL00NLxaHu0pl5huMUojbC9tO9FKCRpCQObUqdHWsSPYZJ4lU8eETn-MlJx4Hni_oc_l5mxIs_l-Z2htBiaA\u0026usqp=CAY"},{"type":"image","link":"https://encrypted-tbn0.gstatic.com/shopping?q=tbn:ANd9GcQLv5xOi-9b-Mka7jfFnQzlXkTrEAsjPAzumbUB2D6Ddgl3FHGZOQXAUGQAv6WkUeZsbsdvKA2NRF1-h8EOBSQPLmuPMLPQ2Q\u0026usqp=CAY"}],"sizes":{"128 GB":{"link":"https://www.google.com/shopping/product/4172129135583325756?gl=us\u0026hl=en\u0026sourceid=chrome\u0026ie=UTF-8","product_id":"4172129135583325756"},"256 GB":{"link":"https://www.google.com/shopping/product/1700752269234454309?gl=us\u0026hl=en\u0026sourceid=chrome\u0026ie=UTF-8\u0026prds=opd:11579479524734831751,rsk:PC_14243855303706753583\u0026sa=X\u0026ved=0ahUKEwjxhNXT2ZeMAxVcK7kGHUh1ErMQlIUHCEQoAQ","product_id":"1700752269234454309"},"512 GB":{"link":"https://www.google.com/shopping/product/14752474427020499512?gl=us\u0026hl=en\u0026sourceid=chrome\u0026ie=UTF-8\u0026prds=opd:11579479524734831751,rsk:PC_14243855303706753583\u0026sa=X\u0026ved=0ahUKEwjxhNXT2ZeMAxVcK7kGHUh1ErMQlIUHCEUoAg","product_id":"14752474427020499512"}},"highlight":["5G transforms iPhone with accelerated wireless speeds and better performance on congested networks","A14 Bionic: generations ahead of any other smartphone chip","Night mode comes to both the Wide and Ultra Wide cameras, and it's better than ever at capturing incredible low-light shots",

¿Por qué usar Scrapeless para rastrear reseñas de productos de Google?


Why use Scrapeless to crawl Google product reviews
  • Precios asequibles: Con solo $0.1 por 1,000 consultas, Scrapeless ofrece una solución muy rentable para las empresas que necesitan escalar la recopilación de datos sin exceder el presupuesto.
  • Rápido y confiable: Con un tiempo de respuesta de menos de 3 segundos, Scrapeless ofrece resultados en tiempo real, asegurando que obtengas los datos que necesitas de forma rápida y eficiente, esencial para entornos empresariales acelerados.
  • Fácil de usar: Scrapeless cuenta con una interfaz intuitiva que permite a los equipos con experiencia técnica limitada comenzar con una configuración mínima, reduciendo la necesidad de una capacitación extensa.
  • Recopilación de datos escalable: Ya sea que estés recopilando datos para un proyecto pequeño o un análisis a nivel empresarial, Scrapeless se escala con las necesidades de tu negocio, permitiéndote manejar grandes volúmenes de consultas sin problemas.
  • Rascado personalizable: Scrapeless te permite adaptar tu extracción de datos a necesidades específicas, ya sea que te dirijas a productos, regiones o tipos de reseñas particulares, lo que te brinda flexibilidad para recopilar la información más relevante.
  • Mejora la toma de decisiones: Scrapeless ayuda a las empresas a obtener información valiosa de las reseñas de productos de Google, ayudando en el análisis del sentimiento del cliente y las decisiones de mejora del producto. Esto es particularmente crucial para las empresas que buscan mantenerse competitivas.
  • Integración perfecta: Con opciones para integrar Scrapeless con otras herramientas empresariales, tu equipo puede analizar directamente los datos recopilados dentro de tus sistemas existentes, lo que facilita la actuación rápida sobre la información.

¡Únete a nuestra comunidad de Discord y conéctate con clientes de TOB!

Únete a nuestra comunidad de Discord para conectar con otros clientes de TOB, compartir información y debatir estrategias. Además, obtén acceso directo a nuestro equipo para obtener asistencia personalizada, ya sea que necesites soluciones personalizadas, pruebas de datos o orientación. ¡No te pierdas esta oportunidad de mejorar tu experiencia con Scrapeless!

Método 2: Rastreo de reseñas de productos de Google usando Python y Selenium


Requisitos previos

Antes de comenzar, asegúrate de tener lo siguiente:

  • Python instalado (se recomienda 3.x)
  • Google Chrome y ChromeDriver
  • Bibliotecas de Python necesarias:
Copy
pip install selenium beautifulsoup4 pandas

Paso 1: Configurar Selenium WebDriver

Selenium nos permite automatizar las interacciones web. Primero, necesitamos inicializar Chrome WebDriver:

Copy
from selenium import webdriver
from selenium.webdriver.chrome.service import Service
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
import time
service = Service('path/to/chromedriver')  # Actualiza con la ruta correcta
options = webdriver.ChromeOptions()
options.add_argument('--headless')  # Ejecutar en modo sin cabeza
driver = webdriver.Chrome(service=service, options=options)
driver.get('https://www.google.com/shopping/product/1234567890/reviews')  # URL de ejemplo

Paso 2: Extraer datos de reseñas

Usamos BeautifulSoup para analizar el código fuente de la página y extraer los detalles de la reseña.

Copy
from bs4 import BeautifulSoup
def extract_reviews(driver):
    soup = BeautifulSoup(driver.page_source, 'html.parser')
    reviews = []

    for review in soup.find_all('div', class_='sh-dgr__content'):
        rating = review.find('div', class_='sh-dgr__rating')
        text = review.find('div', class_='sh-dgr__review-text')

        if rating and text:
            reviews.append({
                'rating': rating.text.strip(),
                'review': text.text.strip()
            })
    return reviews
data = extract_reviews(driver)
print(data)

Paso 3: Automatizar la paginación

Si hay varias páginas de reseñas, necesitamos automatizar la paginación.

Copy
def scrape_multiple_pages(driver):
    all_reviews = []
    while True:
        all_reviews.extend(extract_reviews(driver))

        try:
            next_button = driver.find_element(By.XPATH, '//a[@aria-label="Next page"]')
            next_button.click()
            time.sleep(2)  # Esperar a que se cargue la nueva página
        except:
            break
    return all_reviews
data = scrape_multiple_pages(driver)
print(f'Total Reviews Scraped: {len(data)}')

Paso 4: Guardar datos en CSV

Una vez que hayamos recopilado los datos, podemos guardarlos para un análisis posterior.

Copy
import pandas as pd

df = pd.DataFrame(data)
df.to_csv('google_reviews.csv', index=False)
print('Reviews saved to google_reviews.csv')

Comparación: Scrapeless vs. Selenium + BeautifulSoup para raspar reseñas de productos de Google


Aquí hay una tabla de comparación que destaca por qué Scrapeless es la mejor opción para raspar reseñas de productos de Google:

Aspecto Scrapeless 🚀 (Recomendado) Selenium + BeautifulSoup ⚙️ (Método tradicional)
Facilidad de uso No se requiere codificación, solo llamadas API Requiere escribir y mantener código Python
Medidas anti-raspado Mecanismos de derivación integrados Fácilmente detectado por Google, puede ser bloqueado
Velocidad Basado en la nube, raspado más rápido Se ejecuta localmente, más lento debido a las cargas de página
Costo de mantenimiento Sin mantenimiento, Scrapeless maneja las actualizaciones del sitio Se necesitan actualizaciones frecuentes del código para los cambios de página
Calidad de los datos Datos estructurados, salida JSON/CSV Requiere análisis manual de HTML, puede ser inconsistente
Rascado de varias páginas Maneja la paginación automáticamente Requiere codificación manual para la paginación
Configuración del entorno No se necesita software adicional, basado en API Requiere ChromeDriver y una configuración compleja

Conclusión


Scrapeless, Selenium y Scrapy son todas soluciones viables para raspar datos de reseñas de productos de Google, pero cada una tiene sus propias ventajas y desventajas:

  • Scrapeless es la opción más simple y eficiente, especialmente para escenarios en los que necesitas obtener datos estructurados rápidamente. Puede manejar automáticamente los mecanismos anti-rastreadores y la carga dinámica de contenido.
  • Selenium proporciona capacidades potentes de procesamiento de contenido dinámico, pero tiene un bajo rendimiento, altos costos de mantenimiento y es fácil de detectar.
  • Scrapy es un framework de rastreo eficiente que es adecuado para el rastreo de datos a gran escala, pero es difícil de manejar contenido dinámico y tiene una curva de aprendizaje pronunciada.

En general, si deseas obtener datos de reseñas de productos de Google de forma rápida, eficiente y estable, Scrapeless es la mejor opción. No solo simplifica el proceso de raspado, sino que también evita el trabajo complejo de desarrollo y mantenimiento. Al usar cualquier herramienta, asegúrate de cumplir con los Términos de servicio de Google para evitar riesgos legales innecesarios.

¿Listo para llevar tu raspado de datos al siguiente nivel?

¡No dejes que tu negocio se quede atrás! Regístrate en Scrapeless hoy y comienza a raspar reseñas de productos de Google sin esfuerzo. Con solo unas pocas llamadas API simples, puedes acceder a información valiosa para mejorar el desarrollo de tu producto y la participación del cliente. Además, Scrapeless no se limita solo a las reseñas: úsalo para recopilar datos en varias plataformas, analizar a la competencia, rastrear tendencias y mucho más.

Únete ahora y obtén 20,000 consultas gratuitas para explorar todas las funciones potentes que Scrapeless tiene para ofrecer. Ya sea que estés en comercio electrónico, marketing o investigación, Scrapeless es tu herramienta ideal para una extracción de datos eficiente, escalable y personalizable.

¡Regístrate ahora y observa la diferencia que hace para tu negocio!

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar