Volver al blog

Cómo usar Playwright Stealth para scraping

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

06-Nov-2025

infraestructura

  • Siempre actualizado con los últimos métodos de elusión de bots
  • Concédele foco a la lógica de tu negocio, no a la infraestructura

Monitoreo y Depuración en Vivo

  • Función de Sesión en Vivo para observar tu scraper en tiempo real
  • Reproducción de Sesiones para depurar solicitudes fallidas
  • Registros y análisis completos

Integrar Scrapeless con tu código existente de Playwright es increíblemente simple. Con solo unos pocos pasos, puedes eludir cualquier medida anti-bot y acceder a los datos que necesitas.

Paso 1: Regístrate y Obtén Tu Clave API

  1. Visita el Tablero de Scrapeless
  2. Regístrate para obtener una cuenta gratuita
  3. Navega a la pestaña de Configuraciones
  4. Copia tu Clave API

En lugar de lanzar un navegador local, conéctate al navegador en la nube de Scrapeless utilizando el protocolo CDP:

Antes (Playwright Estándar):

python Copy
browser = await p.chromium.launch(headless=True)

Después (Navegador de Scraping Scrapeless):

python Copy
from playwright.async_api import async_playwright

# Tu Clave API de Scrapeless
API_KEY = "tu_clave_api_aqui"

# Construye la URL de conexión de Scrapeless
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_ttl=180&proxy_country=ANY"

async with async_playwright() as p:
    # Conéctate al navegador en la nube de Scrapeless
    browser = await p.chromium.connect_over_cdp(connection_url)
    page = await browser.newPage()
    # Tu lógica de scraping aquí

Paso 3: Prueba en Sitios Protegidos

Intentemos hacer scraping en la misma página protegida por Cloudflare que bloqueó Playwright Stealth:

python Copy
from playwright.async_api import async_playwright
import asyncio

async def scraper():
    # Tu Clave API de Scrapeless
    API_KEY = "tu_clave_api_aqui"
    
    # URL de conexión de Scrapeless
    connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_ttl=180&proxy_country=ANY"
    
    async with async_playwright() as p:
        # Conéctate al navegador en la nube de Scrapeless
        browser = await p.chromium.connect_over_cdp(connection_url)
        page = await browser.new_page()
        
        # Accede al sitio protegido por Cloudflare
        await page.goto("https://www.scrapingcourse.com/antibot-challenge")
        
        # Extrae contenido
        content = await page.content()
        print(content)
        
        # Toma una captura de pantalla
        await page.screenshot(path="success_screenshot.png")
        
        await browser.close()

# ejecutar el scraper
if __name__ == "__main__":
    asyncio.run(scraper())

Resultado:

html Copy
<html lang="en">
<head>
    <title>Desafío Antibot - ScrapingCourse.com</title>
</head>
<body>
    <h2>
        ¡Eludiste el desafío Antibot! :D
    </h2>
    <!-- Contenido extraído con éxito -->
</body>
</html>

¡Felicidades! 🎉 Has eludido exitosamente la protección de Cloudflare con el Navegador de Scraping Scrapeless.


Opciones de Configuración Avanzada

El Navegador de Scraping Scrapeless ofrece amplias opciones de configuración para casos de uso avanzados:

Configuraciones de Proxy Personalizadas

python Copy
# Usa un proxy de un país específico
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&proxy_country=US&session_ttl=300"

# Usa tu propio proxy
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&proxy_url=http://tu-proxy.com:8080"

Gestión de Sesiones

python Copy
# Crea una sesión persistente
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_name=mi_sesion&session_ttl=600"

Habilitar Grabación de Sesiones para Depuración

python Copy
# Graba sesión para depuración
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_recording=true"

Huellas Dactilares Personalizadas

python Copy
# Usa huella dactilar de navegador personalizada
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&fingerprint=custom"

Para más opciones de configuración, visita la Documentación de Scrapeless.


Característica Playwright Stealth Navegador de Scraping Scrapeless
Complejidad de Configuración Media (requiere configuración) Simple (cambio de una línea)
Elusión de Anti-Bot Básica (falla en sistemas avanzados) Avanzada (99.9% de tasa de éxito)
Elusión de Cloudflare ❌ Falla ✅ Tiene éxito
Resolución de CAPTCHA ❌ Requiere manual ✅ Automático
Mantenimiento ❌ Necesita actualizaciones constantes ✅ Cero mantenimiento
Rotación de IP ❌ Se requiere DIY ✅ Integrado (más de 70M IPs)
Proxies Globales ❌ Se necesita servicio externo ✅ 195 países cubiertos
Rendimiento Local (depende del hardware) ⚡ 10x más rápido (basado en la nube)
Herramientas de Depuración ❌ Limitadas ✅ Sesión en Vivo + Reproducción
Escalabilidad ❌ Limitada por recursos locales ✅ Sesiones concurrentes ilimitadas
Costo Gratis (pero alto costo de infraestructura) Pago por uso (40-80% más barato)
Soporte Solo comunidad ✅ Soporte profesional

Casos de Uso en el Mundo Real

Scrapeless Scraping Browser sobresale en escenarios donde Playwright Stealth falla:

1. Monitoreo de Precios en E-commerce

  • Raspado de Amazon, Walmart, eBay sin bloqueos
  • Seguimiento de precios de competidores en tiempo real
  • Manejo de precios dinámicos y actualizaciones de inventario

2. Colección de Datos de Redes Sociales

  • Extracción de datos de Instagram, LinkedIn, Twitter
  • Eludir muros de inicio de sesión y límites de tasa
  • Mantener sesiones persistentes

3. Inteligencia en Viajes y Hospitalidad

  • Monitoreo de precios de vuelos, tarifas de hoteles
  • Acceso a contenido geo-restringido
  • Manejo de sitios de reservas pesados en JavaScript

4. Investigación de Mercado y Generación de Lead

  • Raspado de directorios y bases de datos B2B
  • Extracción de información de contacto a gran escala
  • Cumplimiento automático de límites de tasa

5. SEO y Análisis de Competencia

  • Seguimiento de clasificaciones de palabras clave a nivel global
  • Análisis de estrategias de competidores
  • Monitoreo de cambios en SERP en tiempo real

Precios y Optimización de Costos

Scrapeless Scraping Browser ofrece precios flexibles:

  • Nivel Gratuito: Perfecto para pruebas y pequeños proyectos
  • Pago Por Uso: Solo paga por lo que usa
  • Planes para Empresas: Soluciones personalizadas con garantías de SLA

Comparación de Costos:

  • Ejecutar Playwright localmente: $200-500/mes (costos del servidor + mantenimiento)
  • Usar Scrapeless: $50-150/mes (reducción de costos del 40-80%)

Además, se eliminan:

  • ❌ Costos de mantenimiento del servidor
  • ❌ Costos de gestión de proxies
  • ❌ Costos de servicio de resolución de CAPTCHA
  • ❌ Tiempo de desarrollador gastado en depuración

Mejores Prácticas

1. Respetar Límites de Tasa

Incluso con las poderosas capacidades de Scrapeless, siempre respete los límites de tasa de los sitios web de destino:

python Copy
import asyncio

async def scrape_with_delay(urls):
    for url in urls:
        await page.goto(url)
        # Extraer datos
        await asyncio.sleep(2)  # Retraso de 2 segundos entre solicitudes

2. Usar Persistencia de Sesión

Para sitios web que requieren inicio de sesión:

python Copy
# Crear sesión persistente
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_name=login_session&session_ttl=3600"

3. Habilitar Grabación de Sesiones para Depuración

Al desarrollar:

python Copy
# Habilitar grabación
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&session_recording=true"

Luego vea las repeticiones en el panel de Scrapeless para depurar fallos.

4. Optimizar Selección de Proxies

Elija proxies según su objetivo:

python Copy
# Contenido solo para EE. UU.
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&proxy_country=US"

# Raspado global
connection_url = f"wss://browser.scrapeless.com/browser?token={API_KEY}&proxy_country=ANY"

Conclusión

Si bien Playwright es una herramienta popular de navegación sin cabeza, sus propiedades predeterminadas la hacen fácilmente detectable por los sitios web de destino. Playwright Stealth ayuda a enmascarar algunas lagunas, pero no es suficiente ante sistemas avanzados anti-bots como Cloudflare, DataDome y AWS WAF.

Para extraer datos de manera fiable y a gran escala, recomendamos encarecidamente utilizar una solución empresarial como Scrapeless Scraping Browser.

¿Por qué Scrapeless?

Cero Cambios de Código: Un reemplazo de línea en sus scripts de Playwright existentes
Tasa de Éxito del 99.9%: Eludir cualquier sistema anti-bots, incluyendo Cloudflare
Resolución Automática de CAPTCHA: No se requiere intervención manual
Red Global de Proxies: Más de 70 millones de IPs residenciales en 195 países
Cero Mantenimiento: Concéntrese en la lógica de su negocio, no en la infraestructura
Económico: 40-80% más barato que las soluciones DIY
Soporte Profesional: Obtenga ayuda cuando la necesite

Pruebe Scrapeless Scraping Browser de Forma Gratuita – ¡Sin necesidad de tarjeta de crédito!


Preguntas Frecuentes

1. ¿Por qué usar Playwright Stealth?

Playwright Stealth ayuda a enmascarar las propiedades de automatización de Playwright para evitar la detección básica de bots. Es un buen punto de partida para tareas de raspado simples, pero tiene limitaciones contra sistemas avanzados anti-bots.

2. ¿Es Playwright Stealth indetectable?

No. Si bien Playwright Stealth puede eludir la detección básica de bots, falla contra sistemas avanzados anti-bots como Cloudflare, DataDome y AWS WAF. Para casos de uso en producción, recomendamos Scrapeless Scraping Browser.

3. ¿Cuál es la mejor manera de evitar la detección en Playwright?

La manera más fiable es utilizar un servicio de navegador en la nube profesional como Scrapeless Scraping Browser, que ofrece:

  • Tecnología anti-detección de nivel empresarial
  • Resolución automática de CAPTCHA
  • Rotación de proxies incorporada
  • Cero mantenimiento
  • Garantía de tiempo de actividad del 99.9%

4. ¿Puedo usar Scrapeless con mi código de Playwright existente?

¡Sí! Scrapeless requiere cambios mínimos en su código existente. Simplemente reemplace el lanzamiento del navegador con una conexión CDP al navegador en la nube de Scrapeless:

python Copy
# Antes
navegador = await p.chromium.launch(headless=True)

# Después
navegador = await p.chromium.connect_over_cdp(connection_url)

### 5. ¿Cuánto cuesta Scrapeless?

Scrapeless ofrece precios flexibles que incluyen un nivel gratuito para pruebas. Los planes de pago por uso comienzan desde solo unos pocos dólares al mes, lo que lo hace 40-80% más barato que operar tu propia infraestructura. [Consulta los precios actuales](https://www.scrapeless.com/pricing).

### 6. ¿Scrapeless es compatible con otros idiomas además de Python?

¡Sí! Scrapeless funciona con cualquier idioma que soporte Puppeteer, Playwright o el protocolo CDP, incluyendo:
- Python
- Node.js
- Java

### 7. ¿Puede Scrapeless manejar sitios web que requieren inicio de sesión?

¡Absolutamente! Scrapeless soporta sesiones persistentes, lo que te permite mantener estados de inicio de sesión a través de múltiples solicitudes. Usa el parámetro `session_name` para crear sesiones persistentes.

---

**¿Listo para llevar tu web scraping al siguiente nivel?**

[Comienza tu prueba gratuita](https://www.scrapeless.com/) | [Ver documentación](https://docs.scrapeless.com/) | [Únete a la comunidad de Discord](https://discord.gg/Np4CAHxB9a)

---

*Aviso: Esta guía es para fines educativos. Siempre respeta los términos de servicio de los sitios web y los archivos robots.txt. El web scraping solo debe realizarse en datos disponibles públicamente con la debida autorización.*

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar