Cómo configurar un proxy de Crawlee en 2026
Specialist in Anti-Bot Strategies
Configura proxies residenciales premium en Crawlee para evitar bloqueos de IP y escalar tus operaciones de web scraping de manera confiable en cualquier sitio web objetivo.
Puntos clave
- Crawlee es un marco moderno de web scraping construido sobre Puppeteer/Playwright para sitios con mucho JavaScript
- Los proxies gratuitos son poco fiables y son bloqueados activamente por sistemas anti-scraping
- Los proxies residenciales premium proporcionan IPs asignadas por ISP legítimos que evitan la mayoría de los mecanismos de bloqueo
- La autenticación del proxy requiere credenciales de nombre de usuario y contraseña incrustadas en las cadenas de conexión
- Una configuración adecuada del proxy permite un scraping a gran escala sin bloqueos de IP ni tiempos de espera en las solicitudes
Entendiendo Crawlee
Crawlee es un marco de web scraping que simplifica los flujos de trabajo de rastreo y scraping. Construido sobre tecnologías de navegador sin cabeza como Puppeteer (Node.js) y Playwright (Python), Crawlee maneja la automatización del navegador, la gestión de sesiones y el almacenamiento de resultados. A diferencia de las bibliotecas HTTP más simples, Crawlee ejecuta JavaScript, gestiona cookies e interactúa con contenido dinámico, lo cual es crucial para sitios web modernos que renderizan contenido del lado del cliente.
Sin embargo, los sitios web detectan y bloquean el comportamiento predeterminado de Crawlee a través de varios mecanismos. El agente de usuario estándar identifica los scripts de Crawlee para los sistemas anti-bot. Las solicitudes desde direcciones IP de centro de datos generan sospechas. La limitación de tasa se activa cuando Crawlee realiza solicitudes rápidamente consecutivas. Los proxies resuelven estos problemas distribuyendo solicitudes a través de IPs residenciales legítimas y ocultando el verdadero origen de la solicitud.
Limitaciones de los proxies gratuitos
Los proxies gratuitos listados en bases de datos públicas parecen atractivos para desarrolladores que buscan ahorrar costos. Sin embargo, introducen desventajas significativas:
Disponibilidad poco confiable: Los proxies gratuitos desaparecen con frecuencia o se vuelven inaccesibles, interrumpiendo a los scrapers en medio de la operación
Rendimiento lento: Los proxies gratuitos dirigen el tráfico a través de múltiples servidores intermedios, introduciendo latencia que ralentiza la recopilación de datos
Altas tasas de bloqueo: Los sitios web mantienen listas de bloqueo de IPs de proxies gratuitos conocidos, haciéndolos ineficaces para scraping serio
Preocupaciones de seguridad: Los operadores de proxies gratuitos no pueden garantizar operaciones legítimas; algunos interceptan tráfico o inyectan malware
Sin soporte: Los servicios de proxy gratuitos no ofrecen soporte al cliente cuando surgen problemas
Los proxies premium económicos como Scrapeless Residential Proxies que comienzan en $0.40/GB superan drásticamente a las alternativas gratuitas a pesar de las mínimas diferencias de costo.
Beneficios de los proxies premium
Los proxies residenciales premium proporcionan ventajas legítimas para las operaciones de Crawlee:
IPS residenciales reales: Los proxies utilizan direcciones IP asignadas por los ISP a usuarios de internet domésticos reales, haciéndolos indistinguibles del tráfico genuino
Rotación de IP: Algoritmos de asignación inteligentes ciclan automáticamente a través de direcciones diversas, previniendo la acumulación de patrones sospechosos por IP
Segmentación geográfica: Selecciona ubicaciones de proxies que coincidan con las expectativas geográficas de tu sitio web objetivo
Alta disponibilidad: Los proveedores profesionales garantizan más del 99.9% de disponibilidad con protecciones SLA
Enrutamiento inteligente: Detección automática y evitación de conexiones lentas o bloqueadas
Estas capacidades transforman Crawlee de una herramienta que requiere una gestión manual extensa en una plataforma de scraping de grado de producción.
Configuración básica del proxy en Crawlee
Crawlee admite proxies a través de objetos de configuración pasados a instancias de crawlers. La estructura básica requiere una URL de proxy con autenticación:
javascript
import { CheerioCrawler } from 'crawlee';
const crawler = new CheerioCrawler({
proxyUrls: [
'http://username:password@proxy.example.com:8080'
]
});
await crawler.addRequests([
{ url: 'https://example.com/page1' },
{ url: 'https://example.com/page2' }
]);
await crawler.run();
El formato de URL de proxy sigue el patrón estándar: protocol://[username:password@]host[:port]
Configuración de proxies residenciales Scrapeless
Scrapeless Residential Proxies se integran sin problemas con Crawlee a través de una configuración sencilla. Accede a tu panel de cuenta para obtener credenciales de proxy generadas automáticamente:
Paso 1: Acceder al Generador de Proxies
Inicie sesión en su cuenta de Scrapeless y navegue hasta el panel de control del Generador de Proxies. Sus credenciales de proxy residencial autogeneradas aparecen en la parte superior de la página.
Paso 2: Configurar Credenciales
Establezca su nombre de usuario y contraseña a través de la interfaz de gestión de credenciales. Scrapeless admite múltiples conjuntos de credenciales para diferentes aplicaciones.
Paso 3: Formatear URL de Proxy
Combine sus credenciales y el punto final del proxy en una URL de proxy válida:
http://usuario:contraseña@superproxy.scrapeless.com:1337
Scrapeless proporciona puntos finales separados para tráfico HTTP (puerto 1337) y HTTPS (puerto 1338).
Paso 4: Integrar con Crawlee
Aplique la URL de proxy a su configuración de Crawlee:
javascript
import { PuppeteerCrawler } from 'crawlee';
const proxyUrl = 'http://usuario:contraseña@superproxy.scrapeless.com:1337';
const crawler = new PuppeteerCrawler({
proxyUrls: [proxyUrl],
useSessionPool: true
});
await crawler.addRequests([
{ url: 'https://sitio-web-destino.com' }
]);
await crawler.run();
Configuración Avanzada de Proxy
Múltiples URLs de Proxy: Crawlee acepta arreglos de URLs de proxy, distribuyendo automáticamente las solicitudes a través de múltiples proxies:
javascript
const crawler = new PuppeteerCrawler({
proxyUrls: [
'http://usuario1:contraseña1@proxy1.scrapeless.com:1337',
'http://usuario2:contraseña2@proxy2.scrapeless.com:1337',
'http://usuario3:contraseña3@proxy3.scrapeless.com:1337'
]
});
Selección Dinámica de Proxy: Para operaciones de scraping complejas, Scrapeless proporciona selección de proxy inteligente que optimiza la asignación de IP según las características del sitio web objetivo.
Segmentación Geográfica: Especifique la geolocalización del proxy a través de parámetros de URL:
javascript
const proxyUrl = 'http://usuario:contraseña@superproxy.scrapeless.com:1337?country=US&state=NY';
Este parámetro obliga a todas las solicitudes a través de proxies en Nueva York, asegurando respuestas apropiadas para la localidad.
Manejo de Autenticación y Sesiones
Algunos sitios web requieren credenciales de inicio de sesión. Crawlee maneja la autenticación a través de la gestión de sesiones. Cuando se combina con rotación de proxies, las sesiones mantienen el estado de inicio de sesión a lo largo de solicitudes desde diferentes IPs:
javascript
import { PuppeteerCrawler } from 'crawlee';
const crawler = new PuppeteerCrawler({
proxyUrls: ['http://usuario:contraseña@superproxy.scrapeless.com:1337'],
useSessionPool: true,
sessionPoolOptions: {
maxPoolSize: 50
}
});
crawler.addPostResponseHandler(async ({ page, session }) => {
// Cada sesión mantiene sus propias cookies y estado de autenticación
if (session.isValid) {
// Procesar página autenticada
}
});
El pool de sesiones de Crawlee aísla las cookies y el estado por sesión, asegurando que la rotación de IPs no interrumpa la autenticación.
Evitar Problemas Comunes con Proxies
Timeouts de Proxy: Si las solicitudes frecuentemente caducan, aumente los valores de timeout:
javascript
const crawler = new PuppeteerCrawler({
navigationTimeoutSecs: 30,
proxyUrls: [proxyUrl]
});
Conexión Rechazada: Verifique que las credenciales coincidan con los requisitos de su proveedor de proxy. Errores tipográficos o de formato causan fallos de conexión inmediatos.
Limitación de Tasa a Pesar de los Proxies: Incluso con rotación de proxies, tasas de solicitud excesivas activan bloqueos. Implemente retrasos en las solicitudes:
javascript
const crawler = new PuppeteerCrawler({
proxyUrls: [proxyUrl],
handlePageTimeoutSecs: 60,
preNavigationHooks: [
async ({ request }) => {
await page.waitForTimeout(Math.random() * 3000)
}
]
});
Proxies Bloqueados: Si los proxies individuales de Scrapeless son bloqueados, el servicio rota automáticamente a diferentes direcciones. Contacte al soporte si los bloqueos persisten.
Solución Integral: Navegador Scrapeless
Para máxima fiabilidad, Navegador Scrapeless proporciona un reemplazo directo para Puppeteer con rotación automática de proxy, renderizado de JavaScript y elusión de anti-bots:
El navegador maneja la configuración de proxy automáticamente, eliminando la configuración manual mientras permite tasas de éxito superiores contra sitios web protegidos.
Probar tu Configuración
Verifique la configuración del proxy comprobando las direcciones IP devueltas:
javascript
const { PuppeteerCrawler } = require('crawlee');
const crawler = new PuppeteerCrawler({
proxyUrls: ['http://user:pass@superproxy.scrapeless.com:1337']
});
crawler.addPostResponseHandler(async ({ page }) => {
const ipInfo = await page.evaluate(() => {
return fetch('https://httpbin.io/ip').then(r => r.json());
});
console.log('IP de la solicitud:', ipInfo.origin);
});
## Optimización del rendimiento
Los proxies configurados adecuadamente permiten un raspado de alto rendimiento:
- **Concurrente**: Realiza más de 50 solicitudes paralelas al utilizar rotación de proxies
- **Velocidad**: Las solicitudes promedian de 1 a 2 segundos con proxies premium frente a 5 a 10 segundos con proxies gratuitos
- **Fiabilidad**: Tasas de éxito del 99%+ frente al 50-70% para proxies gratuitos o gestión manual de proxies
Estas mejoras se traducen directamente en una recolección de datos más rápida y costos operativos más bajos a pesar de los gastos de proxy.
---
## Preguntas Frecuentes
**P: ¿Necesito diferentes credenciales de proxy para cada instancia de Crawlee?**
R: No. Credenciales de proxy únicas funcionan en ilimitadas instancias de Crawlee. Sin embargo, ejecutar múltiples raspadores a gran escala simultáneamente puede beneficiarse de credenciales separadas que permiten la gestión independiente del límite de tasa.
**P: ¿Puedo mezclar proxies de Scrapeless con otros proveedores de proxies?**
R: Sí. Crawlee acepta arreglos de diversas URL de proxies, distribuyendo automáticamente las solicitudes. Sin embargo, gestionar múltiples proveedores aumenta la complejidad. Las soluciones de un solo proveedor suelen resultar más confiables.
**P: ¿Qué debo hacer si un proxy se bloquea permanentemente?**
R: Proveedores premium como Scrapeless rotan automáticamente los IPs bloqueados. Si los problemas persisten, contacta al soporte; a menudo excluyen dominios específicos o ajustan el enrutamiento para resolver bloqueos.
**P: ¿Cuántas solicitudes concurrentes pueden manejar los proxies de Scrapeless?**
R: La infraestructura de Scrapeless soporta miles de solicitudes concurrentes. Límite la concurrencia según la tolerancia del sitio web objetivo en lugar de la capacidad del proxy. Prueba gradualmente de 10 concurrentes a más de 100.
**P: ¿Es automática o manual la rotación de proxies en Crawlee?**
R: Crawlee maneja la rotación automáticamente cuando se le proporcionan múltiples URL de proxies. El marco distribuye solicitudes entre proxies sin intervención del desarrollador, simplificando las operaciones a gran escala.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



