¿Cómo desbloquear el CAPTCHA de imageToText en Scrapeless?
Specialist in Anti-Bot Strategies
Estamos muy emocionados de anunciar que Scrapeless Browser ha lanzado oficialmente la función imageToText, que admite el reconocimiento automático y el llenado del contenido de Captcha de imagen a través del CDP.
El reconocimiento de Captcha siempre ha sido un punto problemático en la automatización web, y la complejidad de los Captchas de imagen ha sido particularmente frustrante para muchos desarrolladores.
Con el lanzamiento de la función imageToText, Scrapeless elimina la necesidad de servicios de OCR de terceros adicionales e intervención manual; todo se puede automatizar con una única interfaz de API para reconocimiento e input.
Características Destacadas
- Nuevo Lanzamiento: El comando CDP
Captcha.imageToText. Soporta de manera nativa el reconocimiento de Captcha de imagen y llena automáticamente los campos de entrada especificados con los resultados, todo en solo unos segundos. - Doble Compatibilidad con Puppeteer y Playwright: Con el SDK de Scrapeless, esta función se puede invocar fácilmente en ambos marcos de navegador sin cabeza más utilizados, soportando una gama más amplia de escenarios de desarrollo.
- Sin Necesidad de Descargas de Imagen o Integración de Servicios Externos: El motor de reconocimiento integrado se ejecuta directamente a través del CDP, lo que lo hace adecuado para cualquier entorno de implementación.
Casos de Uso
- Manejo automático de Captcha de imagen al construir agentes de IA.
- Encontrar comúnmente protección de página de producto durante la recopilación de datos en sitios web de comercio electrónico.
- Verificación de imagen para formularios de inicio de sesión, procesos de registro y puntos de entrada para crawlers.
- Los servicios de datos a nivel empresarial requieren soluciones escalables para eludir sistemas de verificación de imagen.
¿Cómo Integrar la Decodificación de imageToText?
Es muy simple llamar a Puppeteer; solo necesitas añadir el siguiente código a tu programa existente:
JavaScript
const client = await page.createCDPSession();
await client.send("Captcha.imageToText", {
imageSelector: '.captcha__image',
inputSelector: 'input[name="captcha"]',
timeout: 30000,
})
También, soportamos playwright:
JavaScript
await page.goto("https://www.scrapeless.com", timeout=60000, wait_until="load")
client = await page.target.createCDPSession()
await client.send('Captcha.imageToText', {
'imageSelector': '.captcha__image',
'inputSelector': 'input[name="captcha"]',
'timeout': 30000,
})
Además, integrar el SDK de Scrapeless invocará automáticamente el comando Captcha.imageToText, completando el proceso de reconocimiento e input de la imagen a través del Protocolo DevTools. Los desarrolladores no necesitan ninguna configuración de OCR o integración de plataformas de terceros; ¡está listo para usar con solo un clic!
JavaScript
const { Puppeteer, createPuppeteerCDPSession } = require('@scrapeless-ai/sdk');
const browser = await Puppeteer.connect({
session_name: 'sdk_test',
session_ttl: 180,
proxy_country: 'US',
session_recording: true,
defaultViewport: null
});
const page = await browser.newPage();
await page.goto('https://www.example.com');
const cdpSession = await createPuppeteerCDPSession(page);
await cdpSession.imageToText({
imageSelector: '.captcha__image',
inputSelector: 'input[name="captcha"]',
timeout: 30000,
})
¡Verifique Nuestro Ejemplo de Uso!
Para entender mejor los pasos de implementación de esta función, tomemos el ejemplo de acceso a: interception1.web.de.
Protegeremos firmemente la privacidad del sitio web. Todos los datos en este blog son públicos y se utilizan solo como demostración del proceso de crawling. No guardamos ninguna información ni datos.
- Usando Tutorial:

- Requisito Previo
Inicie sesión en el Panel de Control de Scrapeless y obtenga la API Key

- El código de acceso completo es el siguiente. Recuerde reemplazar su clave API y la URL de destino.
JavaScript
import puppeteer from "puppeteer-core"
const query = new URLSearchParams({
token: "YOUR_TOKEN",
proxy_country: "ANY",
session_recording: true,
session_ttl: 900,
session_name: "Default Script",
defaultViewport: null,
})
const connectionURL = `wss://browser.scrapeless.com/browser?${query.toString()}`
const browser = await puppeteer.connect({
browserWSEndpoint: connectionURL,
defaultViewport: null,
})
const page = await browser.newPage()
// ir a su sitio web de destino
await page.goto(
"https://interception1.web.de/logininterceptionfrontend/?interceptiontype=VerifyLogin&interceptiontype=VerifyLogin&service=freemail",
{
timeout: 30000,
}
);
// Creando sesión CDP
const client = await page.createCDPSession();
// Resolver captcha de imagen
await client.send("Captcha.imageToText", {
imageSelector: ".captcha__image", // Selector de captcha de imagen
inputSelector: 'input[name="captchaPanel:captchaImagePanel:captchaInput:topWrapper:inputWrapper:input"', // Selector de entrada de resultado
timeout: 30000,
});
Además, también puedes eludir los Captchas integrando el SDK de Scrapeless. Aquí tienes nuestro código de referencia:
```JavaScript
import { Puppeteer, createPuppeteerCDPSession } from '@scrapeless-ai/sdk';
async function runExample() {
console.log('Creando una instancia del navegador Puppeteer...');
const browser = await Puppeteer.connect({
session_name: 'cdp-example-session',
session_ttl: 300,
proxy_country: 'US'
});
const page = await browser.newPage();
console.log('Creando una sesión CDP mejorada por Scrapeless...');
const cdpSession = await createPuppeteerCDPSession(page);
console.log('Navegando a la página de inicio de sesión...');
await page.goto('https://interception1.web.de/logininterceptionfrontend/?interceptiontype=VerifyLogin&interceptiontype=VerifyLogin&service=freemail');
await cdpSession.imageToText({
imageSelector: ".captcha__image", // Selector de captcha de imagen
inputSelector: 'input[name="captchaPanel:captchaImagePanel:captchaInput:topWrapper:inputWrapper:input"', // Selector de entrada de resultado
timeout: 30000,
});
await cdpSession.waitCaptchaDetected();
await page.screenshot({ path: 'captcha-screenshot.png' });
}
runExample();
Conclusiones
La función imageToText lanzada por Scrapeless Browser es una actualización importante para abordar los desafíos de los Captchas de imagen. Integra el reconocimiento de imágenes como una capacidad nativa del SDK de Scrapeless, proporcionando una experiencia verdaderamente fluida para los procesos de automatización.
Comienza a usar el SDK de Scrapeless ahora para aprovechar esta nueva función, haciendo que las tareas de procesamiento de Captcha sean más eficientes y sin esfuerzo.
Referencia de documentación: API CDP - imageToText
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



