Volver al blog

Alimentando agentes de IA: desbloqueando datos de Amazon, Google y LLM con actores de Scraper API

Olivia Patel
Olivia Patel

Senior Cybersecurity Analyst

08-Jun-2026

Puntos clave:

  • Una solicitud HTTP por actor. La API de Scrapeless Scraper convierte un objetivo — un producto de Amazon, una búsqueda en Google, una respuesta de IA — en un único POST contra un actor llamado scraper.*. Sin navegador para manejar, sin analizador que mantener.
  • Dos endpoints, por familia de actores. Los actores de sitio y SERP (scraper.amazon, scraper.google.search, scraper.shopeev2) utilizan POST /api/v1/scraper/request y devuelven JSON parseado cuya forma exacta es específica del actor. Los actores de respuesta de IA (scraper.chatgpt, scraper.gemini, scraper.copilot, scraper.grok, scraper.perplexity, scraper.aimode) utilizan POST /api/v2/scraper/execute y devuelven un sobre { status, task_id, task_result }.
  • Un encabezado de autenticación en todas partes. Cada llamada lleva x-api-token: <tu clave>. Una clave de cuenta cubre cada actor.
  • Salida estructurada, no HTML sin procesar. Los actores de sitio devuelven JSON estructurado parseado — scraper.amazon incluye tanto un result parseado como el html renderizado, mientras que scraper.google.search devuelve los campos SERP en el nivel superior — y los actores v2 devuelven el cuerpo de la respuesta más citas y enlaces como campos JSON.
  • Asíncrono cuando una renderización es lenta. Algunos actores de sitio devuelven un taskId; lo envías, luego consultas GET /api/v1/scraper/result/{taskId} hasta que la carga útil esté lista.
  • Gratis para comenzar. Las nuevas cuentas de Scrapeless incluyen créditos gratuitos para la API de Scraper — regístrate en app.scrapeless.com.

Introducción: el modelo de actor

Un scraper tradicional es tres trabajos unidos: superar la capa anti-bot, renderizar la página y analizar los campos que deseas. La API de Scraper de Scrapeless colapsa los tres en una sola llamada. Nombras un actor — un extractor preconstruido para un objetivo específico — le das una entrada y obtienes datos estructurados de vuelta. La rotación de proxies, la renderización y el análisis se ejecutan del lado del servidor.

El catálogo de actores abarca tres grupos: comercio electrónico (scraper.amazon, scraper.shopeev2), búsqueda (scraper.google.search), y respuestas de IA (scraper.chatgpt, scraper.gemini, scraper.copilot, scraper.grok, scraper.perplexity, scraper.aimode). Esta guía cubre autenticación, las dos formas de solicitud, un ejemplo de trabajo de cada familia, el patrón asíncrono, y los errores que realmente verás.


Lo que puedes hacer con ello

  • Extraer datos de productos estructurados — título, precio, calificación, disponibilidad, ASIN — de una URL de mercado en una sola solicitud.
  • Leer una página de resultados de búsqueda como JSON en lugar de raspar el marcado SERP tú mismo.
  • Capturar una respuesta de IA con sus citas — el texto exacto que un modelo devolvió para un aviso, más las fuentes citadas, para seguimiento de visibilidad de GEO y marcas.
  • Ejecutarlo desde cualquier lugar — es HTTP simple, así que curl, Python requests, Node fetch, o cualquier lenguaje con un cliente HTTP funciona sin cambios.

Por qué la API de Scraper

  • Sin navegador, sin analizador que mantener. El actor renderiza y analiza del lado del servidor; recibes campos, no un DOM por caminar.
  • Una clave, una forma por familia. Un solo x-api-token autentica a cada actor, y cada familia devuelve un sobre consistente, por lo que un envoltorio de cliente escrito una vez se reutiliza en diferentes objetivos.
  • Salida y renderización residencial están integradas. El actor maneja la geo-ruta y la renderización de JavaScript; envías la entrada y lees el resultado.

Obtén tu clave API en el plan gratuito en app.scrapeless.com. La API de Scraper se encuentra junto a la API Universal de Scraping y Scraping Browser en el catálogo de precios.


Requisitos previos

  • Una cuenta de Scrapeless y clave API — regístrate en app.scrapeless.com.
  • curl para la prueba rápida, o Python 3.10+ / Node.js 18+ para los clientes a continuación.
  • Familiaridad básica con HTTP y JSON.

Almacena tu clave en el entorno para que nunca se incluya en el código:

bash Copy
export SCRAPELESS_API_KEY=tu_api_token_aqui

Las dos formas de solicitud

La API de Scraper tiene dos endpoints. Cuál utiliza un actor depende de lo que devuelve.

Familia Endpoint Actores Devuelve
Sitio / SERP POST https://api.scrapeless.com/api/v1/scraper/request scraper.amazon, scraper.google.search, scraper.shopeev2 JSON parseado específico del actor (por ejemplo, scraper.amazon{ html, metadata, result }; scraper.google.searchorganic_results, … en el nivel superior)
Respuestas de IA POST https://api.scrapeless.com/api/v2/scraper/execute scraper.chatgpt, scraper.gemini, scraper.copilot, scraper.grok, scraper.perplexity, scraper.aimode { estado, id_tarea, resultado_tarea }

Ambos toman un cuerpo JSON de { "actor": "<nombre>", "input": { … } } y el encabezado x-api-token. Los campos de input difieren por actor (ver cada ejemplo).


Ejemplo 1 — Producto de Amazon (v1)

bash Copy
curl -X POST https://api.scrapeless.com/api/v1/scraper/request \
  -H "Content-Type: application/json" \
  -H "x-api-token: $SCRAPELESS_API_KEY" \
  -d '{
    "actor": "scraper.amazon",
    "input": { "action": "producto", "url": "https://www.amazon.com/dp/B09B8V1LZ3" }
  }'

La respuesta contiene el html renderizado, un bloque de metadatos, y un objeto resultado parseado. El resultado es lo que la mayoría de las canalizaciones utilizan directamente:

json Copy
// resultado (abreviado) — el esquema es normativo, valores de una ejecución en vivo
{
  "asin": "B09B8V1LZ3",
  "titulo": "Amazon Echo Dot (modelo más nuevo) …",
  "precio_final": "$49.99",
  "disponibilidad": "En stock",
  "cantidad_resenas": "193514",
  "nombre_vendedor": "Amazon.com"
}

En Python:

python Copy
import os, requests

resp = requests.post(
    "https://api.scrapeless.com/api/v1/scraper/request",
    headers={"x-api-token": os.environ["SCRAPELESS_API_KEY"]},
    json={"actor": "scraper.amazon",
          "input": {"action": "producto", "url": "https://www.amazon.com/dp/B09B8V1LZ3"}},
    timeout=120,
)
resp.raise_for_status()
print(resp.json()["resultado"])   # objeto parseado; resp.json()["html"] es la página completa

scraper.google.search utiliza el mismo punto final v1 con la entrada { "q": "extracción de datos de la web" }, pero su SERP parseada regresa en el nivel superiorresultados_organicos, informacion_busqueda, paginacion, búsquedas_relacionadas — junto con metadatos, sin un envoltorio de resultado.


Ejemplo 2 — una respuesta de IA (v2)

Los actores de respuesta de IA toman un prompt y un país y devuelven la respuesta del modelo con sus citas:

bash Copy
curl -X POST https://api.scrapeless.com/api/v2/scraper/execute \
  -H "Content-Type: application/json" \
  -H "x-api-token: $SCRAPELESS_API_KEY" \
  -d '{
    "actor": "scraper.chatgpt",
    "input": { "prompt": "¿Cuáles son las mejores herramientas de extracción de datos de la web?", "country": "US" }
  }'

Cada llamada exitosa devuelve el mismo sobre:

json Copy
// el esquema es normativo, valores de una ejecución en vivo
{
  "estado": "éxito",
  "id_tarea": "…",
  "resultado_tarea": {
    "modelo": "gpt-5-5",
    "texto_respuesta": "…la respuesta del modelo…",
    "referencias_contenido": [ { "titulo": "…", "url": "https://…" } ],
    "enlaces": [ "https://…" ]
  }
}

resultado_tarea contiene la respuesta (texto_respuesta), las fuentes citadas (referencias_contenido), y los enlaces extraídos — el análisis de participación de citas es un campo leído, no un parseo.

Algunos de estos actores requieren un campo adicional, que la API menciona en su mensaje de validación si lo omites: scraper.copilot necesita "modo": "inteligente", scraper.grok necesita "modo": "MODELO_MODE_AUTO", y scraper.perplexity acepta "búsqueda_web": true para fundamentar la respuesta. scraper.gemini y scraper.aimode solo toman { prompt, country }.

Para obtener la lista completa de campos por actor, consulta la documentación del LLM Chat Scraper. Para una construcción práctica de extremo a extremo sobre uno de estos actores, la guía del scraper de vista general de Google AI describe la captura a nivel de citas.


Actores asíncronos: enviar, luego consultar

Algunos actores de sitios renderizan una página pesada y responden de manera asíncrona. El POST devuelve un taskId en lugar de la carga:

json Copy
{ "taskId": "ef2f7cef-…", "mensaje": "tarea en progreso" }

Consulta el punto final de resultados hasta que la tarea esté completa, luego lee la misma estructura de carga:

bash Copy
curl "https://api.scrapeless.com/api/v1/scraper/result/$TASK_ID" \
  -H "x-api-token: $SCRAPELESS_API_KEY"
# mientras aún se esté ejecutando: { "estado": "procesando", "taskId": "…" }

scraper.shopeev2 sigue este patrón. Envía una URL de producto de shopee.sg ({ "url": "https://shopee.sg/<nombre>-i.<shopid>.<itemid>" }), luego consulta hasta que llegue el JSON del producto. Las tiendas están restringidas por región, por lo que un dominio no soportado devuelve área no soportada.


Lo que obtienes de vuelta

Familia de actores Claves de nivel superior Dónde está el dato
Sitio / SERP (v1) específicas del actor (amazon: html, metadatos, resultado; google: resultados_organicos, … nivel superior) campos estructurados parseados; scraper.amazon también devuelve el html renderizado completo
Respuestas de IA (v2) estado, id_tarea, resultado_tarea resultado_tarea contiene el texto de respuesta, citas, y enlaces
Tratar campos ausentes como anulables: los módulos varían según el producto, consulta, región y modelo. Lee primero lo que el actor expone (result de scraper.amazon, los campos SERP de nivel superior de scraper.google.search, o task_result para los actores v2), y recurre a html de scraper.amazon solo cuando necesites un campo que el actor no analiza.

FAQ

P: ¿Cómo me autentico?

Cada solicitud lleva el encabezado x-api-token: <tu clave>. Una clave de cuenta funciona en todos los actores. Crea una clave en el plan gratuito en app.scrapeless.com.

P: ¿Qué endpoint utiliza un actor: v1 o v2?

Los actores de sitios y SERP (scraper.amazon, scraper.google.search, scraper.shopeev2) utilizan /api/v1/scraper/request. Los actores de respuestas de IA (scraper.chatgpt, scraper.gemini, scraper.copilot, scraper.grok, scraper.perplexity, scraper.aimode) utilizan /api/v2/scraper/execute.

P: ¿Cómo encuentro los campos de entrada requeridos de un actor?

Envía la solicitud; si falta un campo, la API responde con un mensaje de validación nombrándolo (por ejemplo, scraper.copilot informa que mode es requerido). La referencia por actor está en la documentación de la API de Scrapeless.

P: ¿Es legal raspar estos sitios?

Estos actores recopilan datos públicamente visibles. Las reglas varían según la jurisdicción y los términos de servicio de cada sitio, así que revisa los ToS relevantes y consulta a un abogado para tu caso de uso antes de operar a gran escala. Nunca recopiles datos personales protegidos bajo GDPR o CCPA.

P: ¿Necesito un proxy?

No. La salida residencial y el geo-enrutamiento están integrados en el actor: tú envías la entrada, el actor maneja la capa de red. Los destinos restringidos por región solo aceptan dominios de tiendas soportadas.

P: ¿Puedo ejecutar esto sin un agente de IA o SDK?

Sí. Es HTTP simple: curl, requests, fetch, o cualquier cliente HTTP funciona directamente. No se requiere SDK.


Conclusión

La API de Scraper reduce un raspado a una decisión y una solicitud: elige el actor, envía { actor, input } con tu x-api-token, y lee los campos estructurados de vuelta. Los actores de sitios y SERP responden en /api/v1/scraper/request con JSON analizado cuya forma es específica del actor; los actores de respuesta de IA responden en /api/v2/scraper/execute con un uniforme { status, task_id, task_result } envelope; las respuestas lentas se contestan de manera asincrónica a través de un taskId al que haces polling. Escribe el envoltorio del cliente una vez y dirígete al actor que la tubería necesita.

¿Listo para construir tu tubería de datos impulsada por IA?

Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que construyen tuberías de API de Scraper: Discord · Telegram.

Regístrate en app.scrapeless.com para obtener créditos de Scraper API gratuitos, y dirije un actor a los sitios, consultas o respuestas de IA que tu tubería necesite.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar