Volver al blog

Cómo raspar respuestas de Grok con la API del raspador de Grok

Sophia Martinez
Sophia Martinez

Specialist in Anti-Bot Strategies

10-Jun-2026

Resumen

  • Una API de raspador Grok devuelve la respuesta de xAI junto con sus paneles de origen como datos. Una solicitud POST al actor scraper.grok captura la respuesta completa más web_search_results y x_search_results — las páginas de la web abierta y las publicaciones de X (Twitter) que Grok citó, como arreglos separados.
  • Tres entradas, una de ellas inusual. prompt contiene la pregunta, country fija la salida residencial y un mode de razonamiento requerido — MODEL_MODE_FAST, MODEL_MODE_EXPERT o MODEL_MODE_AUTO — controla cuán exhaustivamente Grok razona antes de responder.
  • Las citas de X son el diferenciador. Grok combina la búsqueda web en vivo con el feed en tiempo real de X; capturar solo el texto de la respuesta desperdicia la mitad de los datos que indica a quién acreditó.
  • El formato coincide con otros actores de LLM. { status, task_id, task_result }, un x-api-token, el mismo endpoint — un cliente de captura de ChatGPT se extiende a Grok cambiando el nombre del actor y añadiendo el mode.
  • Los metadatos de ejecución vienen gratis. Las sugerencias de seguimiento, notas al pie, conteos de tokens y los identificadores de conversación de la ejecución llegan en la misma carga útil, listas para auditorías.
  • Gratis para empezar. Las nuevas cuentas de Scrapeless incluyen créditos de prueba gratuitos — regístrate en app.scrapeless.com.

Introducción: el motor de respuestas con un feed social dentro

Grok responde preguntas combinando dos tipos de fuentes que ningún otro asistente importante combina: búsqueda web en vivo y publicaciones obtenidas directamente de X. Pregúntale qué herramienta comprar, qué API se sostiene, qué marca confiar, y la respuesta integra páginas web y publicaciones de X en una única respuesta citada. Para cualquiera que esté rastreando cómo aparece una marca en las respuestas de IA, eso hace de Grok una superficie distinta — las citas incluyen la conversación social, no solo la web indexada.

Capturar esas respuestas a mano es la historia habitual: una interfaz con inicio de sesión, salida en streaming, respuestas sensibles a la ubicación y un DOM que nunca fue diseñado para ser analizado. Y Grok agrega un giro propio — el modo de razonamiento cambia la respuesta, por lo que un pipeline de captura tiene que controlarlo explícitamente.

El actor scraper.grok convierte todo eso en una solicitud HTTP: prompt, país y modo como entrada; respuesta estructurada y ambos paneles de cita como salida. Esta guía cubre la estructura de la solicitud, el esquema de respuesta, un cliente de Python ejecutable y los actores complementarios que cubren el resto del paisaje de respuestas de IA. Para ver la vista clasificada de la categoría, consulta la guía de los mejores raspadores de LLM.

Lo Que Puedes Hacer Con Esto

  • Seguimiento de citas a través de dos paneles. Contar qué dominios aparecen en web_search_results y qué cuentas aparecen en x_search_results para un conjunto fijo de prompts a lo largo del tiempo.
  • Monitoreo de marcas donde X conduce la narrativa. Para categorías donde el sentimiento se forma en X primero, las citas de Grok muestran qué publicaciones están dando forma a las respuestas del modelo.
  • Comparación de modos de razonamiento. Captura el mismo prompt bajo FAST, EXPERT y AUTO y mide cómo la profundidad cambia la respuesta y las fuentes.
  • Captura en múltiples mercados. Fija ejecuciones por país y compara lo que Grok dice a diferentes mercados sobre la misma pregunta.
  • Análisis de respuestas competitivas. Rastrear cuándo Grok comienza o deja de recomendar un producto, y rastrear el cambio a las citas detrás de ello.
  • Construcción de conjuntos de datos. Almacena triples de prompt–respuesta–panel como JSON limpio para análisis longitudinal.

Por Qué el Raspador Grok de Scrapeless

El actor scraper.grok es parte de la familia de Raspadores de Chat LLM de Scrapeless dentro de la línea de API de Raspado Universal:

  • Ambos paneles de citas como arreglos discreto. Fuentes de la web abierta y publicaciones de X llegan por separado — un informe de share-of-citation lee cada panel directamente, sin reenfoque.
  • El modo de razonamiento es una entrada de primera clase. Tú decides cuán arduamente piensa Grok en cada ejecución, lo que mantiene una serie programada metodológicamente consistente.
  • Salida residencial fijada por país. Las ejecuciones pasan a través de proxies residenciales en más de 195 países, por lo que se pueden reproducir respuestas específicas a la localidad.
  • Un contrato a través de plataformas. El mismo endpoint, encabezado y { status, task_id, task_result } cubren los actores de ChatGPT, Gemini, Perplexity y Copilot.

La referencia de parámetros se encuentra en la documentación de Raspador de Chat LLM.

Requisitos Previos

  • Una cuenta de Scrapeless y una clave API — regístrate en app.scrapeless.com.
  • curl para la prueba rápida, o Python 3.10+ para el cliente a continuación.
  • Familiaridad básica con HTTP y JSON.
    Guarda tu clave en el entorno para que nunca termine en el código:
bash Copy
export SCRAPELESS_API_KEY=tu_token_api_aqui

Cómo funciona el Scraper de Grok

  • Endpoint: POST https://api.scrapeless.com/api/v2/scraper/execute
  • Actor: scraper.grok
  • Encabezado de autorización: x-api-token: $SCRAPELESS_API_KEY

Parámetros de la solicitud

campo de entrada requerido descripción
prompt la pregunta que se enviará a Grok
country código de país de dos letras para la salida residencial de la ejecución (por ejemplo, US; JP y TW no están disponibles)
mode profundidad de razonamiento: MODEL_MODE_FAST, MODEL_MODE_EXPERT o MODEL_MODE_AUTO

Captura rápida con curl

bash Copy
curl -sS -X POST https://api.scrapeless.com/api/v2/scraper/execute \
  -H "Content-Type: application/json" \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -d '{
    "actor": "scraper.grok",
    "input": {
      "prompt": "¿Qué API de scraping web maneja sitios con mucho JavaScript?",
      "country": "US",
      "mode": "MODEL_MODE_EXPERT"
    }
  }'

Sobre la respuesta

json Copy
// muestra ilustrativa — esquema de una ejecución en vivo de scraper.grok; valores abreviados
{
  "status": "success",
  "task_id": "52fc9c96-…",
  "task_result": {
    "user_query": "¿Qué API de scraping web maneja sitios con mucho JavaScript?",
    "full_response": "Para sitios con mucho JavaScript, las opciones que se mantienen son…",
    "web_search_results": [
      { "title": "…", "url": "https://…", "preview": "…", "description": "…", "favicon": "…", "image": "…" }
    ],
    "x_search_results": [],
    "follow_up_suggestions": [ "…" ],
    "footnotes": [],
    "tool_usages": [ "…" ],
    "token_count": 1024,
    "user_model": "…",
    "response_id": "…",
    "conversation": { "conversation_id": "…", "title": "…", "create_time": "…" }
  }
}

Campo por campo:

campo tipo lo que contiene
task_result.user_query cadena la pregunta tal como la recibió Grok
task_result.full_response cadena el texto completo de la respuesta de Grok
task_result.web_search_results[] arreglo citas de la web abierta — title, url, preview, más description, favicon y image cuando están presentes
task_result.x_search_results[] arreglo las publicaciones X citadas por Grok; vacío cuando la pregunta no obtuvo fuentes sociales
task_result.follow_up_suggestions[] arreglo las preguntas de seguimiento que Grok ofrece después de la respuesta
task_result.footnotes[] arreglo entradas de notas al pie, cuando la respuesta las contiene
task_result.tool_usages[] arreglo las herramientas que se invocaron en la ejecución (buscar, navegar)
task_result.token_count número el uso de tokens de la ejecución
task_result.conversation objeto identificadores de la ejecución — conversation_id, title, marcas de tiempo — útil como claves de auditoría

Obtén tu clave API en el plan gratuito: app.scrapeless.com

Integrando la API en Python

Un cliente completo: envía el prompt, verifica el sobre y muestra ambos paneles de citas.

python Copy
import os
import requests

ENDPOINT = "https://api.scrapeless.com/api/v2/scraper/execute"


def ask_grok(prompt: str, country: str = "US", mode: str = "MODEL_MODE_EXPERT") -> dict:
    resp = requests.post(
        ENDPOINT,
        headers={
            "Content-Type": "application/json",
            "x-api-token": os.environ["SCRAPELESS_API_KEY"],
        },
        json={
            "actor": "scraper.grok",
            "input": {"prompt": prompt, "country": country, "mode": mode},
        },
        timeout=300,
    )
    resp.raise_for_status()
    return resp.json()


if __name__ == "__main__":
    data = ask_grok("¿Qué API de scraping web maneja sitios con mucho JavaScript?")
    result = data.get("task_result", {})
    web = result.get("web_search_results") or []
    x = result.get("x_search_results") or []
    print(f"status={data.get('status')} web_sources={len(web)} x_sources={len(x)}")
    for i, src in enumerate(web[:5], 1):
        print(f"  [web {i}] {src.get('title', '')[:60]} → {src.get('url', '')[:60]}")
    for i, post in enumerate(x[:5], 1):
        print(f"  [x {i}] {str(post)[:80]}")

Para el trabajo de participación de citas, agrupa los URLs de web_search_results por dominio y x_search_results por cuenta, y cuenta por prompt — los dos paneles son señales independientes y vale la pena graficarlas por separado.

Elegir el modo de razonamiento

El mode requerido es la entrada que no tiene un equivalente en ChatGPT, y cambia tanto la latencia como la salida:

  • MODEL_MODE_FAST — respuestas más rápidas; adecuado para barridos de alto volumen donde la amplitud supera la profundidad.
  • MODEL_MODE_EXPERT — razonamiento más profundo y típicamente fuentes más ricas; adecuado para los prompts que se registran a lo largo del tiempo. Permitir ejecuciones más largas.
  • MODEL_MODE_AUTO — Grok elige por prompt; conveniente de forma interactiva, pero una serie programada es más fácil de interpretar cuando el modo se mantiene constante.
    Cualquiera que elijas, guárdalo con cada captura; comparar una ejecución de EXPERT con una de FAST es comparar dos procesos diferentes.

Actores compañeros para el resto del paisaje de respuestas de IA

El endpoint, el encabezado y el sobre permanecen iguales en toda la familia; solo cambian el nombre del actor y las entradas específicas de la plataforma:

  • scraper.chatgptprompt + country opcional; devuelve result_text con citas de content_references.
  • scraper.gemini — misma entrada de dos campos; devuelve result_text más un array de citations.
  • scraper.perplexitycountry requerido y un flag de web_search; devuelve web_results, media_items, y prompts relacionados.
  • scraper.copilot — la superficie de respuesta de Copilot bajo el mismo contrato.
  • scraper.overview / scraper.aimode — bloque de AI Overview de Google y pestaña AI Mode; cubierto de principio a fin en la guía de AI Overview.

La fijación de precios para la línea es basada en uso con créditos de prueba gratuitos al registrarse; los niveles actuales están en la página de precios.

Cómo evitar problemas comunes

  • Un x_search_results vacío es normal para muchos prompts. Las preguntas técnicas y de producto a menudo se resuelven completamente a partir de la web abierta. Los prompts sobre personas, eventos y sentimiento son los que extraen publicaciones de X; formula las frases adecuadamente cuando el panel de X es el objetivo.
  • Los tamaños de panel varían de ejecución a ejecución. El mismo prompt puede citar 35 fuentes web en una ejecución y 20 en la siguiente. Guarda cada captura con su conversation_id y lee la serie, no una sola ejecución.
  • Mantén el modo constante en una serie. El modo cambia el proceso de razonamiento; mezclar modos dentro de un conjunto de prompts rastreados hace que las líneas de tendencia sean inaprehensibles.
  • Trata los campos como anulables. footnotes a menudo está vacío, las entradas de fuente web solo llevan description/image algunas veces, y x_search_results puede ser []; lee lo que está presente.
  • Ten en cuenta la lista de países. country es requerido y JP/TW no están disponibles; elige los mercados sobre los que reportas y mantenlos fijos por serie.

Conclusión: ambos paneles, una solicitud

Capturar Grok se reduce a una llamada: POST { actor: "scraper.grok", input: { prompt, country, mode } } con tu x-api-token, lee full_response para la respuesta, y grafica web_search_results y x_search_results como señales de citas separadas. Mantén el modo constante, fija el país, guarda el conversation_id, y el mismo cliente escala de un prompt a un programa de monitoreo multi-mercado programado.

Preguntas frecuentes

P: ¿Es legal extraer respuestas de Grok?

El actor captura contenido de respuesta públicamente accesible. Las reglas varían según la jurisdicción y los términos del servicio de la plataforma; revisa los Términos de Servicio relevantes y consulta con un abogado para tu caso de uso, especialmente antes de redistribuir capturas. Nunca recojas datos personales protegidos bajo GDPR o CCPA.

P: ¿Cómo me autentico?

Cada solicitud lleva x-api-token: <tu clave>. Una clave de cuenta cubre scraper.grok y cada otro actor de Scrapeless. Crea una clave en el plan gratuito en app.scrapeless.com.

P: ¿Necesito un proxy?

No. La salida residencial y el geo-enrutamiento están integrados en el actor; la entrada de country requerida es toda la configuración.

P: ¿Por qué es requerido mode?

La profundidad de razonamiento de Grok cambia materialmente la respuesta, por lo que el actor lo hace explícito en lugar de establecer un valor por defecto silenciosamente. En código, los valores son los enums de la API — MODEL_MODE_FAST, MODEL_MODE_EXPERT, MODEL_MODE_AUTO.

P: ¿Cómo separo las citas web de las citas de X?

Ya llegan separadas: web_search_results contiene las páginas de la web abierta, x_search_results contiene las publicaciones de X. Lee cada array directamente.

P: ¿Puedo ejecutar esto sin un SDK o agente de IA?

Sí. Es HTTP puro: curl, Python requests, Node fetch, o cualquier cliente HTTP funciona directamente contra POST /api/v2/scraper/execute.

P: ¿Funciona mi código de captura de ChatGPT para Grok?

La autenticación, el endpoint y el sobre son idénticos. Cambia el nombre del actor, agrega el mode y country requeridos, y mapea las claves task_result (full_response en lugar de result_text, los dos paneles en lugar de content_references).

¿Listo para construir tu pipeline de datos de respuestas de IA?

Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que construyen pipelines de respuestas de IA: Discord · Telegram.

Regístrate en app.scrapeless.com para créditos de prueba gratuitos, y dirige al actor scraper.grok a los prompts, modos y mercados que tu programa de monitoreo necesita.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar