Volver al blog

API de Scraper de Gemini: Captura las Respuestas de Google Gemini como Datos

Isabella Garcia
Isabella Garcia

Web Data Collection Specialist

08-Jul-2026

TL;DR:

  • El Gemini Scraper captura la respuesta de Google Gemini como datos estructurados. Envía un prompt a scraper.gemini; recibe el texto de la respuesta más las citas en las que se basó Gemini.
  • Es un flujo asíncrono de dos llamadas. Haz un POST del prompt para crear una tarea, luego obtén el resultado por task_id — en una ejecución en vivo, la respuesta llegó en aproximadamente 12 segundos.
  • Las citas vienen estructuradas, no raspadas de HTML. Cada una lleva title, url, website_name, snippet, favicon y los pasajes destacados que utilizó Gemini.
  • Localiza con un código de país. El campo country da forma a la respuesta a una región, de la misma manera en que un usuario allí la vería.
  • Así es como monitoreas la visibilidad de marca en las respuestas de IA. Pregunta a Gemini las preguntas que tus clientes hacen y lee qué fuentes cita.
  • Gratis para comenzar. Las nuevas cuentas de Scrapeless incluyen uso gratuito de la API de Scraper — regístrate en app.scrapeless.com.

Introducción: lee lo que Gemini responde realmente

Los motores de respuesta de IA ahora se sitúan entre los usuarios y la web abierta. Cuando alguien le pregunta a Google Gemini por "el mejor servicio de proxy" o "cosas que hacer en Nueva York", la respuesta — y las fuentes que cita — moldean lo que ese usuario cree antes de hacer clic en algo. Para el monitoreo de marca, la investigación competitiva y la optimización del motor de respuestas, la pregunta ya no es "¿dónde me clasifico en Google?" sino "¿qué dice Gemini y a quién cita?"

El Scrapeless Gemini Scraper responde eso programáticamente. Envías un prompt al actor scraper.gemini y obtienes de vuelta el texto de la respuesta más las citas estructuradas detrás de ella. Esta guía cubre la forma de la solicitud, un primer curl, el esquema de respuesta, una integración en Python y cómo usarlo — cada solicitud y respuesta a continuación se capturó contra la API en vivo.


Lo que puedes hacer con ello

  • Captura el texto de la respuesta de Gemini — la respuesta completa como Markdown estilo CommonMark, lista para almacenar o analizar.
  • Lee las citas — las fuentes sobre las que Gemini fundamentó la respuesta, cada una con título, URL y el pasaje utilizado.
  • Rastrea menciones de marca en respuestas de IA — haz las preguntas que tus compradores hacen y verifica si apareces.
  • Localiza por región — establece country para ver la respuesta como un usuario en ese mercado lo haría.
  • Alimenta un pipeline de monitoreo — ejecuta los mismos prompts en un horario y compara las fuentes a lo largo del tiempo.

Por qué el Scrapeless Gemini Scraper

El Gemini Scraper es parte de la línea de Scrapeless LLM Chat Scraper, la forma gestionada de leer respuestas de motores de IA como datos. Para Gemini específicamente, aporta:

  • Un solo contrato de solicitud — envía un prompt, recibe la respuesta y sus citas; sin navegador que manejar.
  • Citas estructuradas — las fuentes regresan como campos, no como marcado que tienes que analizar.
  • Proxies residenciales en más de 195 países — las respuestas se obtienen a través de una salida limpia y apropiada para la región.
  • Localización por país — un campo da forma a la respuesta para un mercado.

Obtén tu clave de API en el plan gratuito en app.scrapeless.com.


Requisitos previos

  • Una cuenta de Scrapeless y clave de API — regístrate en app.scrapeless.com
  • curl para la primera solicitud, y Python 3.10+ para la integración
  • Familiaridad básica con HTTP y JSON

Cómo funciona el Gemini Scraper

El flujo son dos llamadas: crea una tarea, luego busca su resultado.

Parámetros de la solicitud

Campo Dónde Significado
actor nivel superior scraper.gemini
input.prompt entrada la pregunta para hacerle a Gemini
input.country entrada código de país ISO para localizar la respuesta

La autenticación es el encabezado x-api-token en ambas llamadas.

Captura rápida con curl

Crea la tarea:

bash Copy
curl -X POST https://api.scrapeless.com/api/v2/scraper/request \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "actor": "scraper.gemini",
    "input": { "prompt": "Atracciones recomendadas en Nueva York", "country": "US" }
  }'
# { "status": "pending", "task_id": "3886db31-…" }

Luego obtén el resultado por task_id:

bash Copy
curl -X GET https://api.scrapeless.com/api/v2/scraper/result/{task_id} \
  -H "x-api-token: ${SCRAPELESS_API_KEY}"

Contenido de respuesta

Una vez que status es success, la respuesta y las citas están en task_result:

json Copy
// muestra ilustrativa — la forma del campo es exacta (capturada en vivo); valores abreviados
{
  "status": "success",
  "task_result": {
    "prompt": "Atracciones recomendadas en Nueva York",
    "result_text": "La ciudad de Nueva York es un hermoso caos de cultura, historia…",
    "citations": [
      {
        "title": "20 Mejores Cosas que Hacer en NYC",
        "url": "https://example.com/nyc",
        "website_name": "Ejemplo Travel",
        "snippet": "Desde la Estatua de la Libertad hasta…",
        "favicon": "https://example.com/favicon.ico",
        "highlights": ["Estatua de la Libertad", "Central Park"]
      }
    ]
  }
}
Copy
En una ejecución en vivo, esto se devolvió en aproximadamente 12 segundos con 15 citas, cada una llevando los seis campos anteriores.

---

## Integrando la API en Python

Crea la tarea, consulta hasta que esté terminada y lee la respuesta:

```python
import os
import time
import requests

API_KEY = os.environ["SCRAPELESS_API_KEY"]
BASE = "https://api.scrapeless.com"
HEADERS = {"x-api-token": API_KEY, "Content-Type": "application/json"}


def ask_gemini(prompt: str, country: str = "US") -> dict:
    created = requests.post(
        f"{BASE}/api/v2/scraper/request",
        headers=HEADERS,
        json={"actor": "scraper.gemini", "input": {"prompt": prompt, "country": country}},
        timeout=60,
    )
    task_id = created.json()["task_id"]

    for _ in range(30):
        time.sleep(3)
        got = requests.get(f"{BASE}/api/v2/scraper/result/{task_id}", headers=HEADERS, timeout=60)
        data = got.json()
        if data.get("status") in ("success", "failed"):
            return data
    raise TimeoutError("el resultado no está listo a tiempo")


result = ask_gemini("Atracciones recomendadas en Nueva York")
answer = result["task_result"]
print(answer["result_text"])
for c in answer["citations"]:
    print("-", c["website_name"], c["url"])

Obtén tu clave API en el plan gratuito: app.scrapeless.com


Cómo evitar problemas comunes

  • Un campo que no está presente es nulo, no un error. No cada respuesta lleva highlights o un favicon; trata cada campo de cita como opcional y verifica su ausencia.
  • Obtén resultados rápidamente. El resultado se recupera por task_id; consulta poco después de crear la tarea en lugar de mucho después, y prefiera un intervalo de consulta corto a leerlo mucho más tarde.
  • Fija el país al mercado que estás estudiando. El campo country cambia la respuesta; mantenlo fijo por cada ejecución de monitoreo para que los resultados sean comparables a lo largo del tiempo.
  • Las respuestas varían entre ejecuciones. La redacción de Gemini cambia de ejecución a ejecución, por lo que compara las fuentes de citas a lo largo del tiempo, no la prosa exacta; la forma en que los motores de respuesta presentan páginas se describe en la guía de Google sobre características de IA para la web, y el contrato HTTP que estás llamando sigue la especificación de semántica HTTP.

Conclusión: tu marca, como la ve Gemini

El Scraper de Gemini convierte una respuesta de IA en datos que puedes rastrear: el texto de respuesta y las fuentes exactas detrás de ella, en un flujo de dos llamadas. Ejecuta los mensajes que tus clientes preguntan, almacena las citas y observa cómo cambia tu visibilidad en las respuestas de Gemini a lo largo del tiempo. Combínalo con los otros motores en la línea de Universal Scraping API, infórmate sobre por qué los motores de respuesta cambiaron la búsqueda, y la documentación cubre cada campo.


¿Listo para Construir Tu Canal de Datos Potenciado por IA?

Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que monitorean respuestas de IA: Discord · Telegram.

Regístrate en app.scrapeless.com para uso gratuito de la API Scraper, y consulta precios para escalabilidad.


FAQ

Q: ¿Qué devuelve el Scraper de Gemini?
El texto de la respuesta como Markdown (result_text) más un arreglo de citations — cada cita tiene title, url, website_name, snippet, favicon, y los highlights que usó Gemini. En una ejecución en vivo, un mensaje devolvió 15 citas.

Q: ¿Es sincrónico?
No. Envías el mensaje para crear una tarea y obtienes el resultado por task_id. En una ejecución en vivo, la respuesta estuvo lista en aproximadamente 12 segundos.

Q: ¿Puedo localizar la respuesta?
Sí — establece input.country a un código ISO. La respuesta se adapta a ese mercado, así que mantenlo fijo al comparar resultados a lo largo del tiempo.

Q: ¿Por qué cambian las respuestas entre ejecuciones?
Las respuestas generativas varían en redacción de ejecución a ejecución. Para monitoreo, rastrea las fuentes de citas y si tu marca aparece, no la prosa exacta.

Q: ¿Necesito un proxy?
No. La salida se maneja dentro del actor a través de IP residenciales; solo envías el mensaje y el país.

Copy

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar