Volver al blog

Cómo raspar el modo IA de Google: Respuestas, citas y fuentes

Ava Wilson
Ava Wilson

Expert in Web Scraping Technologies

29-Jun-2026

Resumen:

  • El Modo AI de Google es un motor de respuestas conversacionales de página completa, no el bloque de Resumen AI en línea. Descompone un aviso en muchas sub-búsquedas paralelas y devuelve una respuesta larga, sintetizada y multipartita con sus propias fuentes citadas: el análogo más cercano de Google a ChatGPT o Perplexity.
  • El actor scraper.aimode lo captura en una solicitud POST sincrónica. Una única llamada a /api/v2/scraper/execute devuelve la respuesta; no hay un flujo de activar-luego-polar-luego-descargar que gestionar.
  • Una llamada devuelve tres formatos de respuesta más citas. task_result lleva result_text (prosa sencilla), result_md (markdown), result_html (la respuesta renderizada), un array citations de las fuentes en las que se basó la respuesta y un raw_url para la procedencia.
  • citations es la superficie de participación de citas. Cada entrada nombra la fuente — título, URL, nombre del sitio, fragmento — para que puedas eliminar duplicados y clasificar los dominios de los que el Modo AI de Google obtiene información para consultas con intención de investigación.
  • La salida está limitada por country; el idioma de la respuesta no está garantizado. El mismo aviso puede devolver una respuesta en un idioma diferente en una ejecución dada, así que detecta el idioma más adelante en lugar de asumir que el país lo establece.
  • El sobre coincide con el resto de la línea de actores. Cada llamada devuelve { status, task_id, task_result }, así que un cliente escrito aquí también lee ChatGPT, Gemini y Perplexity.
  • Gratis para empezar. Las nuevas cuentas de Scrapeless incluyen créditos de prueba gratuitos — regístrate en app.scrapeless.com.

Introducción: El Modo AI es el motor de respuestas de Google, no un bloque SERP

El Modo AI de Google es una página de respuestas por separado, estilo chat: haces una pregunta, Google la descompone en muchas sub-búsquedas paralelas y devuelve una larga respuesta sintetizada con seguimientos y su propia lista de fuentes citadas. No es la caja de Resumen AI que aparece en línea sobre los enlaces azules: esa es una superficie diferente, capturada por un actor diferente. El Modo AI es donde Google dirige preguntas de investigación y comparación, y se comporta más como ChatGPT o Perplexity que como una página de resultados.

Para una marca o un equipo de investigación, esa página es ahora un destino principal y es difícil de leer a gran escala. La respuesta está renderizada en JavaScript, el diseño cambia y las fuentes detrás de ella están enterradas en un marcado que cambia sin aviso. Capturarlo manualmente significa manejar una página de conversación que lucha contra la automatización.

El actor scraper.aimode devuelve esa página como datos en una solicitud: un aviso entra y una respuesta estructurada regresa en texto plano, markdown y HTML, con las fuentes citadas como un array. Las secciones a continuación cubren la solicitud de captura, el esquema de respuesta campo por campo, un cliente en Python que convierte un conjunto de avisos en una tabla de participación de citas, y los actores compañeros para el resto de las superficies AI de Google. Para el bloque de Resumen AI en línea, la extracción de Google AI Overview cubre el actor scraper.overview separado.


Lo Que Puedes Hacer Con Los Datos Del Modo AI De Google

  • Seguimiento de participación en citas. Ejecuta un conjunto fijo de avisos de investigación en un horario y cuenta qué dominios cita el Modo AI para cada uno: la métrica GEO para las consultas que Google dirige al Modo AI.
  • Monitoreo de marca y competitividad. Detecta cuándo una respuesta comienza o deja de mencionar tu producto para una pregunta de compra o comparación, y qué fuente rastrea la mención.
  • Análisis de brechas de contenido. Ve qué páginas utiliza el Modo AI para un tema, y cuáles de tus propias páginas nunca aparecen.
  • Conjuntos de datos RAG y de evaluación. Alimenta result_text más citations en un sistema de recuperación o un conjunto de evaluación como filas limpias de aviso–respuesta–fuente.
  • Diferenciación de respuestas a lo largo del tiempo. Almacena result_html por captura y compara la respuesta renderizada para ver cómo cambia la síntesis de Google.
  • Captura multilingüe. Fija country por cada llamada para comparar cómo la respuesta y sus fuentes cambian entre mercados.

Por Qué El Scraper De Google AI Mode De Scrapeless

El scraper de Google AI Mode de Scrapeless es el actor scraper.aimode, parte de la API de Extracción Universal. Para el Modo AI específicamente, ofrece:

  • Una POST sincrónica que devuelve la respuesta: no hay flujo de activar-luego-polar-luego-descargar que gestionar.
  • Tres formatos de salida en una sola respuesta: result_text para incrustaciones, result_md para renderización, result_html para archivo fiel.
  • Un array unificado de citaciones — una superficie de atribución, sin campos de anuncios o compras mezclados — listo para operacionalizar el seguimiento de la carga de citaciones.
  • Egreso residencial fijado por el país que proporcionas, con renderizado y manejo anti-bot ejecutados del lado del servidor.
  • El mismo encabezado de x-api-token y sobre de { status, task_id, task_result } que el resto de la línea de actores.

Obtén tu clave API en el plan gratuito en app.scrapeless.com.


Requisitos previos

  • Python 3.10 o más reciente (el cliente a continuación utiliza solo requests) o cualquier cliente HTTP para la llamada curl
  • Una cuenta de Scrapeless y clave API — regístrate en app.scrapeless.com
  • La clave exportada como SCRAPELESS_API_KEY
  • Familiaridad básica con la terminal y JSON — sin navegador, proxy o solucionador CAPTCHA que comprar

Cómo funciona el scraper del modo AI de Google

Una única solicitud POST a /api/v2/scraper/execute con el actor scraper.aimode devuelve la respuesta. El actor renderiza la página del Modo AI del lado del servidor y la analiza en el sobre de respuesta.

Parámetros de la solicitud

Los parámetros van dentro del objeto input.

Campo de input requerido descripción
prompt la pregunta de forma libre para enviar al Modo AI; la redacción de investigación y comparación activa la respuesta de manera más confiable
country código de región de dos letras (por ejemplo, US); fija el egreso residencial para la ejecución

Captura rápida con curl

bash Copy
# Requiere SCRAPELESS_API_KEY en el entorno.
curl -sS -X POST https://api.scrapeless.com/api/v2/scraper/execute \
  -H "Content-Type: application/json" \
  -H "x-api-token: ${SCRAPELESS_API_KEY}" \
  -d '{
    "actor": "scraper.aimode",
    "input": {
      "prompt": "mejores zapatillas para correr 2026",
      "country": "US"
    }
  }'
# Pipa a: | jq '.task_result.citations' para las fuentes citadas.

Sobre de respuesta

La respuesta se encuentra bajo task_result en tres formatos, con las fuentes como un array citations y un raw_url para la procedencia. La forma a continuación es una captura real para el prompt anterior; los valores de los campos son una muestra ilustrativa de una ejecución en vivo.

json Copy
// El esquema es lo que devuelve scraper.aimode; los valores de los campos son una muestra ilustrativa de una ejecución en vivo (ofertas/citaciones recortadas).
{
  "status": "success",
  "task_id": "…",
  "task_result": {
    "result_text": "### Mejores Entrenadores Diarios (Más Versátiles)\n#### ASICS Novablast 5 — Precio: $129.95 (anteriormente $150) | Vendedor: ASICS y más | Calificación: 4.x …",
    "result_md": "### Mejores Entrenadores Diarios (Más Versátiles)\n\n…",
    "result_html": "<div>… la respuesta renderizada del Modo AI …</div>",
    "citations": [
      {
        "website_name": "GearLab",
        "title": "10 Mejores Zapatillas para Correr de 2026 | Probadas y Clasificadas",
        "url": "https://…",
        "snippet": "…",
        "favicon": "https://…",
        "thumbnail": "https://…"
      }
    ],
    "raw_url": "https://…"
  }
}

Qué formato leer depende del trabajo:

  • result_text — prosa simple, el campo más limpio para embeddings, detección de lenguaje o análisis rápido.
  • result_md — estructura markdown para renderizado; ten en cuenta que puede llevar imágenes en línea como URIs de datos base64, así que retíralas antes de almacenar.
  • result_html — la respuesta renderizada fiel, grande (cientos de KB); guárdala para archivo y diferencias, no para analizar.
  • citations — el array de atribución estructurado; esto es lo que deduplicas y clasificas para la participación en la citación.

Unas observaciones honestas de ejecutarlo:

  • El lenguaje no está fijado por country. El mismo prompt US devolvió una respuesta en inglés en una ejecución y una no en inglés en otra. Trata el idioma de la respuesta como variable: detecta desde result_text aguas abajo y filtra, en lugar de asumir que el país lo establece.
  • La salida varía de ejecución a ejecución. La cuenta de citaciones y la longitud de la respuesta cambian entre llamadas para el mismo prompt — almacena task_id y una marca de tiempo de captura, porque la serie a lo largo del tiempo es la señal, no una sola llamada.
  • No cada consulta activa el Modo AI. Los prompts conversacionales, de investigación y de comparación activan la respuesta; una consulta navegacional simple puede no hacerlo. Formula con intención de investigación.
  • Trata cada campo como nullable. citations puede regresar vacío y un formato puede faltar en una ejecución dada; protege contra esto en lugar de suponer su presencia.

Obtén tu clave API en el plan gratuito: app.scrapeless.com


Integrando la API en Python

El patrón para la escala es un conjunto de prompts fijos, una llamada cada uno, citaciones aplanadas en conteos de dominio. El cliente lee SCRAPELESS_API_KEY del entorno, publica un prompt y construye un conteo de dominio de citaciones para que una tabla de participación en citaciones resulte directamente.

python Copy
"""Captura respuestas del modo AI de Google para un conjunto de prompts (scraper.aimode).
    export SCRAPELESS_API_KEY=your_api_token_here
```python
import os
from collections import Counter
from urllib.parse import urlparse

import requests

ENDPOINT = "https://api.scrapeless.com/api/v2/scraper/execute"
PROMPTS = [
    "mejores zapatillas para correr 2026",
    "mejor crm para pequeñas empresas",
    "suv eléctrico más fiable 2026",
]


def capture(prompt: str, country: str = "US") -> dict:
    resp = requests.post(
        ENDPOINT,
        headers={
            "Content-Type": "application/json",
            "x-api-token": os.environ["SCRAPELESS_API_KEY"],
        },
        json={"actor": "scraper.aimode", "input": {"prompt": prompt, "country": country}},
        timeout=180,
    )
    resp.raise_for_status()
    return resp.json().get("task_result", {}) or {}


def cited_domains(task_result: dict) -> list[str]:
    domains = []
    for citation in task_result.get("citations") or []:
        url = citation.get("url") or ""
        host = urlparse(url).netloc.removeprefix("www.")
        if host:
            domains.append(host)
    return domains


if __name__ == "__main__":
    tally = Counter()
    for prompt in PROMPTS:
        result = capture(prompt)
        text = result.get("result_text") or ""
        domains = cited_domains(result)
        if not text and not domains:
            # Vacío persistente = sin respuesta de AI Mode para esta consulta/geo. Registrar y continuar.
            print(f"{prompt}: sin respuesta de AI Mode")
            continue
        tally.update(domains)
        print(f"{prompt}: {len(text)} caracteres, {len(domains)} citaciones")
    print("\nParticipación de citaciones (dominios a través del conjunto de prompts):")
    for domain, count in tally.most_common(10):
        print(f"  {count:>2}  {domain}")

Cada prompt genera el texto de respuesta más los dominios citados por AI Mode; contabilizar los dominios a través del conjunto produce una tabla de participación de citaciones. Para seguir una conversación, envía el seguimiento como su propio prompt: cada llamada captura un turno, por lo que un hilo de múltiples pasos es una secuencia de capturas independientes vinculadas al mismo tema. Escribe las filas en un almacén según un horario y la participación de citación, la deriva de respuestas y nuevas fuentes se derivan como series de tiempo.


Actores complementarios para captura de Google-AI end-to-end

Una cuenta y un sobre que leen todas las superficies de respuesta de Google. Captura la misma consulta, país y marca de tiempo a través de actores para una imagen completa:

  • scraper.overview — el bloque de AI Overview en línea; envía todo el trabajo de AI-Overview allí (scrapeo de AI Overview de Google lo cubre).
  • scraper.google.search — los resultados orgánicos para la misma consulta, para unirse a la respuesta de AI.
  • scraper.chatgpt, scraper.gemini, scraper.perplexity, scraper.grok — el resto de los motores de respuesta en la misma forma { status, task_id, task_result }. La comparación de los mejores scrapers de LLM lee estas superficies en el mismo sobre.

Cómo evitar problemas comunes

  • Salida vacía o variable. result_text o citations pueden regresar vacíos, y los conteos pueden variar entre ejecuciones. Almacena task_id y una marca de tiempo; la serie es la señal. Trata cada campo como nullable.
  • Sin respuesta de AI Mode para una consulta. No cada prompt activa AI Mode: formula como una pregunta de investigación o comparación; una búsqueda de navegación puede no devolver nada.
  • Idioma incorrecto. El idioma de respuesta puede diferir del país que pasas, así que detecta el idioma desde result_text y filtra en lugar de asumir.
  • Eligiendo el formato. Usa result_text para incrustaciones y verificaciones de idioma, result_md para renderizar (elimina imágenes en base64 en línea), y result_html solo para archivo y comparación.

Conclusión: un POST para las respuestas conversacionales de Google

Capturar AI Mode de Google toma una llamada: un POST al actor scraper.aimode devuelve la respuesta conversacional en tres formatos con sus fuentes citadas como un arreglo. Formula prompts con intención de investigación, fija el país, lee result_text más citations, detecta el idioma río abajo y trata cada campo como nullable. Ejecuta un conjunto fijo de prompts según un horario con Universal Scraping API créditos y captura AI Mode junto al bloque de AI Overview y los resultados orgánicos para obtener la imagen completa de Google-AI. La forma de solicitud y los nombres de los campos se confirman contra el actor scraper.aimode en la Referencia del Scraper de Chat LLM.


¿Listo para construir tu pipeline de visibilidad de respuestas de IA?

Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que construyen pipelines de datos de respuestas de IA: Discord · Telegram.

Regístrate en app.scrapeless.com para obtener créditos de prueba gratuita y dirija el conjunto de indicaciones anteriores a las preguntas de investigación y a los mercados que rastrea tu programa de visibilidad.


Preguntas Frecuentes

P: ¿Es legal extraer datos de Google AI Mode?
Los datos devueltos son la respuesta visible públicamente del AI Mode que Google muestra a cualquier usuario. Como ocurre con cualquier raspado, la legalidad depende de la jurisdicción y el uso: revisa los términos relevantes y consulta a un abogado antes de basarte en ello, y recopila solo respuestas y datos de fuentes públicas.

P: ¿Ofrece Google una API oficial para AI Mode?
No. No hay un punto final oficial para las respuestas del AI Mode, por lo que se necesita un actor gestionado que renderice y analice la página.

P: ¿Necesito un proxy o un solucionador de CAPTCHA?
No. La renderización, el egreso residencial y el manejo anti-bot se ejecutan del lado del servidor. Envías un POST con un encabezado x-api-token y recibes JSON de vuelta; el campo country selecciona el mercado de egreso.

P: ¿En qué se diferencia AI Mode de AI Overview?
AI Mode es un motor de respuestas conversacionales a página completa que fanfarea un indicativo en muchas sub-búsquedas; AI Overview es el bloque en línea por encima de los resultados orgánicos. Son superficies separadas con actores separados: scraper.aimode aquí, scraper.overview para el bloque.

P: ¿En qué formato se devuelven los datos?
El sobre es JSON: { status, task_id, task_result }. La respuesta en sí viene en tres formas: result_text, result_md y result_html, además de un array de citations y un raw_url.

P: ¿Cómo extraigo las fuentes citadas?
Lee task_result.citations; cada entrada lleva el título de la fuente, URL, nombre del sitio y fragmento. Analiza el host de cada URL y cuenta los registros para la parte de citación.

P: ¿Qué formato debo usar para RAG?
Utiliza result_text para incrustaciones, o result_md cuando quieras estructura, después de eliminar las imágenes en base64 en línea. Guarda result_html para archivo, no para recuperación.

P: ¿Puedo capturar respuestas para un país específico?
Pasa el código country para fijar el egreso residencial por mercado. Controla la región de egreso; el idioma de la respuesta aún puede variar, así que detecta y filtra el idioma más adelante.

P: ¿Por qué mi respuesta está vacía o difiere del navegador?
La consulta puede no activar AI Mode, la región puede diferir o la salida varía de ejecución a ejecución. Formula con intención de investigación, fija country, almacena task_id más una marca de tiempo, y trata los campos como anulables.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar