Fuentes de datos de compras de IA comparadas: dónde vive la data del producto
Scraping and Proxy Management Expert
Resumen:
- Los datos de compras de IA provienen de cuatro superficies distintas, no de un solo feed. ChatGPT Shopping, Google AI Mode, Google AI Overview y Google Shopping devuelven una unidad de datos diferente para la misma consulta, por lo que la superficie que elijas decide qué puedes monitorear.
- ChatGPT Shopping es la única superficie que devuelve una lista de ofertas por comerciante. El actor
scraper.chatgptconshopping: truedevuelve productos con un arreglooffers[]— el mismo modelo con precios entre Sony, Best Buy, Walmart y Target en una sola respuesta. - Google AI Mode devuelve una respuesta sintetizada, fuentes citadas y detalles ricos del producto en una sola llamada. Una única solicitud
scraper.aimodedevolvió 7citacionesy 7productos, cada uno con marca, rango de precios, calificación, tiendas y reseñas. - Google AI Overview solo llena
productoscuando se activa su intención de compra. El actorscraper.overviewdevuelve las banderasis_shoppingeis_overview_shopping; ambas fueronfalsaspara "mejores zapatillas para correr 2026", por lo queproductosregresó nulo — las banderas en sí son la señal de intención comercial. - Google Shopping es la línea base del catálogo, accedida a través de un endpoint diferente. El actor
scraper.google.searchcontbm: "shop"publica en/api/v1/scraper/request, no en el endpoint de ejecución v2 que comparten los actores LLM, y devuelve una forma de SERP de compras: metadatos, refinamientos de consulta ysearch_information. - Gratis para comenzar. Las nuevas cuentas de Scrapeless incluyen créditos de prueba gratuitos — regístrate en app.scrapeless.com.
Introducción: los datos de productos ahora viven en cuatro superficies
Un comprador que pregunta "mejores zapatillas para correr 2026" ya no llega a una sola página de resultados. La misma consulta se distribuye a través del carrusel de compras de ChatGPT, la página de respuestas de Google AI Mode, el bloque de AI Overview en línea y la SERP de Google Shopping — y cada superficie responde con una forma diferente de datos. Una devuelve ofertas con precios por comerciante; otra devuelve una respuesta sintetizada con fuentes citadas; una devuelve una bandera de intención comercial; una devuelve un índice de catálogo. Tratar "datos de compras de IA" como un único feed pasa por alto dónde vive realmente cada hecho.
Esta publicación es el mapa de origen, no un tutorial de recopilación. Compara las cuatro superficies una al lado de la otra: qué actor lee cada una, qué la activa, la unidad de datos que genera y el trabajo de monitoreo para el que fue construida. Los cuatro son actores de Universal Scraping API, por lo que la decisión no es qué proveedor usar, sino qué superficie responde a la pregunta que realmente estás haciendo. Para la superficie de bloque en línea específicamente, raspar Google AI Overviews cubre el actor scraper.overview por sí solo.
Las cuatro superficies de un vistazo
Cada superficie es un punto diferente en el viaje de compra, y el actor que la lee devuelve una carga útil correspondientemente diferente:
- ChatGPT Shopping — el carrusel de productos que ChatGPT muestra para un aviso de intención de compra, leído por
scraper.chatgptconshopping: true. - Google AI Mode — el motor de respuestas conversacionales de página completa de Google, leído por
scraper.aimode. - Google AI Overview — el bloque de AI en línea por encima de los resultados orgánicos, leído por
scraper.overview. - Google Shopping — la SERP de compras dedicada, leída por
scraper.google.searchcontbm: "shop".
La matriz de origen: cuatro superficies lado a lado
La matriz a continuación es el centro de atención: lee hacia abajo en una columna para ver lo que una superficie genera, lee a través de una fila para ver por qué ningún actor único cubre cada pregunta de compra.
| Superficie | Actor | Qué la activa | Unidad de datos | Localiza por | Forma de salida | Mejor trabajo de monitoreo |
|---|---|---|---|---|---|---|
| ChatGPT Shopping | scraper.chatgpt (shopping: true) |
un aviso de intención de compra que genera el carrusel esa sesión | una oferta por comerciante | país |
products[] → offers[]{merchant_name, price, available, details} |
precio entre comerciantes |
| Google AI Mode | scraper.aimode |
un aviso de investigación o comparación | una respuesta sintetizada, fuentes citadas y detalles del producto | país |
result_text / result_md / result_html, citations[], products[] |
compartir citaciones más detalles del producto |
| Google AI Overview | scraper.overview |
una consulta que muestra el bloque en línea; datos de productos solo cuando se activa la intención de compra | una respuesta con fuentes atribuidas; productos solo en intención comercial |
país |
content, source[], web_source[], is_shopping / is_overview_shopping, products (nullable) |
bandera de intención comercial más fuente de citación |
| Google Shopping | scraper.google.search (tbm: "shop") |
una consulta de búsqueda en el vertical de compras | un índice de SERP de compras | gl + hl |
metadatos, información_de_búsqueda, refinar_esta_búsqueda[], paginación |
base de catálogo |
Un detalle de transporte decide el diseño del cliente por adelantado: los tres actores LLM (scraper.chatgpt, scraper.aimode, scraper.overview) todos envían un POST a /api/v2/scraper/execute y devuelven el sobre { estado, id_tarea, resultado_tarea }, mientras que scraper.google.search envía un POST a /api/v1/scraper/request con entrada: { q, tbm: "shop", hl, gl }. Tres superficies comparten un cliente; la cuarta necesita su propia forma de solicitud.
ChatGPT Shopping: la superficie de precios inter-mercancía
ChatGPT Shopping es la única de las cuatro superficies que devuelve un precio real por comerciante. Con shopping: true dentro de entrada, scraper.chatgpt devuelve un arreglo productos[] donde cada producto lleva un encabezado precio, una calificación, un conteo de num_reviews, y una lista ofertas[] — una entrada por comerciante, cada una con su propio nombre_comerciante, precio, bandera de disponible, y una cadena de detalles para stock y entrega. Un único resultado de auriculares devolvió el mismo modelo a precios de Sony, Best Buy, Walmart y Target en una sola respuesta. Cuando la pregunta es "¿cuánto cuesta este artículo en todas las tiendas en este momento?", esta es la superficie que lo responde. El carrusel se renderiza por sesión, por lo que un arreglo productos poblado en una llamada y uno vacío en la siguiente son ambos normales — trata el arreglo como anulable y agrega ejecuciones programadas.
Google AI Mode: la superficie de respuesta más detalles de producto
Google AI Mode devuelve la carga más compleja de las cuatro. Una única solicitud scraper.aimode devolvió la respuesta sintetizada en tres formatos (resultado_texto, resultado_md, resultado_html), un arreglo citaciones[] de 7 fuentes, y un arreglo productos[] de 7 entradas — y cada objeto de producto es rico, llevando marca, rango_de_precio, calificación, tiendas, reseñas, y variantes en lugar de un solo precio. AI Mode es donde Google dirige preguntas de investigación y comparación, por lo que también funciona como una superficie de compartir citas (de qué dominios se basó la respuesta) y una superficie de investigación de productos (los detalles detrás de cada recomendación). La desventaja es que no devuelve una oferta limpia por comerciante de la manera que lo hace ChatGPT Shopping; el detalle de precio es un rango, no una fila por tienda.
Google AI Overview: la superficie de bandera de intención comercial
Google AI Overview es la superficie que te dice si una consulta es comercial o no. El actor scraper.overview devuelve la respuesta en bloque en línea como contenido y texto_raw, las fuentes atribuidas divididas en fuente[] y fuente_web[] (cada entrada lleva nombre_sitio, título, url, y fragmento), y dos booleanos — es_compras y es_overview_compras. Para "las mejores zapatillas para correr 2026", ambas banderas devolvieron falso, y productos fue nulo. Ese es el comportamiento honesto en torno al cual diseñar: el bloque AI Overview solo llena un arreglo de productos cuando se activa su intención de compra, así que las banderas son la señal, no un error. Léelas para clasificar cuáles de tus consultas rastreadas Google considera transaccionales, y lee fuente[] más fuente_web[] para la misma métrica de compartir citas que soporta AI Mode.
json
// El esquema es lo que devuelve scraper.overview; los valores de campo son una muestra ilustrativa de una ejecución en vivo.
{
"estado": "exito",
"id_tarea": "…",
"resultado_tarea": {
"es_compras": falso,
"es_overview_compras": falso,
"contenido": "Las mejores zapatillas para correr de 2026 presentan un fuerte enfoque en entrenadores super acolchados …",
"fuente": [
{ "nombre_sitio": "YouTube", "título": "Las Mejores Zapatillas para Correr de 2026 (Hasta Ahora) …", "url": "https://…", "fragmento": "…", "tiendas": nulo }
],
"fuente_web": [
{ "nombre_sitio": "The Run Testers", "título": "Las Mejores Zapatillas para Correr 2026", "url": "https://…", "fragmento": "…" }
],
"productos": nulo,
"anuncios": nulo
}
}
Cuando una consulta rastreada cambia es_compras a verdadero, la misma respuesta comienza a llevar un arreglo productos poblado — así que la bandera también es el desencadenante que le dice a un pipeline cuándo comenzar a leer datos de productos desde esta superficie.
Obtén tu clave API en el plan gratuito: app.scrapeless.com
Google Shopping: la base de catálogo
Google Shopping es el índice del catálogo del cual se resumen las otras tres superficies. El actor scraper.google.search con tbm: "shop" lee el vertical de compras dedicado y devuelve una forma SERP: metadata (motor y URL en bruto), un bloque de search_information (query_displayed, organic_results_state, total_results), un array de consultas facetadas refine_this_search[] que Google sugiere para el término, y pagination. Es la parte de Deep SerpApi que mapea el paisaje de compras en lugar de la opinión de cualquier modelo al respecto. La profundidad de fila varía según la consulta: "mejores zapatillas para correr 2026" devolvió un conjunto de resultados escaso con total_results en 0 y el valor ubicado en las facetas de refinamiento en su lugar, por lo que se debe tratar esta superficie como la línea base estructural de lo que Google indexa para un término y confirmar el conteo de filas por consulta en lugar de asumir una cuadrícula completa.
Cómo las cuatro localizan, y qué permanece nulo
Cada superficie localiza, pero no a través del mismo campo. Los tres actores LLM toman un country de dos letras dentro de input; scraper.google.search toma gl (país) más hl (idioma). Fija la región por llamada y compara de manera equivalente: una captura de US y una captura de JP son conjuntos de datos diferentes en las cuatro superficies.
Cada campo en cada superficie es anulable y por sesión. products[] de ChatGPT puede estar vacío incluso con shopping: true; citations[] y products[] en el Modo AI cambian en cantidad de ejecución a ejecución; products en la Vista General de AI es nulo siempre que is_shopping sea false; el conteo de filas de Google Shopping varía con la consulta. Un array persistentemente vacío significa que no hubo respuesta para esa consulta y región: regístralo y prosigue, en lugar de interpretarlo como un fallo. Almacena task_id y una marca de tiempo de captura en cada llamada para que la serie temporal, no una sola respuesta, sea la señal.
Guía de decisión: qué superficie para qué trabajo
Fija la superficie a la pregunta:
| Si el trabajo es... | Captura | Lectura |
|---|---|---|
| Seguimiento de precios entre comerciantes | ChatGPT Shopping (scraper.chatgpt, shopping: true) |
products[] → offers[] |
| Parte de citaciones en respuestas AI | Google AI Mode + Google AI Overview | citations[] / source[] + web_source[] |
| Si una consulta es comercial o no | Google AI Overview (scraper.overview) |
is_shopping / is_overview_shopping |
| Línea base de catálogo / SERP para un término | Google Shopping (scraper.google.search, tbm: "shop") |
search_information, refine_this_search[] |
Debido a que tres de las cuatro utilizan el mismo punto final v2 y sobreenvoltura, capturar ChatGPT Shopping, Modo AI y Vista General AI para una consulta y país es el mismo cliente con una cadena de actor diferente. Google Shopping se une a la imagen como una segunda forma de solicitud contra el punto final v1, vinculada a la misma consulta y región para que la línea base del catálogo se alinee con las superficies AI por encima de ella.
Conclusión: elige la superficie, no el feed
Los datos de compras AI son cuatro superficies, y cada una responde a una pregunta diferente: ChatGPT Shopping para precios entre comerciantes, Google AI Mode para citaciones más detalles de productos, Google AI Overview para la bandera de intención comercial y sus fuentes, y Google Shopping para la línea base del catálogo. Mapea el trabajo a la superficie, fija la región por llamada, trata cada campo como anulable y almacena task_id más un timestamp para que la serie sea la señal. Ejecuta un conjunto fijo de consultas en un horario con créditos de Universal Scraping API y las cuatro superficies se convierten en una vista coordinada de dónde reside realmente los datos del producto que tu programa rastrea. Los nombres de los actores y los campos de respuesta aquí están confirmados contra ejecuciones en vivo en el LLM Chat Scraper de referencia.
¿Listo para construir tu pipeline de datos de compras AI?
Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que construyen pipelines de datos de respuestas AI: Discord · Telegram.
Regístrate en app.scrapeless.com para créditos de prueba gratuita y apunta a un cliente a las cuatro superficies anteriores para mapear dónde residen realmente los datos de productos que tu programa rastrea.
FAQ
P: ¿Cuál de las cuatro superficies devuelve un precio real por comerciante?
Solo ChatGPT Shopping. El actor scraper.chatgpt con shopping: true devuelve un array products[] cuya lista offers[] contiene una entrada de precio por comerciante. El Modo AI devuelve un price_range por producto, la Vista AI devuelve precios solo cuando su intención de compra se activa, y Google Shopping devuelve un índice SERP en lugar de una fila de oferta resuelta.
P: ¿Utilizan los cuatro superficies el mismo endpoint?
No. Los tres actores LLM — scraper.chatgpt, scraper.aimode y scraper.overview — envían POST a /api/v2/scraper/execute y comparten el sobre { status, task_id, task_result }. scraper.google.search se publica en /api/v1/scraper/request con input: { q, tbm: "shop", hl, gl }, por lo que necesita su propia forma de solicitud.
P: ¿Por qué el campo products de la Vista AI era nulo?
La Vista AI de Google solo llena products cuando is_shopping (o is_overview_shopping) es true. Para "mejores zapatillas para correr 2026" ambos indicadores eran false, así que products regresó nulo. Las banderas son la señal de intención comercial; léelas para saber cuándo aparecerán los datos de productos en esa superficie.
P: ¿Qué superficies me dan fuentes de citas para el seguimiento de la cuota de citas?
Dos de ellas. El Modo AI de Google devuelve un array citations[], y la Vista AI de Google devuelve source[] más web_source[], cada entrada nombra la fuente por website_name, title y url. Analiza el host de cada URL y suma los registros para construir una tabla de cuota de citas.
P: ¿Puede un cliente leer las cuatro superficies?
Tres de ellas, sí — ChatGPT Shopping, Modo AI y Vista AI comparten el endpoint v2, encabezado y sobre, por lo que cambiar el nombre del actor es un cambio de una línea. Google Shopping necesita una solicitud separada contra el endpoint v1 con localización gl/hl, por lo que un pipeline completo ejecuta el cliente v2 compartido más una llamada dedicada a scraper.google.search.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



