n8n + Scraper LLM: Captura respuestas de IA en un flujo de trabajo sin código
Senior Web Scraping Engineer
Conclusiones clave:
- n8n se comunica con el Chat Scraper LLM de Scrapeless mediante un nodo de solicitud HTTP — sin código, sin SDK. Un único nodo envía un POST a
https://api.scrapeless.com/api/v2/scraper/executecon un encabezadox-api-tokeny un cuerpo JSON, y la respuesta llega al flujo de trabajo como datos que el siguiente nodo puede leer. - El cuerpo de la solicitud es
{ actor, input }y nada más. Configura el cuerpo a{"actor":"scraper.chatgpt","input":{"prompt":"…","country":"US","web_search":true}}y el nodo devuelve{ status, task_id, task_result }— el mismo sobre que utiliza cada actor LLM de Scrapeless. - Un desencadenador de programación convierte la llamada en un monitor constante. Conecta
Schedule Trigger → HTTP Request → IF → Set/Sheet/DBy n8n vuelve a ejecutar el prompt establecido en un intervalo, añadiendo cada respuesta a una hoja o tabla sin que nadie abra un terminal. - El nodo IF maneja la ejecución vacía como datos, no como un error. El modelo completa
task_resultpor sesión, así que una respuesta vacía no es respuesta para esa consulta en esta ejecución — bifurca en ello, registra que no hay nada que almacenar y sigue adelante; la próxima ejecución programada captura la completada. - El nodo Cliente MCP es la alternativa al nodo agente. Cuando el flujo de trabajo es un agente de IA en lugar de un pipeline fijo, apunta el nodo Cliente MCP de n8n al servidor MCP de Scrapeless y la misma captura se convierte en una herramienta que el agente invoca por sí mismo.
- Libre para comenzar. Las nuevas cuentas de Scrapeless incluyen créditos de prueba gratis — regístrate en app.scrapeless.com.
Introducción: el motor de respuestas se convierte en una entrada de flujo de trabajo
Los motores de respuesta LLM ahora se sitúan entre los usuarios y la web abierta, y las preguntas que a una marca le importan — quién es recomendado, qué fuentes son citadas, qué precio aparece — se responden dentro de ChatGPT antes de que se haga clic en alguna página. Leer esa superficie de forma programada es un trabajo de recolección de datos, y n8n ya es donde muchos equipos ejecutan sus trabajos de datos programados.
El inconveniente es que ChatGPT no tiene una API oficial de respuestas, y manejar la interfaz de chat desde una herramienta de automatización significa muros de inicio de sesión, respuestas transmitidas y campos que se resuelven del lado del cliente después de que la respuesta se renderiza. El nodo de solicitud HTTP de n8n puede llamar a cualquier endpoint REST, pero no tiene nada que llamar hasta que la representación, la salida residencial y el análisis ocurren en otro lugar primero.
El Chat Scraper LLM de Scrapeless es ese otro lugar: un POST devuelve la respuesta renderizada de ChatGPT como JSON, así que el nodo de solicitud HTTP tiene un endpoint limpio al que dirigirse y el resto del flujo de trabajo lee campos estructurados. Este post conecta n8n con ese actor sin código — un desencadenador de programación, un nodo de solicitud HTTP, una bifurcación IF para ejecuciones vacías y un nodo de almacenamiento — y muestra el camino del nodo agente para flujos de trabajo que necesitan el scraper como una herramienta de IA. Para la vista clasificada de los scrapers del motor de respuestas en sí, los mejores scrapers LLM comparan las superficies lado a lado.
Una nota sobre el alcance: el contrato de solicitud a continuación se verifica contra el actor scraper.chatgpt en vivo, y cada nombre de parámetro de n8n se confirma contra la referencia de nodo actual de n8n. El flujo de trabajo de extremo a extremo se describe desde esas dos piezas verificadas — este post no presenta una ejecución con capturas de pantalla como prueba.
Lo que puedes hacer con ello
- Monitoreo de respuestas programado. Ejecuta un conjunto fijo de prompts cada hora o cada mañana y añade cada respuesta de ChatGPT a una hoja, de modo que la deriva de respuestas se convierta en una serie temporal en lugar de una verificación manual.
- Seguimiento de participación de citas. Lee
task_result.search_resultpara las fuentes que consultó ChatGPT y cuenta los dominios a través de las ejecuciones para ver a quién sigue citando el modelo para tu categoría. - Alertas de menciones de marca. Bifurca en si el texto de la respuesta nombra tu producto y enlaza un nodo de Slack o correo electrónico a partir de IF cuando aparece o desaparece una mención.
- Captura multi-motor en un solo flujo de trabajo. Duplica el nodo de solicitud HTTP y cambia la cadena del actor a
scraper.geminioscraper.perplexity— el sobre es idéntico, así que los nodos posteriores no cambian. - Transferencia de no-ops a no-desarrolladores. Una vez que el flujo de trabajo existe, un compañero edita la lista de prompts en un nodo Set o en una hoja sin tocar código, y la captura sigue funcionando.
- Llamadas de herramientas de agente. Expón el scraper a través del nodo Cliente MCP para que un agente de IA de n8n decida cuándo consultar un motor de respuestas como parte de una tarea más grande.
Por qué el Chat Scraper LLM de Scrapeless para n8n
El Chat Scraper LLM de Scrapeless es el actor scraper.chatgpt, parte de la API de Scraping Universal, y se adapta a n8n porque es un POST autenticado con JSON de entrada y JSON de salida. Para un flujo de trabajo sin código específicamente, trae:
- Un único punto final REST que el nodo de solicitud HTTP llama directamente — sin SDK que instalar en el host de n8n, sin navegador que controlar.
- Renderización del lado del servidor, salida residencial y manejo anti-bot, de modo que el nodo recibe una respuesta finalizada en lugar de una página de inicio de sesión.
- El campo
countryen la solicitud, que determina el mercado de salida desde dentro del cuerpo JSON — un nodo cubre la captura por mercado. - Un sobre
{ status, task_id, task_result }compartido entrescraper.chatgpt,scraper.geminiyscraper.perplexity, de modo que un nodo en funcionamiento se duplica en los otros motores sin cambios. - Un encabezado
x-api-tokencomo la única autenticación — una sola credencial de n8n o valor de encabezado, reutilizable en cada nodo que llama a Scrapeless.
Obtén tu clave API en el plan gratuito en app.scrapeless.com.
Prerrequisitos
- Una instancia de n8n (en la nube o autoalojada) donde puedas agregar un flujo de trabajo.
- Una cuenta de Scrapeless y clave API — regístrate en app.scrapeless.com
- La clave API disponible para pegar en el encabezado del nodo de solicitud HTTP (o guardada como una credencial de n8n).
- Un destino para las filas capturadas — un nodo Set, un nodo de Google Sheets o un nodo de base de datos como Postgres.
No se necesita tiempo de ejecución de lenguaje, proxy o solucionador de CAPTCHA; la solicitud es HTTP simple y el trabajo pesado se realiza en el lado de Scrapeless.
El flujo de trabajo en un vistazo
La captura completa consiste en cuatro nodos en línea:
Disparador de Programación → Solicitud HTTP → SI → Establecer / Google Sheets / Postgres
(intervalo) (actor POST) (¿vacío?) (almacenar la respuesta)
El Disparador de Programación se activa en un intervalo, el nodo de Solicitud HTTP llama a scraper.chatgpt, el nodo SI verifica si la respuesta regresó poblada, y el nodo de almacenamiento escribe la fila. La rama vacía del nodo SI es donde se registra y se descarta una ejecución sin respuesta — no se envía de nuevo. Cada nodo a continuación nombra solo parámetros que existen en la referencia actual del nodo de n8n.
Paso 1 — Disparador de Programación
El Disparador de Programación inicia el flujo de trabajo en una cadencia fija para que la captura se ejecute sin que nadie presione reproducir. Agrega un nodo Disparador de Programación (tipo versión 1.3) y establece sus Reglas de Disparo a un intervalo — cada hora, cada pocas horas o una vez al día, dependiendo de la frecuencia con la que tienden a moverse las respuestas que sigues. Para el monitoreo del motor de respuestas, diario o dos veces al día suele ser suficiente, ya que la serie a lo largo de las semanas es la señal, no el cambio minuto a minuto.
El disparador emite un elemento por activación. Si deseas varios prompts por ejecución, síguelo con un nodo Set que genere tu lista de prompts, o lee los prompts desde una hoja — cada prompt luego fluye a través del nodo de Solicitud HTTP como su propio elemento.
Paso 2 — Nodo de Solicitud HTTP: llamar al actor
El nodo de Solicitud HTTP es la integración. Realiza una llamada POST al actor en Scrapeless y devuelve la respuesta analizada al flujo de trabajo. Agrega un nodo Solicitud HTTP (tipo versión 4.4) y establece estos parámetros:
- Método →
POST - URL →
https://api.scrapeless.com/api/v2/scraper/execute - Enviar Encabezados → activado. Agrega un encabezado: nombre
x-api-token, valor tu clave API de Scrapeless (o referencia una credencial de n8n). - Enviar Cuerpo → activado.
- Tipo de Contenido del Cuerpo →
JSON. - Especificar Cuerpo → Usando JSON, luego pega la llamada al actor en el campo JSON.
El cuerpo JSON es todo el contrato — el nombre del actor más un objeto input:
json
{
"actor": "scraper.chatgpt",
"input": {
"prompt": "mejores zapatillas para correr 2026",
"country": "US",
"web_search": true
}
}
Para hacer que el prompt sea dinámico, reemplaza la cadena estática con una expresión de n8n que lea el elemento entrante — por ejemplo, extrayendo prompt del nodo Set o de la fila de la hoja que alimentó este nodo. country fija la salida residencial para la ejecución, y web_search permite que el modelo extraiga fuentes en vivo, lo que mejora la frecuencia con que se resuelve la respuesta. Cada campo se encuentra dentro de input; enviar prompt o country en el nivel superior del cuerpo es rechazado por el actor.
Establece el Tiempo de Espera del nodo generosamente. Una respuesta renderizada puede tardar un tiempo en llegar, por lo que un tiempo de espera predeterminado corto cortará la llamada antes de que llegue la respuesta — dale espacio.
El nodo devuelve el sobre estándar, { status, task_id, task_result }, como el JSON del elemento. Los nodos posteriores leen la respuesta desde task_result.result_text y las fuentes desde task_result.search_result.
Obtén tu clave API en el plan gratuito: app.scrapeless.com
Paso 3 — Nodo SI: ramificar en una respuesta vacía
El nodo IF decide si hay algo que almacenar. Las respuestas de ChatGPT se generan por sesión, por lo que el mismo aviso puede devolver una respuesta completa en una ejecución y un task_result vacío en la siguiente; eso no es un fallo, simplemente no hay respuesta para esta consulta en esta ejecución. Agrega un nodo IF (tipo versión 2.3) después del nodo de Solicitud HTTP y escribe una única regla de Condiciones que pruebe si el campo de respuesta está vacío, por ejemplo, comprobando que la expresión task_result.result_text no está vacía.
- Rama falsa (respuesta presente) → conecta al nodo de almacenamiento en el Paso 4.
- Rama verdadera (respuesta vacía) → registra que la ejecución no produjo nada y detente. Un nodo NoOp, o un nodo Set que escribe una fila de marcador de "ejecución vacía", es suficiente.
La rama vacía no llama al actor nuevamente. La próxima activación programada es la próxima oportunidad de obtener una respuesta poblada, y agregar las ejecuciones que sí devuelven la respuesta es todo el patrón. Trata el resultado vacío como datos anulables, no como un error a perseguir.
Paso 4 — Almacena la respuesta
El nodo de almacenamiento convierte cada respuesta poblada en una fila que puedes consultar más tarde. Conecta la rama de respuesta presente del nodo IF en el destino que mejor se ajuste al programa:
- Nodo Set → da forma al elemento a los campos que mantienes: el aviso,
task_result.result_text, los dominios fuente detask_result.search_result, eltask_idy una marca de tiempo de captura. Útil como paso de forma final incluso cuando otro nodo realiza la escritura. - Nodo Google Sheets → agrega una fila por ejecución para un registro compartible, sin base de datos, que los no-desarrolladores pueden leer y editar.
- Nodo Postgres (u otra base de datos) → inserta en una tabla cuando la captura alimenta un almacén o un tablero de control.
Almacena task_id y el tiempo de ejecución en cada fila. La longitud de la respuesta, el conteo de citas y las fuentes nombradas cambian de ejecución a ejecución, por lo que el valor es la serie a través de las capturas, no una sola respuesta.
El nodo oficial de Scrapeless — y por qué esta guía usa Solicitud HTTP
n8n tiene un nodo comunitario oficial de Scrapeless (n8n-nodes-scrapeless). Instálalo, autentica una vez con una credencial de Scrapeless, y te brinda operaciones tipadas para tres superficies: Deep SerpApi (Búsqueda de Google y Tendencias de Google), la API de Scraping Universal (Desbloqueador Web) y el Rastreador (Raspar y Rastrear). Para cualquiera de esos trabajos, el nodo es la opción más limpia; no hay URL o cuerpo JSON para construir a mano.
Los actores del Chat Scraper de LLM — scraper.chatgpt, scraper.gemini, scraper.perplexity, y scraper.aimode — no están expuestos como operaciones en la versión actual del nodo, por lo que capturar la respuesta de un motor de respuestas es el caso en el que el nodo de Solicitud HTTP es la vía: llega directamente a /api/v2/scraper/execute, que es exactamente lo que construyen los pasos anteriores. Si una versión posterior del nodo agrega una operación LLM, la credencial de Scrapeless y la forma del flujo de trabajo se mantienen; solo cambia el nodo intermedio.
La alternativa del nodo agente: Cliente MCP + servidor MCP de Scrapeless
Cuando el flujo de trabajo es un agente de IA en lugar de un pipeline fijo, el nodo Cliente MCP de n8n reemplaza la llamada HTTP construida a mano. El nodo Cliente MCP se conecta a un servidor MCP y expone las herramientas de ese servidor a un agente de IA de n8n, por lo que el agente las llama por su cuenta cuando su razonamiento las necesita. Dirígete al servidor MCP de Scrapeless y la captura del motor de respuestas se convierte en una de las herramientas que el agente puede invocar; el agente decide cuándo consultar a ChatGPT como parte de una tarea más grande, en lugar de que tú conectes la llamada en una rama fija.
Los dos caminos responden a diferentes necesidades. El nodo de Solicitud HTTP es la herramienta adecuada para una captura determinista y programada: mismos avisos, misma cadencia, filas predecibles. El nodo Cliente MCP es la herramienta adecuada cuando un agente debe elegir dinámicamente si y qué consultar. La superficie de Scrapeless subyacente es la misma; solo cambia quién activa la llamada.
Lo que obtienes de vuelta
El nodo de Solicitud HTTP devuelve el sobre estándar del actor como el JSON del ítem. La respuesta está bajo task_result, con la prosa en result_text y las fuentes consultadas en search_result. La forma a continuación es lo que devuelve scraper.chatgpt; los valores de los campos son una muestra ilustrativa de una ejecución en vivo (texto y fuentes recortadas).
json
// El esquema es lo que devuelve scraper.chatgpt; los valores de los campos son una muestra ilustrativa de una ejecución en vivo.
{
"status": "success",
"task_id": "…",
"task_result": {
"prompt": "mejores zapatillas de correr 2026",
"model": "gpt-5-mini",
"result_text": "Aquí están las mejores zapatillas de correr en 2026, basadas en pruebas recientes de las principales marcas (ASICS, Nike, HOKA, Adidas, Brooks, Saucony) …",
"content_references": [],
"search_result": [
{ "title": "10 Mejores Zapatillas de Correr de 2026 | Probadas y Clasificadas", "url": "https://…", "snippet": "…", "attribution": "outdoorgearlab.com" }
],
"links": [],
"web_search": true
}
}
Unas pocas notas honestas sobre la lectura de esto dentro de n8n:
- Todos los campos son anulables.
result_textpuede estar vacío ysearch_resultpuede ser un array vacío en una ejecución determinada; el nodo IF del Paso 3 existe precisamente para ese caso. Protege contra campos faltantes en cualquier expresión que los lea. search_resultes la superficie de la cita. Cada entrada lleva untítulo,url,snippet, yatribución; analiza el host de la URL en un nodo Set y cuenta a través de ejecuciones para la cuota de citas.web_searchrefleja la solicitud. Indica si la obtención de fuentes en vivo estaba activa para la ejecución; mantenlotrueen el cuerpo para una mejor resolución en las recomendaciones.- La salida varía de ejecución a ejecución. La longitud de la respuesta y el número de fuentes cambian para el mismo aviso, razón por la cual la marca de tiempo de captura y
task_iddeben pertenecer a cada fila almacenada.
Preguntas Frecuentes
P: ¿Necesito escribir código para conectar n8n al LLM Chat Scraper?
No. La integración es el nodo de Solicitud HTTP integrado configurado con un método POST, la URL /api/v2/scraper/execute, un encabezado x-api-token y un cuerpo JSON. No hay SDK que instalar en el host de n8n y no hay nodo de función que escribir.
P: ¿Dónde va mi clave de API de Scrapeless en n8n?
En los encabezados del nodo de Solicitud HTTP: habilita Enviar Encabezados, agrega un encabezado llamado x-api-token, y establece su valor en tu clave, o referencia una credencial de n8n para que la clave no se almacene en el nodo mismo. El mismo encabezado funciona en cada llamada a Scrapeless en el flujo de trabajo.
P: ¿Cómo puedo enviar varios avisos en una sola ejecución?
Sigue el Activador de Programación con un nodo Set que produzca tu lista de avisos, o lee los avisos de una Hoja de Google. Cada aviso se convierte en su propio ítem y fluye a través del nodo de Solicitud HTTP por separado, por lo que una ejecución captura todo el conjunto.
P: ¿Qué ocurre cuando la respuesta vuelve vacía?
Las respuestas de ChatGPT son por sesión, por lo que un task_result vacío significa que no hubo respuesta para esa consulta en esa ejecución. La rama vacía del nodo IF registra la no operación y se detiene; la siguiente ejecución programada es la siguiente oportunidad de una respuesta poblada. El flujo de trabajo no vuelve a enviar la misma llamada.
P: ¿Puedo capturar Gemini y Perplexity desde el mismo flujo de trabajo?
Sí. Duplica el nodo de Solicitud HTTP y cambia la cadena del actor a scraper.gemini o scraper.perplexity. El endpoint, el encabezado y el envoltorio { status, task_id, task_result } son idénticos, por lo que los nodos de IF y almacenamiento aguas abajo no cambian.
P: ¿Cuándo debo usar el nodo Cliente MCP en lugar del nodo de Solicitud HTTP?
Utiliza el nodo de Solicitud HTTP para una captura fija y programada con avisos predecibles. Utiliza el nodo Cliente MCP, apuntando al servidor MCP de Scrapeless, cuando un agente de IA de n8n debe decidir por sí mismo si y qué consultar: el scraper actúa entonces como una herramienta que el agente invoca.
P: ¿Necesito un proxy o un navegador funcionando en mi host de n8n?
No. El renderizado, la salida residencial y el manejo anti-bot se ejecutan del lado del servidor en Scrapeless. El host de n8n solo realiza una solicitud HTTPS saliente; el campo country en el cuerpo selecciona el mercado de salida.
P: ¿Es legal recopilar respuestas de ChatGPT?
Los datos devueltos son la respuesta públicamente visible que ChatGPT muestra a cualquier usuario. Como con cualquier scraping, la legalidad depende de la jurisdicción y el uso: revisa los términos relevantes y consulta a un abogado antes de construir sobre ello, y recoge solo datos de respuesta y fuente pública, nunca datos personales.
Conclusión: una captura permanente de cuatro nodos
Conectar n8n al LLM Chat Scraper de Scrapeless se reduce a un nodo de Solicitud HTTP: POST { actor, input } a /api/v2/scraper/execute con un encabezado x-api-token, leer task_result de vuelta, ramificar en la ejecución vacía y almacenar la fila. Un Activador de Programación convierte eso en un monitor permanente, y el nodo Cliente MCP lo convierte en una herramienta de agente cuando el flujo de trabajo necesita una. Mantén el conjunto de avisos limitado, fija country por mercado, trata cada campo como anulable y almacena task_id más una marca de tiempo para que la serie sea la señal. Ejecuta un conjunto de avisos fijo en un horario con créditos de API de Scraping Universal, y el motor de respuestas se convierte en una entrada limpia para lo que el resto del flujo de trabajo haga. El contrato de solicitud y los nombres de los campos están confirmados contra el LLM Chat Scraper en vivo, y los parámetros del nodo contra la referencia actual del nodo n8n.
¿Listo para construir tu pipeline de datos de respuestas de IA?
Únete a nuestra comunidad para reclamar un plan gratuito y conectarte con desarrolladores que están construyendo pipelines de datos de respuestas de IA: Discord · Telegram.
Regístrate en app.scrapeless.com para créditos de prueba gratuitos y dirige el flujo de trabajo de cuatro nodos anterior hacia los avisos, motores y mercados que tu programa sigue.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



