API de Scraper de Microsoft Copilot: Captura de Respuestas y Citas
Lead Scraping Automation Engineer
Resumen:
- Una API de raspado de Copilot convierte la respuesta de Microsoft Copilot en JSON estructurado. Un POST al actor
scraper.copilotdevuelve el texto de la respuesta, las citas detrás de ella y los enlaces encontrados, todo como campos, no como una captura de pantalla. - Tres entradas ejecutan todo.
promptcontiene la pregunta, uncountryopcional ajusta la ejecución a la salida residencial en ese mercado, y unmodeopcional selecciona el estilo de respuesta de Copilot. - Las citas llegan listas para graficar.
citationslista cada fuente citada como{ title, url }— el material en bruto para el seguimiento de la cuota de cita sin un paso de análisis. - El formato nunca cambia. Cada llamada devuelve
{ status, task_id, task_result }, la misma estructura que los demás actores LLM de Scrapeless, por lo que un envoltorio escrito para Copilot se extiende a ChatGPT, Grok, Gemini y Perplexity sin cambios. - Sin navegador que cuidar. Renderizado, manejo de sesiones y rotación de proxies se ejecutan del lado del servidor; solo llamas a un endpoint con un encabezado
x-api-tokeny recibes JSON a cambio. - Gratis para comenzar. Las nuevas cuentas de Scrapeless incluyen créditos de prueba gratuitos — regístrate en app.scrapeless.com.
Introducción: Copilot responde donde el comprador ya trabaja
Microsoft Copilot está integrado en Windows, Edge, Microsoft 365 y Bing — por lo que para una gran parte de los usuarios empresariales, Copilot es el asistente que preguntan primero. Cuando ese usuario pregunta por el mejor CRM, el mejor proveedor de proxies o la mejor herramienta de soporte técnico, Copilot devuelve una respuesta sintetizada corta con un puñado de fuentes citadas. Una marca está mencionada en esa respuesta, o es invisible para ese comprador.
Rastrear esa respuesta a mano no escala: la respuesta se genera fresca cada vez, las fuentes citadas rotan y la redacción cambia de ejecución a ejecución. Para monitorearlo como datos, necesitas la respuesta y sus citas como campos estructurados.
Esta guía recorre el actor scraper.copilot en la API de Raspado Scrapeless — un único POST autenticado que devuelve el texto de respuesta de Copilot, sus citas y sus enlaces como JSON, en el mismo formato que el resto de la línea de respuestas LLM de Scrapeless.
Lo Que Puedes Hacer Con Esto
- Rastrear la visibilidad de la marca en Copilot. Ejecuta un conjunto fijo de prompts de intención de compra y verifica si tu marca aparece en el texto de la respuesta y la lista de citas.
- Medir la cuota de cita. Agrupa las URLs de
citationspor dominio para ver en qué fuentes se apoya Copilot para un tema y dónde te clasificas frente a ellas. - Comparar Copilot con otros motores. Envía el mismo prompt a
scraper.copilot,scraper.chatgpt,scraper.gemini, yscraper.perplexityy compara las respuestas y fuentes lado a lado. - Monitorear el desvío de respuestas. Captura el mismo prompt en un horario y grafica cómo cambian la respuesta y sus citas a lo largo de las semanas.
- Alimentar canalizaciones intermedias. El
result_textestructurado ycitationsse integran directamente en una base de datos, un panel de control o un conjunto de evaluación LLM.
Por Qué el Raspador de Copilot de Scrapeless
Copilot es una aplicación de JavaScript detrás de la autenticación de Microsoft y defensas contra la automatización; una solicitud HTTP en bruto no devuelve nada útil, y manejar tú mismo una sesión de navegador real implica renderizado, inicio de sesión y rotación de proxies para mantener. El Raspador de Copilot de Scrapeless — parte de la API Universal de Raspado — ejecuta esa superficie del lado del servidor y devuelve JSON limpio. Para Copilot específicamente, ofrece:
- Salida residencial en más de 195 países, por lo que un valor
countrycaptura la respuesta que vería un usuario real en ese mercado. - Renderizado y manejo de sesiones del lado de la nube — sin navegador que ejecutar, iniciar sesión o mantener.
- Un formato de respuesta estable compartido con todos los demás actores LLM de Scrapeless, por lo que un cliente cubre toda la línea.
- Citas como campos de primera clase —
{ title, url }por cada fuente, listas para agrupar y contar.
Obtén tu clave API en el plan gratuito en app.scrapeless.com.
Requisitos Previos
- Una cuenta de Scrapeless y una clave API (el plan gratuito incluye créditos de prueba) — app.scrapeless.com.
- La clave exportada como una variable de entorno para que nunca se almacene en el código fuente:
bash
export SCRAPELESS_API_KEY="tu_api_token_aquí"
curlpara una primera captura y Python 3 conrequestspara el cliente trabajado a continuación.
Cómo funciona el raspador Copilot
Nombras al actor, le das una entrada y envías tu clave en un encabezado.
- Endpoint:
POST https://api.scrapeless.com/api/v2/scraper/execute - Actor:
scraper.copilot - Encabezado de autenticación:
x-api-token: $SCRAPELESS_API_KEY
Parámetros de solicitud
| campo de entrada | requerido | descripción |
|---|---|---|
prompt |
sí | la pregunta a enviar a Copilot |
country |
no | código de país de dos letras que indica la salida residencial de la ejecución (por ejemplo, US) |
mode |
no | estilo de respuesta de Copilot; smart es el valor predeterminado en capturas recientes |
Captura rápida con curl
bash
curl -sS -X POST https://api.scrapeless.com/api/v2/scraper/execute \
-H "Content-Type: application/json" \
-H "x-api-token: ${SCRAPELESS_API_KEY}" \
-d '{
"actor": "scraper.copilot",
"input": { "prompt": "¿Cuáles son los mejores proveedores de proxy en 2026?", "country": "US", "mode": "smart" }
}'
Sobre del response
json
// muestra ilustrativa — esquema de una ejecución en raspador.copilot; valores resumidos
{
"status": "success",
"task_id": "…",
"task_result": {
"prompt": "¿Cuáles son los mejores proveedores de proxy en 2026?",
"mode": "smart",
"result_text": "El mejor proveedor depende de tu caso de uso… [1]",
"citations": [
{ "title": "10 Mejores Proveedores de Proxy para 2026: Probados y Clasificados", "url": "https://…" }
],
"links": [
"https://…"
]
}
}
Campo por campo:
| campo | tipo | qué contiene |
|---|---|---|
status |
string | success en una ejecución completada |
task_id |
string | el identificador de la ejecución, útil como clave de auditoría en tu propio almacén |
task_result.prompt |
string | el prompt tal como lo recibió Copilot |
task_result.mode |
string | el modo de respuesta que produjo la respuesta (por ejemplo, smart) |
task_result.result_text |
string | la respuesta completa en markdown, sin eliminar los marcadores de cita en línea |
task_result.citations[] |
array | cada fuente citada como { title, url } |
task_result.links[] |
array | enlaces desnudos que aparecen junto con la respuesta, cuando están presentes |
Obtén tu clave API en el plan gratuito: app.scrapeless.com
Integrando la API en Python
Un cliente completo: envía el prompt, verifica el sobre e imprime la tabla de citas.
python
import os
import requests
ENDPOINT = "https://api.scrapeless.com/api/v2/scraper/execute"
def ask_copilot(prompt: str, country: str = "US", mode: str = "smart") -> dict:
resp = requests.post(
ENDPOINT,
headers={
"Content-Type": "application/json",
"x-api-token": os.environ["SCRAPELESS_API_KEY"],
},
json={"actor": "scraper.copilot", "input": {"prompt": prompt, "country": country, "mode": mode}},
timeout=180,
)
resp.raise_for_status()
return resp.json()
if __name__ == "__main__":
data = ask_copilot("¿Cuáles son los mejores proveedores de proxy en 2026?")
result = data.get("task_result", {})
citations = result.get("citations") or []
print(f"status={data.get('status')} mode={result.get('mode')} citations={len(citations)}")
for i, c in enumerate(citations, 1):
print(f" [{i}] {c.get('title', '')[:60]} → {c.get('url', '')[:60]}")
El cuerpo de la respuesta permanece en result.get("result_text") como markdown; para el trabajo de citación, el bucle anterior suele ser todo el trabajo: agrupa las URLs impresas por dominio y cuenta.
Actores compañeros para el resto del paisaje de respuestas AI
El mismo endpoint, encabezado y sobre cubren las plataformas vecinas; solo cambia el nombre del actor y un campo o dos específicos de la plataforma:
scraper.chatgpt— mismo input de prompt/pais; devuelveresult_textmás un array de citascontent_referencesy el panelsearch_result.scraper.grok— agrega unmodede razonamiento requerido y devuelve paneles de citas separadasweb_search_resultsyx_search_results.scraper.gemini— mismo input de dos campos que ChatGPT; devuelveresult_textmás un array decitations.scraper.perplexity— toma uncountryrequerido y un flagweb_search; devuelveweb_results,media_itemsy prompts relacionados.scraper.overview/scraper.aimode— bloque de AI Overview de Google y pestaña AI Mode; la guía de AI Overview cubre ese par de extremo a extremo.
Los precios para la línea se basan en el uso con créditos de prueba gratuitos al registrarse; los niveles actuales están en la página de precios.
Cómo evitar problemas comunes
- Citas vacías en algunas solicitudes. Copilot no cita fuentes para cada respuesta: las solicitudes con matiz de opinión o puramente generativas pueden regresar sin citas. Para hacer seguimiento de las citas, formula las solicitudes de la manera en que lo haría un comprador investigador ("mejor X para Y"), lo que activa de manera confiable respuestas fundamentadas en la web.
- Las respuestas varían de ejecución a ejecución. La misma solicitud puede producir una respuesta y un conjunto de citas diferentes en cuestión de minutos; esa volatilidad es el fenómeno que estás midiendo. Almacena cada captura con su
task_idy marca de tiempo y trata la serie, no cualquier ejecución individual, como la señal. - Considera cada campo como nullable.
linksa menudo está vacío y los recuentos de citas fluctúan entre ejecuciones. Lee lo que está presente en lugar de afirmar una forma fija. - Fija el país de manera deliberada. Una ejecución no fijada captura una respuesta; una ejecución fijada captura la respuesta para un mercado que te interesa. Mantén el valor de
countryen tus registros almacenados para que las series sigan siendo comparables.
Conclusión: Respuestas de Copilot como una dependencia de una línea
Copilot es un asistente de primer nivel para una amplia base de usuarios de Windows, Edge y Microsoft 365, y la respuesta que devuelve decide si tu marca es vista. El actor scraper.copilot convierte esa respuesta en un registro estructurado — texto, citas, enlaces — en el mismo sobre que cada otro actor LLM de Scrapeless, por lo que monitorear a Copilot es una adición de una línea a un pipeline que ya puedes estar ejecutando para ChatGPT o Gemini.
¿Listo para construir tu pipeline de datos de respuestas de IA?
Únete a nuestra comunidad para reclamar un plan gratuito y conectar con desarrolladores que construyen pipelines de respuestas de IA: Discord · Telegram.
Regístrate en app.scrapeless.com para obtener créditos de prueba gratuitos y dirige el actor scraper.copilot hacia las solicitudes, mercados y horarios que necesita tu programa de monitoreo.
FAQ
P: ¿Es legal extraer las respuestas de Microsoft Copilot?
R: El actor lee contenido de respuesta disponible públicamente, el mismo que ve un visitante. Al igual que con cualquier extracción, restringe el uso a datos públicos, respeta los términos de la plataforma, evita recopilar datos personales y consulta con un abogado si un caso de uso no está claro.
P: ¿Necesito una cuenta de Microsoft o manejar el inicio de sesión?
R: No. La autenticación, el manejo de sesiones y el rendering se realizan del lado del servidor; envías una solicitud y lees JSON de vuelta.
P: ¿Por qué son diferentes las citas cada vez que ejecuto la misma solicitud?
R: Copilot genera respuestas dinámicamente y vuelve a seleccionar fuentes por ejecución, por lo que el conjunto de citas varía. Esa variabilidad de ejecución a ejecución es la señal que una serie de monitoreo está diseñada para rastrear: almacena cada captura con su task_id y marca de tiempo.
P: ¿Puedo capturar la respuesta para un país específico?
R: Sí. Pasa un código de país de dos letras en la entrada para fijar la ejecución a la salida residencial en ese mercado, así capturas la respuesta que vería un usuario local.
P: ¿En qué se diferencia esto del extractor de ChatGPT o Gemini?
R: Solo el nombre del actor y uno o dos campos. scraper.copilot devuelve sus citas bajo citations; el sobre { status, task_id, task_result } es idéntico, por lo que un cliente cubre toda la línea de respuestas LLM.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



