Volver al blog

Cómo alimentar a los agentes de IA con datos web en tiempo real: Una guía de pipeline de producción.

Daniel Kim
Daniel Kim

Lead Scraping Automation Engineer

29-Jul-2026

TL;DR:

  • Los datos web en tiempo real para agentes de IA son un problema de ingeniería de datos antes de ser un problema de modelo. La recopilación, validación, frescura y procedencia determinan si un agente puede confiar en lo que recupera.
  • Mantenga la ingestión programada separada de las llamadas de agentes dirigidas al usuario. Atienda preguntas comunes desde almacenes preparados y reserve la adquisición en vivo para hechos cuyo valor disminuye rápidamente.
  • Asigne a cada página una URL canónica, un hash de contenido, una versión de esquema, tiempo de colección y política de origen. Rechace registros inválidos antes de que lleguen a las incrustaciones o solicitudes.
  • Utilice Craw para la ingestión repetible de sitios y herramientas MCP de navegador para tareas limitadas e interactivas. Ambos deben alimentar el mismo contrato de validación y procedencia.
  • Mida el retraso de frescura, la duración de adquisición, la tasa de duplicados, la tasa de rechazo de esquema y el costo por documento aceptado. La latencia del modelo por sí sola no describe la experiencia del usuario.

Un agente de IA solo puede razonar sobre el contexto que recibe. Si ese contexto es obsoleto, duplicado, malformado o le falta su fuente, un modelo más fuerte seguirá produciendo una respuesta débil.

Eso convierte a los datos web en tiempo real para agentes de IA en una cuestión de diseño de canal. El objetivo no es raspar una página durante cada conversación. El objetivo es entregar la evidencia pública permitida correcta, dentro de una ventana de frescura definida, en una forma que el agente pueda recuperar y citar.

Por qué los datos web frescos necesitan su propio sistema

El entrenamiento del modelo crea una instantánea. Los precios de productos, inventario, páginas de políticas, documentación, horarios de eventos y noticias cambian después de que se hace esa instantánea. La recuperación puede cerrar la brecha, pero solo si la capa de origen responde a cuatro preguntas:

  1. ¿Lo suficientemente fresco para qué decisión? Una verificación de disponibilidad de producto puede necesitar minutos; una página de referencia técnica puede tolerar una actualización diaria.
  2. ¿Recopilado de dónde? El registro necesita una URL de origen canónica y tiempo de colección.
  3. ¿Válido bajo qué contrato? El contenido debe satisfacer el esquema esperado por las herramientas de abajo.
  4. ¿Permitido para este uso? Las reglas de origen, directivas de robots, términos del sitio, obligaciones de privacidad y políticas internas pertenecen a la decisión de ingestión.

Por lo tanto, "en tiempo real" debería ser un objetivo de servicio, no una etiqueta. Defina una edad máxima aceptable por clase de origen. Una vez que el registro exceda esa edad, el agente puede solicitar una actualización en vivo, revelar que la copia almacenada es más antigua o negarse a responder.

Arquitectura de referencia para un canal web preparado para agentes

Un camino de producción se puede dividir en nueve etapas:

Registro de fuente → programador o solicitud de agente → frontera de URL → adquisición → validación de contenido → normalización y deduplicación → almacenamiento estructurado → índice de recuperación → herramienta de agente

Cada límite tiene una responsabilidad estrecha.

Etapa Entrada Salida Límite de falla
Registro de fuente Dominio y política Caminos permitidos, cadencia, localización Permiso o propietario desconocido
Programador Objetivo de frescura Trabajos de colección Trabajo excesivo o duplicado
Frontera de URL Semillas y enlaces descubiertos URLs canónicas Bucles y escape de ámbito
Adquisición URL canónica HTML, Markdown, enlaces, metadatos Contenido vacío o inesperado
Validación Documento en bruto Registro aceptado o en cuarentena Incompatibilidad de esquema o contenido
Normalización Registro aceptado Texto y campos estables Dañado por boilerplate o codificación
Deduplicación URL y hashes de contenido Documento nuevo o cambiado Embeddings duplicados
Almacenamiento e índice Registro versionado Búsqueda por palabra clave, vector o híbrido Procedencia faltante
Herramienta de agente Consulta y política Paquete de evidencia Evidencia obsoleta o insuficiente

La herramienta dirigida al agente nunca debería tener que entender HTML objetivo. Debería recibir un objeto estable como title, source_url, collected_at, content, content_hash y schema_version.

Para una visión complementaria de casos de uso y criterios de evaluación, vea los benchmarks de datos web existentes para agentes de IA. Esta guía se mantiene enfocada en el canal de producción detrás de esas aplicaciones.

Elija un camino de frescura antes de recopilar

Hay tres patrones de adquisición útiles.

Ingestión programada en segundo plano

Utilice la ingestión programada para fuentes que muchos usuarios consultan repetidamente. Raspe, limpie e indexe los datos fuera del camino de conversación. El agente lee registros preparados, de modo que una fuente lenta no se convierta en latencia dirigida al usuario.

Esto suele ser lo mejor para documentación, catálogos, repositorios de políticas y fuentes de noticias monitoreadas. La programación debe seguir la frecuencia de cambio observada en lugar de un trabajo universal por hora.

Adquisición bajo demanda

Utilice una solicitud en vivo cuando la respuesta pierda valor rápidamente o la URL no se conozca de antemano. El agente invoca una herramienta limitada, recibe contenido, lo valida y añade la evidencia a la tarea actual.
La documentación del MCP del navegador Scrapeless lista herramientas como scrape_markdown, scrape_html y acciones de sesión del navegador. El protocolo en sí estandariza cómo las herramientas exponen capacidades y resultados a los modelos; la especificación del Protocolo de Contexto del Modelo es la autoridad para esa interfaz.

Actualización híbrida

Sirve el registro indexado primero, luego actualízalo solo cuando su antigüedad supere el objetivo de la fuente o el usuario pida explícitamente el estado más reciente. Esto mantiene los caminos comunes rápidos mientras preserva una ruta hacia evidencia actual.

Un diseño híbrido también le da al producto un retroceso claro: si la adquisición en vivo no está disponible, el agente puede identificar la antigüedad del registro más reciente aceptado en lugar de presentarlo silenciosamente como actual.

Rote cada fuente a la capa de adquisición correcta

Las páginas simples pueden exponer contenido completo en el HTML inicial. Otras páginas renderizan campos importantes con JavaScript, varían por geografía o devuelven un intersticial en lugar de la página esperada.

El enrutamiento debe utilizar el comportamiento de la página:

Comportamiento de la fuente Opción de adquisición Señal de validación
HTML público estable Rastrear una sola página Encabezado o selector requerido
Conjunto de documentación enlazada Rastreo recursivo con límites de ruta Conteo de páginas y ruta permitida
Página pública renderizada por JavaScript Navegador para raspado o rastreo habilitado para navegador Campo renderizado esperado
Búsqueda interactiva Sesión MCP del navegador Resultado de la herramienta más URL de la fuente
Punto final público con un contrato documentado Llamada API directa Esquema de respuesta

El iniciador rápido de Scrapeless Crawl documenta la recolección de una sola página, por lotes y subpáginas con salida de Markdown, HTML, enlaces y metadatos. Para la representación interactiva, el producto del Navegador para raspado mantiene la ejecución del navegador fuera de la aplicación del agente.

No aceptes una respuesta simplemente porque la solicitud HTTP se completó. Verifica un marcador específico de la página, longitud mínima de contenido, idioma, tipo MIME y cualquier campo requerido. Una página de desafío, shell de consentimiento o raíz de aplicación vacía deberían entrar en cuarentena, no en el índice de conocimiento.

Normalizar URLs y eliminar duplicados antes de las incrustaciones

La deduplicación de URL evita adquisiciones repetidas. La deduplicación de contenido evita que fragmentos repetidos compitan en la recuperación.

La canonicalización comúnmente incluye:

  • convertir a minúsculas el nombre de host;
  • eliminar el fragmento;
  • resolver enlaces relativos;
  • ordenar o eliminar parámetros de seguimiento aprobados;
  • normalizar las barras finales bajo una política de sitio;
  • rechazar esquemas y hosts fuera del registro de la fuente.

Luego se calculan dos hashes:

  • Hash de URL: la clave de idempotencia para la colección y almacenamiento;
  • Hash de contenido: el detector de cambios después de la eliminación del boilerplate.

Si el hash de URL existe y el hash de contenido no ha cambiado, actualiza los metadatos de frescura sin crear otro conjunto de incrustaciones. Si el hash de contenido cambia, retén la versión anterior el tiempo suficiente para la auditoría o política de reversión, luego indexa el nuevo registro aceptado.

Validar un contrato de ingestión

JSON Schema le da a la tubería un límite verificable por máquina. Su guía oficial paso a paso explica cómo los tipos, propiedades requeridas y restricciones anidadas definen un JSON válido.

El siguiente bloque es un esquema ilustrativo. Los equipos deben ampliarlo con sus propias clasificaciones de fuente y reglas de retención.

json Copy
{
  "$schema": "https://json-schema.org/draft/2020-12/schema",
  "type": "object",
  "required": [
    "source_url",
    "collected_at",
    "content",
    "content_hash",
    "schema_version"
  ],
  "properties": {
    "source_url": { "type": "string", "format": "uri" },
    "collected_at": { "type": "string", "format": "date-time" },
    "title": { "type": ["string", "null"] },
    "content": { "type": "string", "minLength": 200 },
    "content_hash": { "type": "string", "pattern": "^[a-f0-9]{64}$" },
    "schema_version": { "const": "agent-document-v1" },
    "provenance": {
      "type": "object",
      "required": ["collector", "permission_class"],
      "properties": {
        "collector": { "enum": ["crawl", "browser-mcp", "direct-api"] },
        "permission_class": { "enum": ["public-authorized", "owned"] }
      }
    }
  },
  "additionalProperties": false
}

La validación del esquema debe realizarse antes de la fragmentación. De lo contrario, un documento mal formado puede crear incrustaciones costosas y aún así fallar cuando el agente espera un campo que falta.

Construir una función mínima de ingestión de Crawl

El SDK de Scrapeless Node actual expone ScrapingCrawl para la recopilación de páginas y sitios. Este ejemplo de brecha de requisitos requiere Node.js, @scrapeless-ai/sdk versión 1.3.1, una SCRAPELESS_API_KEY y un objetivo público autorizado. Normaliza una página en el contrato utilizado anteriormente; ejecútelo solo después de agregar la validación del esquema y el almacenamiento para el entorno objetivo.

javascript Copy
import { createHash } from "node:crypto";
import { ScrapingCrawl } from "@scrapeless-ai/sdk";

const crawl = new ScrapingCrawl({
  apiKey: process.env.SCRAPELESS_API_KEY
});

function sha256(value) {
  return createHash("sha256").update(value).digest("hex");
}

export async function collectAgentDocument(sourceUrl) {
  const result = await crawl.scrapeUrl(sourceUrl, {
    formats: ["markdown"],
    onlyMainContent: true,
    timeout: 15000
  });

  const content = result.markdown ?? result.data?.markdown;
  if (typeof content !== "string" || content.length < 200) {
    throw new Error("El contenido recopilado no cumplió con el contrato de aceptación");
  }

  return {
    source_url: new URL(sourceUrl).href,
    collected_at: new Date().toISOString(),
    title: result.metadata?.title ?? null,
    content,
    content_hash: sha256(content),
    schema_version: "agent-document-v1",
    provenance: {
      collector: "crawl",
      permission_class: "public-authorized"
    }
  };
}

El código mantiene la adquisición y normalización juntas por legibilidad. En producción, coloque la validación del esquema, el almacenamiento y la indexación en consumidores separados para que cada etapa pueda escalar y ser observada de manera independiente.

Publicar datos limpios para la recuperación de agentes

Markdown es útil para la fragmentación semántica porque los encabezados preservan la estructura del documento. JSON es mejor para entidades como productos, precios, ubicaciones y horarios. Muchos sistemas necesitan ambos:

  • almacenar el Markdown normalizado para la cita y recuperación de pasajes;
  • extraer campos JSON estables para filtros y cálculos;
  • mantener HTML en bruto solo cuando la auditoría o el posterior análisis lo requieren;
  • adjuntar la procedencia a cada fragmento y fila estructurada.

La búsqueda vectorial por sí sola no es un diseño de recuperación completo. Utilice filtros de metadatos para la fuente, el local, la antigüedad de la colección y la clase de permiso. La búsqueda por palabra clave puede preservar identificadores exactos y códigos de error. Luego, una etapa de clasificación híbrida puede combinar similitud semántica con coincidencias exactas y frescura.

La herramienta del agente debe devolver un paquete de evidencia, no un volcado de documento sin límites. Una respuesta útil incluye los pasajes seleccionados, las URL de origen, los tiempos de recopilación y una decisión de frescura. Esto hace que la representación de citas y el comportamiento de rechazo sean deterministas.

Hacer que el pipeline sea observable

Instruya cada límite con un ID de correlación que siga una URL de origen desde la programación hasta la respuesta del agente. OpenTelemetry define trazas, métricas, registros y carga útil como señales de telemetría en su documentación oficial de señales.

Comience con estas medidas:

Medida Lo que revela Dimensión útil
Retraso de frescura Edad del registro aceptado Clase de fuente
Duración de adquisición Tiempo pasado antes de la validación Dominio y ruta
Tasa de aceptación Porcentaje que entra en el índice Razón del validador
Tasa de duplicados Trabajo evitado URL o hash de contenido
Conteo de cuarentena Contratos de fuente rotos Fuente y razón
Costo por documento aceptado Eficiencia de pipeline Ruta de adquisición
Cobertura de evidencia del agente Respuestas con fuentes válidas Herramienta y clase de consulta

Evite publicar números de rendimiento inventados. Establezca un conjunto de prueba de URLs autorizadas, registre marcas de tiempo por etapa e informe percentiles con la mezcla de fuentes y el tamaño de la muestra. La latencia del usuario de extremo a extremo debe incluir la adquisición solo cuando la solicitud realmente tome el camino en vivo.

Reducir costos y latencia sin ocultar la antigüedad

Los mayores ahorros a menudo suceden antes de la inferencia del modelo:

  1. Filtrar URLs no permitidas y fuera de alcance antes de la adquisición.
  2. Verificar los hashes de URLs antes de solicitar páginas de detalle.
  3. Omitir la incrustación cuando el hash de contenido normalizado no haya cambiado.
  4. Fragmentar según la estructura del documento en lugar de solo fragmentos fijos.
  5. Almacenar campos estructurados pequeños por separado del texto largo.
  6. Aplicar objetivos de frescura por fuente en lugar de refrescar todo a un mismo ritmo.
  7. Dirigir el trabajo del navegador interactivo solo a las páginas que lo requieren.
    Para cargas de trabajo con muchas páginas vinculadas, Scrapeless Crawl puede manejar el descubrimiento y la adquisición de páginas mientras que la aplicación se encarga de la política, el esquema, el almacenamiento y la recuperación. Compare el presupuesto de adquisición en la página de precios de Scrapeless contra el costo medido por documento aceptado. Esta separación permite al equipo optimizar cada capa sin acoplar el agente a las operaciones del navegador.

Lista de verificación de gobernanza para datos web públicos

Antes de agregar una fuente:

  • confirme que los datos son públicos y que el uso está autorizado;
  • revise los términos aplicables, contratos, reglas de privacidad y leyes locales;
  • siga la política de robots del sitio y la guía de tasa de solicitudes;
  • excluya datos personales, autenticados o sensibles a menos que exista una base legal documentada y una autorización de acceso;
  • registre el propietario de la fuente, el propósito comercial, el período de retención y la ruta de eliminación;
  • ofrezca a los usuarios posteriores acceso solo a los campos requeridos para su tarea.

El Protocolo de Exclusión de Robots está estandarizado en RFC 9309. Las reglas de robots no reemplazan los términos, deberes de privacidad o revisión legal; son una entrada a la política de la fuente.

Conclusión: diseñar la frescura como un contrato de datos

Los datos web en tiempo real para agentes de IA se vuelven manejables cuando la frescura, validez, procedencia y permiso son campos explícitos. Los trabajos programados de Crawl pueden mantener el conocimiento común listo, mientras que las acciones limitadas de Browser MCP pueden manejar hechos interactivos. Ambos caminos deberían converger en el mismo contrato de validación y recuperación.

Para construir la primera porción de producción, cree una cuenta de Scrapeless, elija una fuente autorizada, fije su objetivo de frescura, recójala a través de Crawl y mida el camino desde la adquisición hasta la evidencia aceptada antes de agregar más dominios.

Preguntas Frecuentes

¿Qué son los datos web en tiempo real para agentes de IA?

Son contenido web recopilado dentro de una ventana de frescura que coincide con la decisión del agente. El registro debe incluir su fuente, tiempo de recopilación, esquema y procedencia para que el agente pueda recuperar y citarlo de manera segura.

¿Debería un agente de IA rastrear la web en cada solicitud?

No. Las fuentes de uso frecuente son generalmente mejor recolectadas en segundo plano y servidas desde un almacenamiento indexado. La adquisición en vivo es apropiada cuando el hecho cambia rápidamente, la URL se descubre durante la tarea, o el registro almacenado es demasiado antiguo.

¿Cuál es la diferencia entre Crawl y Browser MCP?

Crawl es adecuado para la ingesta repetible de páginas, lotes y sitios vinculados. Browser MCP expone herramientas de navegador y extracción limitadas que un agente compatible con MCP puede invocar durante una tarea interactiva. Sus salidas pueden compartir una capa de validación y procedencia.

¿Cómo debe una tubería prevenir el contexto duplicado del agente?

Utilice un hash de URL canónica para evitar trabajos de colección duplicados y un hash de contenido normalizado para detectar documentos sin cambios. Reconstruya las incrustaciones solo cuando el contenido aceptado cambie.

¿Son automáticamente seguros de usar los datos web públicos?

No. La visibilidad pública no elimina las obligaciones contractuales, de privacidad, de propiedad intelectual, de robots o jurisdiccionales. Defina una política de fuente aprobada y obtenga orientación legal para el uso previsto.

En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.

Artículos más populares

Catalogar