La web está obteniendo una capa de acceso: llms.txt, agentes firmados y pago por rastreo.
Expert Network Defense Engineer
La web ha pasado treinta años funcionando con un solo archivo de sistema de honor. robots.txt pide educadamente, no identifica a nadie y no hace cumplir nada, y durante la mayor parte de ese tiempo fue suficiente, porque la cosa que leía tus páginas era un motor de búsqueda que enviaba tráfico de regreso.
Ese intercambio se ha roto, y cuatro esfuerzos separados están tratando ahora de reemplazarlo. No son versiones en competencia de la misma idea. Responden a tres preguntas diferentes: qué leer, quién pregunta y cuánto cuesta, y solo uno de ellos es un estándar terminado.
La Capa Que Realmente Falta Es la Identidad
Comencemos con lo que robots.txt puede y no puede hacer. El estándar del Protocolo de Exclusión de Robots ofrece a los editores una forma de expresar preferencias por cadena de agente de usuario. La debilidad está en esa última frase: una cadena de agente de usuario es una afirmación, no una credencial. Cualquiera puede enviar cualquier cadena, y las listas blancas de IP envejecen mal a medida que la infraestructura avanza.
Así que un editor que quiera tratar a dos rastreadores de manera diferente no tiene una forma confiable de distinguirlos. Cada propuesta a continuación está por debajo de esa brecha. La mecánica práctica del archivo en sí — sintaxis, directivas y cómo los recolectores deben leerlo — se cubre en la guía de robots.txt para raspado web.
llms.txt Responde "¿Qué Debería Leer?"
La propuesta llms.txt coloca un archivo Markdown en /llms.txt que contiene un resumen curado y enlaces a versiones de texto limpio de las páginas importantes de un sitio. La propuesta llms.txt fue publicada por Jeremy Howard en septiembre de 2024, y su problema declarado es las ventanas de contexto: los modelos no pueden ingerir un sitio completo, y convertir HTML a texto utilizable es con pérdida.
Vale la pena ser preciso sobre su estado, porque a menudo se describe como un estándar. El propio sitio lo llama "una propuesta para estandarizar". No hay RFC, no hay grupo de trabajo y no hay requisito de que alguien lo honre.
Lo que realmente se hace bien es la curaduría. Un editor que escribe uno dice aquí está la buena versión de mi contenido, lo que ayuda a un lector bien comportado y no cuesta nada a uno mal comportado. Expresa preferencia, no permiso, la misma limitación que tiene robots.txt.
Web Bot Auth Responde "¿Quién Está Preguntando?"
Esta es la pieza que aborda realmente la brecha de identidad. El enfoque: cada solicitud de un cliente automatizado lleva una firma criptográfica hecha con una clave privada perteneciente a su operador, de modo que el servidor de origen pueda verificar quién está llamando en lugar de confiar en un encabezado.
La especificación actual es el borrador de firmas HTTP de Web Bot Auth, un borrador individual activo de Internet que se basa en Firmas de Mensaje HTTP. Su propio marco es que las listas blancas de IP y las cadenas de agente de usuario no son una identificación adecuada.
Dos advertencias son importantes. Es una presentación individual en lugar del resultado de un grupo de trabajo, y un borrador de arquitectura anterior de los mismos autores ya ha caducado y ha sido reemplazado, lo cual es normal para el trabajo de estándares, pero es un signo de que esto es temprano. Y firmar prueba quién eres, no que estás autorizado. Le da a los editores algo para tomar decisiones; no toma la decisión.
Pago Por Raspado y RSL Responden "¿Cuánto Cuesta?"
Dos esfuerzos abordan la compensación, desde direcciones opuestas.
El pago por raspado de Cloudflare utiliza HTTP 402, el código de estado reservado para el pago en la especificación semántica de HTTP y que ha estado sin usar durante décadas. Los editores establecen un precio por solicitud y marcan cada rastrador como permitido, cobrado o bloqueado; los rastradores señalan su intención a través de encabezados de precio y son identificados por firmas de Web Bot Auth. Se anunció en julio de 2025 y sigue en beta privada — un experimento en vivo, no una infraestructura en la que se pueda construir.
RSL toma la ruta de licenciamiento. El estándar de Licenciamiento Realmente Simple define términos de licenciamiento legibles por máquina — atribución, pagar por raspado, pagar por inferencia — en XML que puede referenciarse desde robots.txt, HTML, encabezados HTTP, feeds RSS o archivos multimedia. RSL 1.0 se envió en 2025 con el apoyo de Akamai, Cloudflare, Creative Commons, Fastly, Reddit, O'Reilly Media, Vox Media, Yahoo y Ziff Davis.
De los cuatro, RSL es el más avanzado como especificación publicada con adopción en la industria nombrada. Eso no significa que esté establecido: una gramática de licenciamiento aún necesita a alguien dispuesto a hacerla cumplir, y la aplicación te regresa a la identidad.
La Pilas Que Implican
Leídas juntas, estas son capas en lugar de alternativas:
- Preferencia —
robots.txtyllms.txtdicen lo que un editor desearía. - Identidad — Web Bot Auth dice quién está preguntando, criptográficamente.
- Términos — RSL dice para qué se puede usar el contenido y a qué precio.
- Liquidación — flujos de estilo pago-por-crawling 402 dicen cómo se mueve realmente el dinero.
El orden es importante. Los términos sin identidad son inejecutables, y la liquidación sin términos es un peaje sin tarifa publicada. La identidad es la capa estructural, y es la menos acabada.
Dónde es Probable que Quede Corto
La objeción obvia a todo esto: nada aquí obliga a nadie que elija no participar. Un cliente que ignora llms.txt, no envía ninguna firma y nunca lee un archivo RSL está en exactamente la misma posición en la que siempre han estado los clientes. Estos mecanismos funcionan con operadores que quieren ser identificables — lo que representa la mayoría de los grandes, responsables, y ninguno de los demás.
El segundo problema es la consolidación. La identidad basada en firma favorece a los operadores lo suficientemente grandes como para operar infraestructura clave y hacer que sus claves sean reconocidas. Un investigador, una startup o un archivo de interés público pueden encontrar que la nueva capa de acceso es más difícil de entrar que el sistema de honor que reemplaza. Ese es un costo real, y vale la pena mencionarlo en lugar de tratarlo como un error de redondeo en una web más limpia.
En tercer lugar, nada de esto aborda la asimetría que causó el colapso. El crawling de la era de búsqueda intercambiaba acceso por tráfico. Un modelo que lee tu página y responde la pregunta por sí mismo no devuelve nada, y un carril de pago no restaura la relación: fija el precio de su ausencia.
Qué Hacer Realmente
Si publicas: escribe un llms.txt — es barato y expresa la curaduría que controlas. Observa RSL, porque una licencia legible por máquina es el artefacto en el que se centrará una disputa futura. Trata el pago-por-crawl como un experimento a seguir en lugar de un plan.
Si recopilas datos: el cambio duradero es convertirte en el tipo de cliente que estos sistemas están diseñados para acomodar. Identifícate honestamente, mantente en datos públicos, respeta las directrices que existen hoy, mantén el volumen proporcional y lleva un registro de lo que recopilaste y de dónde. Cada propuesta anterior recompensa a los operadores que pueden responder "¿quién eres y qué tomaste?" — y eso vale la pena hacerlo ahora, mientras la respuesta todavía sea voluntaria.
El sistema de honor está llegando a su fin. Lo que lo reemplaza está sin terminar, y la postura útil no es esperar a que llegue ni ignorarlo, sino comportarse ahora de la manera que requerirá la versión acabada.
Comienza con el plan gratuito Scrapeless para ver cómo el Agente AI de Scrapeless maneja datos web públicos, y revisa los precios de Scrapeless cuando planees un programa de recopilación.
Preguntas Frecuentes
P: ¿Es llms.txt un estándar oficial?
No. Se presenta explícitamente como una propuesta para estandarizar, publicada en septiembre de 2024. No hay un RFC ni un grupo de trabajo detrás de ello, y no hay requisito de que ningún cliente lo honre. Los sitios lo adoptan porque la curaduría ayuda a los lectores bien comportados, no porque algo lo imponga.
P: ¿Reemplaza llms.txt a robots.txt?
No — responden a diferentes preguntas. robots.txt, estandarizado en el RFC 9309, expresa qué rutas no debe recuperar un cliente. llms.txt señala el contenido que un editor considera más útil y ofrece versiones de texto más limpias de él. Uno restringe, el otro cura, y ninguno autentica al cliente.
P: ¿Qué problema resuelve realmente Web Bot Auth?
Verifica la identidad de un crawler. Hoy, un cliente se identifica con una cadena User-Agent que cualquiera puede copiar, por lo que los editores no pueden distinguir confiablemente entre crawlers. Web Bot Auth tiene cada solicitud firmada con la clave privada del operador utilizando Firmas de Mensajes HTTP, por lo que el origen puede verificar quién está llamando. Es un borrador individual activo de Internet, no un estándar terminado.
P: ¿Pueden los editores cobrar a los crawlers de IA hoy?
Solo experimentalmente. El pago-por-crawl de Cloudflare utiliza HTTP 402 con precios por solicitud y se anunció en julio de 2025, pero sigue en beta privada. RSL, publicado en 2025 con el apoyo de un grupo de empresas de infraestructura y editores, define términos de licencia legibles por máquina que incluyen pago-por-crawl y pago-por-inferencia — pero una licencia aún depende de que alguien se identifique y haga cumplir contra el cliente.
P: ¿Qué debería hacer un equipo de recolección de datos mientras esto se resuelve?
Comportaos como si la identidad y los términos ya estuvieran en vigor. Recoge solo datos públicos, respeta las directrices actuales, mantén el volumen de solicitudes proporcional a lo que un sitio puede ofrecer y registra lo que se ha recopilado y de dónde. Cada propuesta en la mesa recompensa a los operadores que pueden responder a esa pregunta, por lo que el trabajo no se pierde independientemente de cuál gane.
En Scrapeless, solo accedemos a datos disponibles públicamente y cumplimos estrictamente con las leyes, regulaciones y políticas de privacidad del sitio web aplicables. El contenido de este blog es sólo para fines de demostración y no implica ninguna actividad ilegal o infractora. No ofrecemos garantías y renunciamos a toda responsabilidad por el uso de la información de este blog o enlaces de terceros. Antes de realizar cualquier actividad de scraping, consulte a su asesor legal y revise los términos de servicio del sitio web de destino u obtenga los permisos necesarios.



