¿Qué es Microdata? Explicación de Datos Estructurados en HTML

¿Qué es Microdata?

Scrapeless Universal Scraping API recupera páginas web para flujos de trabajo de extracción de datos estructurados, incluidas las páginas cuyo contenido visible se renderiza con JavaScript.

TL;DR

  • Microdata anota HTML existente con significado legible por máquina. Agrega atributos a elementos ordinarios en lugar de mantener datos estructurados en un documento separado.
  • Un ítem de Microdata tiene un tipo y propiedades nombradas. Los atributos centrales definen el alcance, el vocabulario, la identidad, los nombres de propiedad y las referencias a elementos no descendientes.
  • Schema.org y Microdata son capas diferentes. Schema.org proporciona un vocabulario; Microdata proporciona una sintaxis para adjuntar ese vocabulario a HTML.
  • Microdatos es útil pero está estrechamente vinculado al marcado de la página. Los cambios en la plantilla pueden romper anotaciones o reglas de extracción, incluso cuando la página visible sigue viéndose correcta.
  • JSON-LD es a menudo más fácil de mantener para el marcado de búsqueda. Los microdatos siguen siendo válidos y pueden ser la mejor opción cuando la semántica debe permanecer vinculada a los elementos visibles.

Microdata es una sintaxis de datos estructurados incorporada en HTML. Permite a un editor identificar una cosa descrita en una página—como un producto, evento, persona, receta o artículo—y etiquetar las propiedades que pertenecen a esa cosa. Un navegador todavía renderiza los mismos encabezados, enlaces, imágenes y texto. Los atributos adicionales crean una capa adicional legible por máquina para analizadores, rastreadores, sistemas de búsqueda, herramientas de accesibilidad y software de extracción de datos.

The Sección de Microdatos de WHATWG del estándar HTML define el modelo de procesamiento. Ese contexto de estándares importa porque Microdata no es un widget visual ni un complemento de motor de búsqueda. Es parte del propio documento, y su significado sigue reglas sobre el alcance del elemento, los valores de propiedad, las URL y los elementos anidados.

Cómo Microdata Representa una Entidad

Microdata representa una entidad como un ítem con cero o más propiedades. Un ítem comienza en un elemento HTML que lleva el itemscope atributo. El opcional itemtype el atributo suministra una o más URL de vocabulario que definen qué tipo de entidad representa el elemento. Los elementos descendientes que llevan itemprop contribuir valores nombrados a ese ítem.

El valor no siempre proviene de texto visible. Un enlace contribuye con su URL, una imagen contribuye con su URL de origen, un elemento de tiempo puede contribuir con un valor de fecha y hora legible por máquina, y un elemento meta puede llevar un valor que no necesita aparecer como prosa ordinaria. Por lo tanto, un analizador sigue las reglas de valor de Microdata en lugar de eliminar etiquetas y leer cualquier texto que quede.

Dos atributos adicionales cubren relaciones que la simple anidación no puede expresar. itemid da a un elemento tipado un identificador global cuando el vocabulario admite uno. itemref puntos a elementos en otras partes del mismo documento cuyas propiedades deben incluirse en el elemento. Estas características ayudan con las plantillas reales, pero también significan que un extractor debe implementar el modelo completo en lugar de escanear elementos aislados. itemprop cadenas.

Atributos de Microdatos a simple vista

AtributoReglas: 1. Salida SOLAMENTE del texto traducido — sin explicaciones, sin código extra de envoltura. 2. Preservar la estructura Markdown/HTML exactamente (encabezados, listas, enlaces, tablas). 3. Mantener cualquier token de marcador de posición como @@CODEBLOCK_0@@ o @@INLINECODE_0@@ EXACTAMENTE como están; nunca traducir, reordenar, fusionar o reformatear. 4. NO agregar ni eliminar ``` cercos de código, y NO envolver texto normal en un bloque de código.Error común
itemscopeCrea un nuevo elemento.Agregando propiedades sin un elemento propietario claro.
itemtypeVínculos el artículo a un tipo de vocabulario.Usando una etiqueta donde se espera una URL de vocabulario absoluta.
itempropNombra una propiedad del elemento actual.Por favor, proporciona el texto que deseas traducir.
itemidIdentifica un elemento tipado globalmente cuando se permite.Tratándolo como una clave de base de datos arbitraria.
itemrefIncluye propiedades de los elementos referenciados.Ignorando nodos referenciados durante la extracción.

Dónde encaja Schema.org

Schema.org es un vocabulario compartido, mientras que Microdata es una sintaxis de serialización. El material de inicio de Schema.org tipos de documentos como Producto y Evento y propiedades como nombre, imagen y startDate. Un editor puede expresar muchos de esos mismos términos con Microdata, RDFa o JSON-LD. Cambiar la sintaxis no cambia automáticamente el vocabulario o el modelo de entidad previsto.

Esta distinción previene un error común de planificación. Un equipo puede decir que “usa Schema” cuando las preguntas reales son separadas: ¿Qué tipos de vocabulario describen correctamente la entidad empresarial? ¿Qué formato se adapta a la pila de renderizado? ¿Qué consumidores apoyan la combinación elegida? ¿Qué reglas de validación se aplican a una característica de búsqueda particular? Responder esas preguntas de manera independiente produce un marcado más limpio y una extracción más confiable.

Cómo los Parsers Extraen Microdata

Un extractor conforme comienza con elementos de nivel superior, determina el tipo e identificador de cada elemento, luego resuelve los valores de las propiedades de los descendientes y cualquier nodo referenciado. Los elementos anidados permanecen como valores estructurados en lugar de ser aplanados en texto no relacionado. Las propiedades con valor URL se resuelven contra la URL base del documento, por lo que el valor final puede diferir del atributo literal encontrado en el HTML fuente.

La extracción de producción añade otra pregunta: ¿qué documento debería ser analizado? El HTML del servidor puede ya contener Microdata, o una aplicación cliente puede agregar atributos después de la ejecución de JavaScript. Una respuesta HTTP cruda y un DOM renderizado pueden, por lo tanto, exponer diferentes datos estructurados. La etapa de adquisición debe ser registrada junto con la salida para que los usuarios posteriores sepan si el conjunto de datos refleja el HTML fuente o un estado renderizado por el navegador.

Microdata, JSON-LD y RDFa

Microdata coloca propiedades directamente en elementos HTML. JSON-LD generalmente mantiene un objeto JSON en un bloque de script, separado del contenido visible. RDFa también anota el marcado, pero proviene del modelo de datos RDF y apoya patrones de datos enlazados más allá del flujo de trabajo típico de publicación de Schema.org. Los tres pueden expresar datos estructurados, sin embargo crean diferentes compensaciones de mantenimiento y extracción.

La guía de datos estructurados de Google Search Central recomienda JSON-LD cuando la configuración de un sitio lo soporta porque la separación de la presentación hace que los datos anidados sean más fáciles de mantener. Esa recomendación no invalida Microdata. Microdata puede ser sensato cuando las plantillas ya vinculan cada propiedad semántica a un elemento visible y la organización quiere que la anotación se mueva con ese elemento.

PreguntaMicrodataJSON-LDRDFa
Dónde viven los valoresEn elementos HTMLEn un bloque JSON-LDEn elementos HTML
Acoplamiento de presentaciónAltoBajoAlto
Fuerza típicaAlineación de contenido visibleMantenimiento de plantillasExpresión de datos enlazados
Necesidad de extracciónAnálisis de elementos conscientes de HTMLAnálisis JSON más manejo de gráficosAnálisis consciente de RDFa

Modos de Falla Comunes de Microdata

El ámbito roto es la falla más básica. Una propiedad puede estar colocada fuera del elemento que posee el ítem relevante, causando que un parser lo adjunte en otro lugar o lo ignore. Los entidades anidadas también pueden estar modeladas incorrectamente: una dirección a menudo debería ser un ítem con sus propias propiedades, no una cadena ensamblada a partir de cualquier texto que esté cerca.

La deriva de vocabulario crea un defecto más sutil. Un nombre de propiedad puede ser válido para un tipo pero no para otro, o una función de búsqueda puede requerir campos que el vocabulario general considera opcionales. La validación debería ocurrir, por lo tanto, en dos niveles: sintaxis y corrección del modelo de datos, seguido de verificaciones de elegibilidad específicas del consumidor. Pasar una prueba no garantiza un resultado rico o una presentación particular.

La verdad duplicada es otro riesgo. Un sitio puede tener Microdata junto a JSON-LD y exponer diferentes precios, fechas o URLs canónicos en cada uno. Los extractores deberían preservar la procedencia y seleccionar una representación autoritaria o informar del conflicto. Los editores deberían generar todos los formatos estructurados a partir de una fuente de datos en lugar de editarlos de manera independiente.

Usos Prácticos Más Allá de la Apariencia en Búsquedas

Extracción de entidades

Un crawler puede mapear propiedades de producto, evento, organización o artículo en registros tipados sin inferir cada campo a partir de la prosa circundante.

Aseguramiento de calidad

Un trabajo de monitoreo puede comparar valores visibles con valores legibles por máquina y marcar precios obsoletos, identificadores faltantes o anidamientos inválidos.

Migración de contenido

Un pipeline de migración puede preservar los metadatos de la entidad mientras mueve páginas entre sistemas de contenido, siempre que el mapeo del vocabulario sea revisado.

Enriquecimiento de conjuntos de datos

Microdata puede proporcionar nombres explícitos, fechas y relaciones que complementan la extracción de texto, aunque los valores aún requieren validación.

Cómo Elegir y Mantener Microdata

Elija Microdata cuando las anotaciones semánticas pertenecen de manera natural a elementos estables renderizados por el servidor y el equipo de desarrollo se sienta cómodo probando el marcado como parte de la plantilla. Prefiera JSON-LD cuando el gráfico de entidades es complejo, varios elementos visibles contribuyen a un registro, o el contenido y la presentación cambian en diferentes horarios. Prefiera RDFa cuando los requisitos de datos vinculados hacen que su modelo gráfico sea más adecuado.

El mantenimiento debe incluir pruebas a nivel de plantilla, páginas renderizadas representativas, validación de vocabulario y verificaciones específicas para el consumidor. Rastrear la URL de la página, método de captura, marca de tiempo de extracción, tipo de elemento, valor de propiedad en bruto, valor normalizado y resultado de validación. Esos campos hacen que los cambios sean explicables cuando un rediseño mueve un atributo o un script del cliente retrasa su inserción.

Para una colección a escala web, la adquisición y el análisis deben permanecer separados. Scrapeless Universal Scraping API puede suministrar contenido de página a la etapa de extracción, mientras que el analizador aplica reglas de Microdata y mapea el resultado en un esquema estable hacia abajo. Revisar Scrapeless pricing al estimar el costo de adquisición para el volumen de páginas planificado.

Conclusión

Microdata es datos estructurados nativos de HTML: los elementos definen entidades, las propiedades definen valores y un vocabulario proporciona un significado compartido. Funciona bien cuando las anotaciones semánticas permanecen alineadas con elementos visibles estables. El uso confiable depende de analizar el modelo completo del elemento, capturar la representación correcta de la página, validar las reglas de vocabulario y rastrear la procedencia cuando varios formatos estructurados coexisten.

¿Listo para construir un flujo de trabajo de datos estructurados?

Utilice Scrapeless para adquirir páginas web públicas, luego valide y mapee Microdata en registros en los que su canal puede confiar.

Comience gratis →

Preguntas frecuentes

¿Es Microdata lo mismo que Schema.org?

No. Microdata es una sintaxis de HTML para expresar elementos y propiedades, mientras que Schema.org es un vocabulario que define muchos tipos y nombres de propiedad comúnmente utilizados. Los términos de Schema.org también se pueden expresar con JSON-LD o RDFa.

¿Microdata mejora el posicionamiento en los resultados de búsqueda?

Microdata ayuda a los consumidores soportados a entender la información estructurada elegible, pero agregarlo no garantiza un aumento en el ranking o una característica de búsqueda particular. La página visible, la calidad del contenido, la elegibilidad técnica y las políticas del consumidor aún se aplican.

¿Puede una página usar tanto Microdata como JSON-LD?

Sí, una página puede contener ambos formatos, pero las entidades duplicadas deben coincidir. Precios, fechas, identificadores o URLs canónicas en conflicto crean ambigüedad tanto para los validadores como para las canalizaciones de extracción.

¿Debería un extractor leer HTML fuente o el DOM renderizado?

El extractor debe leer la representación que contiene el marcado autoritativo. HTML fuente es más rápido cuando Microdata se renderiza en el servidor; un DOM renderizado es necesario cuando JavaScript agrega o cambia los atributos.

¿Qué debe preservar un conjunto de datos de Microdata?

Un conjunto de datos útil debe preservar la URL de la página, método de captura, tipo de elemento, identificador del elemento cuando esté presente, valores de propiedad en bruto, valores normalizados y resultados de validación. La procedencia hace que sean posibles correcciones y auditorías posteriores.

Referencias