¿Qué es el prompting de Set-of-Mark?
Scrapeless Scraping Browser proporciona un entorno de navegador administrado que puede suministrar páginas renderizadas y capturas de pantalla a flujos de trabajo de agentes de navegador visual.
TL;DR
- El prompting de Set-of-Mark convierte ubicaciones en etiquetas cortas. Un sistema de visión superpone números o letras en regiones significativas de una imagen para que un modelo multimodal pueda referirse a un objeto sin inventar coordenadas de píxeles.
- La técnica mejora la comunicación, no la percepción por sí misma. La segmentación o el análisis de interfaces proponen las regiones; las marcas le dan al modelo un vocabulario compacto para seleccionar entre ellas.
- Los agentes del navegador utilizan SoM para conectar el lenguaje con los controles. Un prompt puede pedir al modelo que elija el marcador 12, luego una capa de automatización asigna ese marcador de nuevo a un botón o región de entrada.
- Las marcas también pueden ocultar evidencia visual útil. Etiquetas abarrotadas, malas propuestas de región y superposiciones colocadas sobre texto pueden reducir la precisión, por lo que la imagen marcada necesita sus propios controles de calidad.
- SoM es una opción de anclaje entre varias. Los localizadores DOM, árboles de accesibilidad, OCR, capturas de pantalla y predicción de coordenadas se ajustan a diferentes condiciones de interfaz.
Definición de prompting de Set-of-Mark
El prompting de Set-of-Mark es un método de prompting visual que coloca marcas distintas y pronunciables—generalmente números o letras—sobre regiones candidatas en una imagen. El modelo multimodal ve la imagen anotada y responde con la marca que corresponde al objeto solicitado. El método se introdujo en el artículo El prompting de Set-of-Mark desata un anclaje visual extraordinario en GPT-4V, donde modelos de segmentación disponibles dividen una imagen y la superposición hace que cada región sea fácil de nombrar.
El problema clave es el anclaje visual. Un modelo puede entender la frase “haga clic en el menú de la cuenta” y puede reconocer el menú en una captura de pantalla, pero aún necesita una forma confiable de expresar dónde se encuentra el objetivo. El lenguaje natural como “el ícono cerca de la esquina superior derecha” se vuelve ambiguo cuando varios íconos están cerca uno del otro. Un marcador crea un identificador temporal: el modelo puede devolver “17”, y el controlador puede asociar 17 con la geometría de la región almacenada.
SoM no cambia la página subyacente, no entrena un nuevo modelo ni define un protocolo de automatización. Cambia la observación mostrada al modelo. Esa distinción importa porque los equipos pueden añadir o quitar la superposición en el momento de la inferencia. La investigación original presenta SoM como un método de prompting sin entrenamiento, y el público La implementación de Microsoft SoM muestra las etapas separadas utilizadas para crear máscaras y renderizar marcas.
Una captura de pantalla marcada es, por lo tanto, una pequeña interfaz entre la visión por computadora y el razonamiento del lenguaje. El lado de visión propone regiones seleccionables. El lado de renderizado asigna etiquetas únicas. El modelo de lenguaje razona sobre la imagen y esas etiquetas. La capa de acción convierte la etiqueta seleccionada de nuevo en coordenadas o una referencia de elemento estructurado. Cada etapa puede evaluarse por separado en lugar de tratar todo el agente como un resultado opaco.
Cómo funciona el prompting de Set-of-Mark
La primera etapa crea regiones candidatas. En una imagen natural, un modelo de segmentación puede producir máscaras de objetos en varios niveles de detalle. En una página web, las regiones candidatas pueden provenir de controles detectados, cuadros de OCR, nodos de accesibilidad, geometría DOM o una combinación. La elección determina qué puede seleccionar el modelo. Si el generador de regiones se pierde una pequeña flecha de divulgación, ningún prompt de marcador puede recuperar ese objetivo más tarde.
La segunda etapa filtra y ordena las regiones. Las máscaras superpuestas pueden crear varias etiquetas para el mismo objeto, mientras que formas decorativas diminutas pueden inundar la captura de pantalla con números irrelevantes. Los sistemas prácticos eliminan regiones por debajo de un umbral de tamaño, fusionan duplicados, priorizan controles probables y mantienen las etiquetas estables durante la vida de una observación. La estabilidad reduce errores cuando el modelo se refiere a una etiqueta en un paso de razonamiento posterior.
La tercera etapa dibuja una etiqueta de alto contraste cerca o dentro de cada región. La etiqueta debe seguir siendo legible sin cubrir la evidencia muy necesaria para elegir el objeto. Un botón de pago, por ejemplo, puede contener texto de precio o estado que lo distingue de otro botón. Colocar un marcador sobre ese texto intercambia claridad espacial por pérdida semántica. Los buenos renderizadores eligen un área vacía, desvían la etiqueta o proporcionan tanto imágenes originales como marcadas.
La etapa final solicita al modelo una respuesta restringida y la valida. Un controlador podría aceptar un identificador de marcador más un tipo de acción, en lugar de un párrafo sin restricciones. El identificador seleccionado se verifica contra la observación actual antes de que ocurra cualquier clic. Si la página cambió después de la captura de pantalla, el controlador debería tomar una nueva observación; una etiqueta correcta de un marco antiguo puede apuntar al control incorrecto en el nuevo estado.
SoM comparado con otros métodos de anclaje
El prompting de Set-of-Mark es más fácil de entender cuando su salida, dependencias y modos de falla se separan de las técnicas vecinas.
| Dimensión | Significado principal | Error común |
|---|---|---|
| Forma de referencia | Un marcador visible corto vinculado a una región almacenada. | Tratar el marcador en sí como un ID de elemento permanente. |
| Fuente de región | Segmentación, OCR, geometría DOM, datos de accesibilidad o controles detectados. | Asumir que SoM descubre cada objetivo sin una etapa de propuesta de región. |
| Mejor ajuste | Escenas visuales densas e interfaces donde las descripciones de ubicación en lenguaje natural son ambiguas. | Agregar etiquetas a una página simple donde ya existe un localizador semántico estable. |
| Riesgo principal | El desorden de superposición o la geometría obsoleta pueden producir una acción confiable pero equivocada. | Calificar solo el éxito final de la tarea y ocultar los errores de anclaje. |
| Alternativa | Selectores DOM, referencias de accesibilidad, coordenadas directas o búsqueda de texto. | Elegir un método para cada página sin importar la estructura disponible. |
Dónde Ayuda el Anclaje de Conjunto de Marcas
SoM gana su lugar cuando una tarea necesita una referencia precisa a regiones visuales y la estructura de la página por sí sola no expresa suficiente significado.
Control del navegador
Un agente de navegador puede elegir entre íconos, tarjetas, controles de lienzo o botones no etiquetados al devolver el número dibujado junto al objetivo previsto.
Lectura de gráficos y diagramas
Los marcadores convierten varias barras, nodos o paneles similares en referentes distintos, lo que ayuda a un modelo a explicar o comparar elementos visuales seleccionados.
Inspección de documentos
Un revisor puede preguntar sobre una celda de tabla numerada, bloque de firma, figura o campo de formulario sin depender de una descripción de coordenadas frágil.
Robótica y tareas incorporadas
Las etiquetas de región pueden proporcionar un vocabulario temporal para objetos en un marco de cámara antes de que un controlador separado planifique una acción física.
Diseñando un Pipeline de SoM Confiable
Comienza con un inventario de acciones explícitas. Un sistema de navegación puede necesitar acciones de clic, escribir, desplazar, pasar el ratón y inspeccionar, pero no cada región marcada admite cada acción. Almacena las acciones permitidas junto al identificador de la región. Un campo de texto puede aceptar escritura; un párrafo puede solo admitir inspección. Este contrato simple evita que el modelo seleccione una región visualmente plausible para una operación imposible.
Mantén la observación original junto a la versión marcada. El marco marcado es útil para referencia, mientras que el marco original preserva tipografía, color, límites y texto de estado pequeño. Un aviso de dos vistas permite que el modelo razone a partir de evidencia limpia y responda con el identificador marcado. También facilita la depuración porque un revisor puede ver si la superposición obscureció el objetivo.
Conecta cada marca a la procedencia. Para una interfaz web, el registro puede incluir límites de captura de pantalla, tamaño de viewport, desplazamiento de desplazamiento, identidad de nodo DOM cuando esté disponible, nombre accesible y marca de tiempo de la observación. El benchmark de WebArena demuestra por qué las tareas de navegador con estado necesitan entornos reproducibles y evaluación funcional en lugar de bonitas capturas de pantalla por sí solas. La procedencia permite que un controlador verifique que la región seleccionada aún pertenece al estado actual de la página.
Evalúa el pipeline por etapa. Mide la recuperación de candidatos antes de la precisión de elección del modelo: ¿marcó el generador de regiones el control necesario en absoluto? Luego mide la legibilidad de la etiqueta, la precisión de selección del modelo, la ejecución de acciones y la corrección de la tarea final. Una tasa de éxito final puede ocultar dos problemas muy diferentes: una mala anclaje visual y un anclaje correcto seguido de una acción defectuosa.
Limitaciones y Modos de Fallo
Las páginas densas pueden superar el presupuesto útil de etiquetas. Cientos de marcas compiten con el texto de la página y entre sí. Filtrar solo por área rara vez es suficiente porque un ícono pequeño puede ser más accionable que una gran imagen decorativa. El rol de la interfaz, la visibilidad, la oclusión y la relevancia probable de la tarea proporcionan mejores filtros. La marcado jerárquico es otra opción: selecciona un panel primero, luego marca los controles dentro de él.
SoM hereda errores del sistema de propuesta de región. La segmentación puede dividir un control en varias piezas o fusionar objetos vecinos. Los rectángulos DOM pueden incluir capas invisibles. OCR puede perder texto estilizado. Los árboles de accesibilidad pueden omitir contenido de lienzo. Combinar fuentes mejora la cobertura, pero la resolución de duplicados debe seguir siendo determinista para que el mismo control visible no reciba varias etiquetas en competencia.
Un marcador es válido solo para el marco que lo produjo. La animación, diseño responsivo, carga diferida y desplazamiento pueden mover el objetivo después de la observación. Los sistemas de agentes de navegador deben vincular un conjunto de marcadores a la URL de la página, al viewport, a la posición de desplazamiento y a un identificador de estado de corta duración. Las acciones de alto impacto merecen una nueva observación y un límite de aprobación incluso cuando la selección visual parece segura.
La técnica también introduce preguntas de accesibilidad y seguridad. Las superposiciones no deben convertirse en parte del sitio visible para el usuario, y las regiones sensibles de la página deben ser redactadas antes de que las capturas de pantalla salgan de un límite aprobado. Los avisos de marcadores son observaciones para un modelo, no autorización para enviar un formulario, divulgar credenciales, comprar un artículo o cambiar el estado de la cuenta.
Cómo Evaluar el Anclaje de Conjunto de Marcas
Construye un conjunto de evaluación con densidades variadas, tamaño de texto, temas, anchos de viewport, posiciones de desplazamiento y tipos de interacción. Registra si se propuso el objetivo, si su etiqueta permaneció legible, si el modelo lo seleccionó y si la acción resultante tuvo el efecto deseado. Este registro en capas muestra dónde aterriza una mejora en realidad.
Compara SoM contra una línea de base semántica. Si una referencia de árbol de accesibilidad selecciona el mismo control con menos tokens y menos errores, el camino semántico debería ganar. Si un lienzo, gráfico o imagen no contiene ningún nodo semántico confiable, el camino visual marcado puede ser la mejor observación. Un agente híbrido puede seleccionar la representación confiable más barata por paso.
Observa el sesgo de posición de la etiqueta. Los modelos pueden preferir números tempranos, regiones centrales o colores visualmente prominentes. Mezcla las asignaciones de marcadores a través de ejemplos repetidos mientras mantienes la captura de pantalla fija. Un resultado estable debe seguir al objeto, no al identificador. También prueba objetivos casi duplicados como tarjetas de productos repetidas o íconos de barra de herramientas idénticos, donde el anclaje espacial hace la mayor parte del trabajo.
Reporta el impacto de la tarea por separado de la precisión del anclaje. Una puntuación de selección más alta importa solo si reduce acciones incorrectas o acorta el camino hacia la finalización. Registra el número de observaciones, llamadas de modelo, selecciones corregidas, rechazos de cuadros obsoletos y aprobaciones humanas. Esas medidas convierten a SoM de una superposición ingeniosa en un componente responsable de un sistema de agente.
Conclusión
La indicación de Set-of-Mark proporciona a un modelo multimodal un lenguaje compacto para señalar. Funciona etiquetando regiones visuales propuestas, pidiendo al modelo que elija una etiqueta y mapeando esa respuesta de vuelta a la geometría almacenada. La técnica es útil porque se puede añadir en el tiempo de inferencia y porque su decisión de anclaje es fácil de inspeccionar.
Sus límites son igualmente concretos: las regiones faltantes permanecen ausentes, las etiquetas abarrotadas ocultan evidencia, y cada marca expira cuando la pantalla cambia. Los equipos obtienen los mejores resultados manteniendo observaciones limpias y marcadas juntas, validando selecciones contra el estado actual y comparando SoM con localizadores semánticos en lugar de asumir que un método visual debe controlar cada paso.
¿Listo para probar la anclaje del agente del navegador?
Captura observaciones estables del navegador con Scrapeless Scraping Browser, luego evalúa SoM, DOM y anclaje de accesibilidad contra las mismas tareas.
Regístrate hoy y obtén $5 en crédito gratuito — sin necesidad de tarjeta de crédito.
Reclama tu crédito de $5 →Preguntas frecuentes
¿Es la indicación de Set-of-Mark lo mismo que la detección de objetos?
No. La detección de objetos o segmentación puede proponer las regiones, mientras que la indicación de Set-of-Mark asigna identificadores visibles que un modelo multimodal puede usar para referirse a esas regiones.
¿Requiere SoM ajuste fino del modelo?
El método original de SoM se presenta como un enfoque de indicación sin entrenamiento. Un sistema puede anotar una imagen en el tiempo de inferencia y pedir a un modelo multimodal capaz que razone sobre la vista marcada.
¿Por qué utilizan los agentes del navegador capturas de pantalla numeradas?
Las capturas de pantalla numeradas reemplazan descripciones vagas de coordenadas con referencias cortas. El controlador puede mapear un número devuelto a un rectángulo o elemento conocido y validarlo antes de actuar.
¿Puede la indicación de Set-of-Mark reemplazar el DOM?
No. Los datos del DOM y de accesibilidad a menudo proporcionan objetivos semánticos más limpios. SoM es especialmente útil cuando la estructura falta, es engañosa, altamente visual, o está dispersa en contenido de lienzo e imagen.
¿Cuál es el mayor error de implementación de SoM?
El mayor error es tratar una marca como permanente. Los marcadores pertenecen a una observación y deben ser actualizados después de desplazamientos, navegación, cambios responsivos o actualizaciones dinámicas de la página.