O Que É Set-of-Mark Prompting?
O Scrapeless Scraping Browser fornece um tempo de execução de navegador gerenciado que pode fornecer páginas renderizadas e capturas de tela para fluxos de trabalho de agentes de navegador visual.
TL;DR
- O prompting Set-of-Mark transforma locais em rótulos curtos. Um sistema de visão sobrepõe números ou letras em regiões significativas da imagem para que um modelo multimodal possa se referir a um objeto sem inventar coordenadas de pixels.
- A técnica melhora a comunicação, não a percepção por si só. Segmentação ou análise de interface propõe as regiões; as marcas dão ao modelo um vocabulário compacto para selecionar entre elas.
- Agentes de navegador usam SoM para conectar linguagem a controles. Um prompt pode pedir ao modelo para escolher o marcador 12, então uma camada de automação mapeia esse marcador de volta para um botão ou região de entrada.
- Marcas também podem ocultar evidências visuais úteis. Rótulos aglomerados, propostas de regiões ruins e sobreposições colocadas sobre texto podem reduzir a precisão, então a imagem marcada precisa de suas próprias verificações de qualidade.
- SoM é uma opção de grounding entre várias. Localizadores DOM, árvores de acessibilidade, OCR, capturas de tela e previsão de coordenadas se encaixam em diferentes condições de interface.
Definição de Set-of-Mark Prompting
O prompting Set-of-Mark é um método de prompting visual que coloca marcas distintas e pronunciáveis—geralmente números ou letras—sobre regiões candidatas em uma imagem. O modelo multimodal vê a imagem anotada e responde com a marca que corresponde ao objeto solicitado. O método foi introduzido no artigo Set-of-Mark Prompting Desbloqueia um Grounding Visual Extraordinário em GPT-4V, onde modelos de segmentação prontos para uso partitionam uma imagem e a sobreposição torna cada região fácil de nomear.
O problema central é o grounding visual. Um modelo pode entender a frase “clique no menu da conta” e pode reconhecer o menu em uma captura de tela, mas ainda precisa de uma maneira confiável para expressar onde o alvo está. A linguagem natural, como “o ícone perto do canto superior direito”, torna-se ambígua quando vários ícones estão próximos. Um marcador cria um identificador temporário: o modelo pode retornar “17”, e o controlador pode associar 17 com a geometria da região armazenada.
SoM não muda a página subjacente, treina um novo modelo ou define um protocolo de automação. Ela muda a observação mostrada ao modelo. Essa distinção é importante porque as equipes podem adicionar ou remover a sobreposição no momento da inferência. A pesquisa original apresenta o SoM como um método de prompting sem treinamento, e o público Implementação SoM da Microsoft mostra as etapas separadas usadas para criar máscaras e renderizar marcas.
Uma captura de tela marcada é, portanto, uma pequena interface entre visão computacional e raciocínio linguístico. O lado da visão propõe regiões selecionáveis. O lado da renderização atribui rótulos únicos. O modelo de linguagem raciocina sobre a imagem e esses rótulos. A camada de ação converte o rótulo selecionado de volta em coordenadas ou uma referência a um elemento estruturado. Cada etapa pode ser avaliada separadamente em vez de tratar todo o agente como um único resultado opaco.
Como Funciona o Set-of-Mark Prompting
A primeira etapa cria regiões candidatas. Em uma imagem natural, um modelo de segmentação pode produzir máscaras de objetos em vários níveis de detalhe. Em uma página da web, as regiões candidatas podem vir de controles detectados, caixas de OCR, nós de acessibilidade, geometria DOM, ou uma combinação. A escolha determina o que o modelo pode selecionar. Se o gerador de regiões perder uma pequena seta de divulgação, nenhum prompt de marcador pode recuperar esse alvo mais tarde.
A segunda etapa filtra e ordena as regiões. Máscaras sobrepostas podem criar vários rótulos para o mesmo objeto, enquanto pequenas formas decorativas podem inundar a captura de tela com números irrelevantes. Sistemas práticos removem regiões abaixo de um limite de tamanho, mesclam duplicatas, priorizam controles prováveis e mantêm rótulos estáveis durante a vida de uma observação. A estabilidade reduz erros quando o modelo se refere a um rótulo em um passo de raciocínio posterior.
A terceira etapa desenha um rótulo de alto contraste perto ou dentro de cada região. O rótulo deve permanecer legível sem cobrir a própria evidência necessária para escolher o objeto. Por exemplo, um botão de checkout pode conter texto de preço ou estado que o distingue de outro botão. Colocar um marcador sobre esse texto troca clareza espacial por perda semântica. Bons renderizadores escolhem uma área vazia, deslocam o rótulo ou fornecem imagens originais e marcadas.
A etapa final pede ao modelo uma resposta restrita e a valida. Um controlador pode aceitar um identificador de marcador mais um tipo de ação, em vez de um parágrafo irrestrito. O identificador selecionado é verificado em relação à observação atual antes que qualquer clique ocorra. Se a página mudar após a captura de tela, o controlador deve fazer uma nova observação; um rótulo correto de uma antiga pode apontar para o controle errado no novo estado.
SoM Comparado a Outros Métodos de Grounding
O prompting Set-of-Mark é mais fácil de entender quando sua saída, dependências e modos de falha são separados de técnicas vizinhas.
| Dimensão | Significado primário | Erro comum |
|---|---|---|
| Forma de referência | Um marcador visível curto ligado a uma região armazenada. | Tratar o marcador em si como um ID de elemento permanente. |
| Fonte da região | Segmentação, OCR, geometria DOM, dados de acessibilidade ou controles detectados. | Assumir que o SoM descobre todo alvo sem uma etapa de proposta de região. |
| Melhor ajuste | Cenas visuais densas e interfaces onde descrições de localização em linguagem natural são ambíguas. | Adicionar rótulos a uma página simples onde já existe um localizador semântico estável. |
| Principal risco | Desordem na sobreposição ou geometria desatualizada pode produzir uma ação confiante, mas errada. | Pontuar apenas o sucesso final da tarefa e esconder erros de grounding. |
| Alternativa | Seletores DOM, referências de acessibilidade, coordenadas diretas ou busca de texto. | Escolher um método para cada página, independentemente da estrutura disponível. |
Onde a Promoção de Conjunto de Marcadores Ajuda
SoM ganha seu lugar quando uma tarefa precisa de referência precisa a regiões visuais e a estrutura da página sozinha não expressa significado suficiente.
Controle do navegador
Um agente de navegador pode escolher entre ícones, cartões, controles de canvas ou botões sem rótulo retornando o número desenhado ao lado do alvo pretendido.
Leitura de gráficos e diagramas
Os marcadores transformam várias barras, nós ou painéis semelhantes em referentes distintos, o que ajuda um modelo a explicar ou comparar itens visuais selecionados.
Inspeção de documentos
Um revisor pode perguntar sobre uma célula de tabela numerada, bloco de assinatura, figura ou campo de formulário sem depender de uma descrição de coordenadas frágil.
Robótica e tarefas incorporadas
Rótulos de região podem fornecer um vocabulário temporário para objetos em uma imagem da câmera antes que um controlador separado planeje uma ação física.
Projetando uma Pipeline SoM Confiável
Comece com um inventário de ações explícitas. Um sistema de navegação pode precisar de ações de clicar, digitar, rolar, passar o mouse e inspecionar, mas nem toda região marcada suporta cada ação. Armazene as ações permitidas ao lado do identificador da região. Um campo de texto pode aceitar digitação; um parágrafo pode suportar apenas inspeção. Este contrato simples impede que o modelo selecione uma região visualmente plausível para uma operação impossível.
Mantenha a observação original ao lado da versão marcada. A estrutura marcada é útil para referência, enquanto a estrutura original preserva tipografia, cores, limites e texto de status pequeno. Um prompt de visão dupla permite que o modelo raciocine a partir de evidências limpas e responda com o identificador marcado. Também facilita a depuração, pois um revisor pode ver se a sobreposição obscureceu o alvo.
Conecte cada marca à proveniência. Para uma interface web, o registro pode incluir limites de captura de tela, tamanho da janela, deslocamento de rolagem, identidade do nó DOM quando disponível, nome acessível e o timestamp da observação. A WebArena benchmark demonstrates porque tarefas de navegação com estado precisam de ambientes reproduzíveis e avaliação funcional ao invés de apenas capturas de tela atraentes. Provenance permite que um controlador verifique se a região selecionada ainda pertence ao estado atual da página.
Avalie o pipeline por estágio. Meça o recall dos candidatos antes da precisão da escolha do modelo: o gerador de região marcou o controle necessário? Em seguida, meça a legibilidade do rótulo, a precisão da seleção do modelo, a execução da ação e a correção da tarefa final. Uma taxa de sucesso final pode esconder dois problemas muito diferentes—fundamentação visual pobre e fundamentação correta seguida por uma ação defeituosa.
Limitações e Modos de Falha
Páginas densas podem exceder o orçamento útil de rótulos. Centenas de marcas competem com o texto da página e entre si. Filtrar apenas por área raramente é suficiente, pois um pequeno ícone pode ser mais acionável do que uma grande imagem decorativa. O papel da interface, visibilidade, oclusão e a relevância da tarefa fornecem melhores filtros. A marcação hierárquica é outra opção: selecione um painel primeiro, depois marque os controles dentro dele.
SoM herda erros do sistema de proposta de região. A segmentação pode dividir um controle em várias peças ou mesclar objetos vizinhos. Retângulos DOM podem incluir camadas invisíveis. OCR pode perder texto estilizado. Árvores de acessibilidade podem omitir conteúdo de canvas. Combinar fontes melhora a cobertura, mas a resolução de duplicatas deve permanecer determinística para que o mesmo controle visível não receba vários rótulos concorrentes.
Um marcador é válido apenas para o quadro que o produziu. Animação, layout responsivo, carregamento sob demanda e rolagem podem mover o alvo após a observação. Sistemas de agente de navegador devem vincular um conjunto de marcadores à URL da página, à área visível, à posição de rolagem e a um identificador de estado de curta duração. Ações de alto impacto merecem uma nova observação e um limite de aprovação, mesmo quando a seleção visual parece certa.
A técnica também introduz questões de acessibilidade e segurança. As sobreposições não devem se tornar parte do site voltado para o usuário, e regiões sensíveis da página devem ser redigidas antes que capturas de tela saiam de um limite aprovado. Os prompts de marcador são observações para um modelo, não autorização para enviar um formulário, divulgar credenciais, comprar um item ou alterar o estado da conta.
Como Avaliar o Prompting de Conjunto de Marcadores
Construa um conjunto de avaliação com densidade variada, tamanho de texto, temas, larguras de viewport, posições de rolagem e tipos de interação. Registre se o alvo foi proposto, se seu rótulo permaneceu legível, se o modelo o selecionou e se a ação resultante teve o efeito pretendido. Este registro em camadas mostra onde uma melhoria realmente impacta.
Compare SoM com uma linha de base semântica. Se uma referência da árvore de acessibilidade selecionar o mesmo controle com menos tokens e menos erros, o caminho semântico deve vencer. Se um canvas, gráfico ou imagem não contiver nenhum nó semântico confiável, o caminho visual marcado pode ser a melhor observação. Um agente híbrido pode selecionar a representação confiável mais barata por etapa.
Cuidado com o viés de posição do rótulo. Modelos podem preferir números iniciais, regiões centrais ou cores visualmente proeminentes. Misture atribuições de marcadores em exemplos repetidos enquanto mantém a captura de tela fixa. Um resultado estável deve seguir o objeto, não o identificador. Também teste alvos quase duplicados, como cartões de produtos repetidos ou ícones de barra de ferramentas idênticos, onde a fundamentação espacial faz a maior parte do trabalho.
Relatar o impacto da tarefa separadamente da precisão de fundamentação. Uma pontuação de seleção mais alta importa apenas se reduzir ações erradas ou encurtar o caminho para a conclusão. Registrar o número de observações, chamadas de modelo, seleções corrigidas, rejeições de quadro obsoleto e aprovações humanas. Essas medidas transformam SoM de uma sobreposição inteligente em um componente responsabilizável de um sistema agente.
Conclusão
O prompting Set-of-Mark dá a um modelo multimodal uma linguagem compacta para apontar. Funciona rotulando regiões visuais propostas, pedindo ao modelo para escolher um rótulo e mapeando essa resposta de volta à geometria armazenada. A técnica é útil porque pode ser adicionada no tempo de inferência e porque sua decisão de ancoragem é fácil de inspecionar.
Seus limites são igualmente concretos: regiões ausentes permanecem ausentes, rótulos aglomerados ocultam evidências, e cada marca expira quando a tela muda. As equipes obtêm os melhores resultados mantendo observações limpas e marcadas juntas, validando seleções em relação ao estado atual e comparando SoM com localizadores semânticos em vez de assumir que um método visual deve controlar cada passo.
Pronto para testar o ancoramento do agente do navegador?
Capture observações de navegador estáveis com Scrapeless Scraping Browser, depois avalie SoM, DOM e ancoragem de acessibilidade em relação às mesmas tarefas.
Inscreva-se hoje e ganhe $5 em crédito gratuito — nenhum cartão de crédito necessário.
Reclame seu crédito de $5 →FAQ
O prompting Set-of-Mark é o mesmo que detecção de objetos?
Não. A detecção de objetos ou segmentação pode propor as regiões, enquanto o prompting Set-of-Mark atribui identificadores visíveis que um modelo multimodal pode usar para se referir a essas regiões.
O SoM requer ajuste fino do modelo?
O método original do SoM é apresentado como uma abordagem de prompting sem treinamento. Um sistema pode anotar uma imagem no tempo de inferência e pedir a um modelo multimodal capaz para raciocinar sobre a visualização marcada.
Por que os agentes do navegador usam capturas de tela numeradas?
Capturas de tela numeradas substituem descrições de coordenadas vagas por referências curtas. O controlador pode mapear um número retornado para um retângulo ou elemento conhecido e validá-lo antes de agir.
O prompting Set-of-Mark pode substituir o DOM?
Não. Os dados do DOM e de acessibilidade frequentemente fornecem alvos semânticos mais limpos. O SoM é especialmente útil quando a estrutura está ausente, é enganosa, altamente visual ou espalhada por conteúdos de canvas e imagem.
Qual é o maior erro na implementação do SoM?
O maior erro é tratar uma marca como permanente. As marcas pertencem a uma observação e devem ser atualizadas após rolagem, navegação, mudanças responsivas ou atualizações dinâmicas da página.