De volta ao blog

Custo do Token de IA: HTML vs Markdown Entre GPT, Claude, Gemini

Emily Chen
Emily Chen

Advanced Data Extraction Specialist

28-Aug-2026

TL;DR:

  • Contagens de tokens são medições específicas do modelo. GPT, Claude e Gemini podem dividir os mesmos bytes de maneira diferente, portanto, o preço listado sozinho não pode prever o custo de entrada.
  • HTML bruto gasta contexto em marcações, scripts, estilos e navegação repetida. O Markdown de conteúdo principal geralmente preserva mais informações visíveis para o leitor por token.
  • Meça o formato e o tokenizador como variáveis separadas. Compare páginas idênticas em HTML bruto, texto extraído e Markdown com o contador próprio de cada provedor.
  • Scrapeless ajuda a controlar a entrada antes que ela chegue ao modelo. Renderize a página, isole o conteúdo útil, preserve as URLs de origem e envie apenas a representação necessária para a tarefa.

Um LLM nunca cobra uma página da web pela contagem de caracteres. Ele cobra os tokens produzidos após um tokenizador específico do modelo dividir a representação da página.

Isso significa que duas escolhas de engenharia determinam o custo: qual tokenizador conta a entrada e se a entrada é HTML bruto, texto simples ou Markdown limpo.

O que é um Token de IA?

Um token de IA é uma unidade produzida pelo tokenizador de um modelo e contada contra o contexto e uso. Tokens não são palavras ou caracteres universais. Vocabulário, corpus de treinamento e algoritmo de tokenização mudam os limites.

O projeto OpenAI tiktoken expõe as codificações usadas para medir esses limites. Uma contagem produzida para uma codificação não deve ser aplicada a uma família de modelos diferente como um valor exato.

Por que a mesma página produz contagens diferentes

Palavras comuns podem se encaixar em uma entrada de vocabulário, enquanto identificadores incomuns, código, emoji e texto não inglês se dividem em várias partes. Pesquisa sobre tokenização em diferentes idiomas mostra que as escolhas de vocabulário criam custos de representação desiguais; o estudo sobre disparidade de tokenização em línguas mede esse efeito entre grupos linguísticos.

A entrada estruturada adiciona outra fonte de variação. HTML repete nomes de tags, atributos, valores de classes, scripts e dados de estilo. JSON e esquemas de ferramentas adicionam chaves, chaves entre aspas e pontuação. Esses bytes são úteis para analisadores, mas muitas vezes irrelevantes para a tarefa do modelo.

HTML, Texto e Markdown são Entradas Diferentes

Formato Mantém Descarta Melhor ajuste
HTML Bruto Estrutura DOM, atributos, scripts, estilos Nada Análise DOM e trabalho com seletores
Texto Extraído Palavras visíveis A maioria da hierarquia e links Classificação simples ou busca
Markdown Limpo Títulos, listas, tabelas, links, texto legível Scripts, estilos, a maior parte da interface visual Pesquisa, resumificação e RAG

Markdown não é automaticamente a representação mais compacta possível. É valioso porque retém uma estrutura de documento útil enquanto remove grandes classes de bytes orientados para o navegador.

Um Benchmark de Token Reproduzível

Use um conjunto fixo de páginas que reflita a carga de trabalho de produção: documentação, páginas de produtos, notícias, fóruns e aplicações JavaScript, se forem relevantes. Salve os bytes adquiridos exatamente e um hash para cada representação.

Para cada página:

  1. Capture o HTML bruto após a política de renderização escolhida.
  2. Extraia o texto do conteúdo principal.
  3. Produza Markdown da mesma fonte renderizada.
  4. Conte todas as três formas com o contador oficial de cada provedor.
  5. Registre tokens, caracteres, hash de conteúdo, configurações de extração e categoria da página.

Não compare contagens coletadas em dias diferentes de páginas que mudam. O formato é a variável independente do experimento; os bytes de origem devem permanecer fixos.

Comece a Raspagem com Scrapeless

Potencialize sua raspagem de web e fluxo de trabalho de automação com Scrapeless!
Inscreva-se hoje e ganhe $5 em crédito gratuitosem necessidade de cartão de crédito.

Reivindique seu crédito gratuito agora no Painel do Scrapeless.

Conte com Métodos Nativos do Provedor

Use o contador ou tokenizador suportado pelo provedor para o modelo em avaliação. Não confie em um atalho de caracteres por token para orçamentos ou admissão de contexto.

Para entradas longas, preserve o limite de contagem e documente qualquer método de fragmentação. Um tokenizador pode mesclar caracteres através de um limite, então a soma das peças contadas de forma independente pode diferir ligeiramente de uma contagem de entrada completa.

O estudo de compressão entre tokenizadores explica por que heurísticas simples de palavras e caracteres falham entre diferentes domínios. Trate a contagem de tokens medida como dados, não como uma razão de conversão universal.

Converter Tokens em Custo Efetivo

O custo efetivo de entrada é medido em tokens multiplicados pelo preço de entrada aplicável do modelo. Mantenha a entrada base, entrada em cache, níveis de contexto longo e uso de saída como linhas separadas porque suas regras de cobrança diferem.
Uma comparação justa de modelos usa o mesmo conjunto de conteúdo e tarefa. Se um modelo recebe HTML bruto e outro recebe Markdown, o experimento mede o design do pipeline e o custo do modelo ao mesmo tempo.

Onde o Scrapeless se Encaixa

Scrapeless Universal Scraping API pode adquirir conteúdo da web antes da chamada do modelo. A aplicação deve manter a URL de origem e as configurações de renderização, e então escolher HTML bruto, texto ou uma representação limpa com base na tarefa a montante.

HTML bruto permanece apropriado quando o modelo deve raciocinar sobre a estrutura do DOM. O Markdown limpo é geralmente o melhor padrão para perguntas e respostas, pois cabeçalhos, listas, links e tabelas sobrevivem sem o documento completo do navegador.

A comparação de scrapers LLM explica como a aquisição de fonte e a saída pronta para LLM se encaixam. Avalie o volume de aquisição na página de preços do Scrapeless.

O Que Otimizar Primeiro

Remova o conteúdo que a tarefa não precisa antes de mudar de modelos. Navegação, banners de cookies, estilos, scripts, marcação móvel duplicada e recomendações não relacionadas consomem contexto sem melhorar a maioria das respostas.

Em seguida, compare tokenizadores usando a entrada limpa. O HTML Living Standard mostra por que um documento do navegador contém preocupações estruturais e de script além de seu conteúdo legível.

Por fim, monitore a mistura de conteúdo em produção. Um benchmark dominado por prosa não preverá uma carga de trabalho dominada por código, tabelas ou páginas multilíngues.

Conclusão

O custo do token começa antes da chamada do modelo. Meça as representações exatas que seu pipeline envia, conte-as com o próprio método de cada modelo e remova bytes orientados para navegador que a tarefa não precisa. O Scrapeless fornece a camada de aquisição; a aplicação decide qual representação se torna o contexto do modelo.

Pronto para Medir o Contexto Web Antes de Comprá-lo?

Junte-se à comunidade do Scrapeless no Discord ou Telegram. Comece com app.scrapeless.com e faça benchmark de um conjunto de páginas representativas em HTML, texto e Markdown.

FAQ

Q: O GPT, Claude e Gemini contam o mesmo texto de forma idêntica?

Não. Cada família de modelo usa seu próprio tokenizador e vocabulário, então bytes idênticos podem produzir contagens de tokens diferentes.

Q: Um token é igual a quatro caracteres?

Nenhuma proporção fixa de caracteres é confiável entre idiomas, códigos, marcação e famílias de modelos. Use o tokenizador ou método de contagem para o modelo exato.

Q: O Markdown sempre usa menos tokens do que o HTML?

O Markdown limpo geralmente remove scripts, estilos, atributos e navegação repetida, mas o resultado depende do extrator e da página. Meça ambas as representações na mesma fonte capturada.

Q: O HTML bruto deve ser enviado a um LLM?

O HTML bruto é justificado quando a tarefa necessita da estrutura do DOM, atributos ou raciocínio de seletor. Resumo e pesquisa geralmente precisam apenas do conteúdo principal e links.

Q: Como o custo de token deve ser comparado entre modelos?

Conte amostras de produção idênticas com o método suportado de cada modelo, aplique a faixa de preço relevante e mantenha a entrada em cache, contexto longo e cobranças de saída separadas.

Na Scorretless, acessamos apenas dados disponíveis ao público, enquanto cumprem estritamente as leis, regulamentos e políticas de privacidade do site aplicáveis. O conteúdo deste blog é apenas para fins de demonstração e não envolve atividades ilegais ou infratoras. Não temos garantias e negamos toda a responsabilidade pelo uso de informações deste blog ou links de terceiros. Antes de se envolver em qualquer atividade de raspagem, consulte seu consultor jurídico e revise os termos de serviço do site de destino ou obtenha as permissões necessárias.

Artigos mais populares

Catálogo