AI代币成本:HTML与Markdown在GPT、Claude、Gemini中的比较
Advanced Data Extraction Specialist
TL;DR:
- 令牌计数是特定于模型的测量。 GPT、Claude 和 Gemini 可以以不同的方式拆分相同的字节,因此仅凭价格列表无法预测输入成本。
- 原始 HTML 在标记、脚本、样式和重复导航上消耗上下文。 主内容 Markdown 通常每个令牌保留更多读者可见的信息。
- 将格式和 tokenizer 作为独立变量进行测量。 比较相同页面在原始 HTML、提取文本和 Markdown 中的各个提供商的计数器。
- Scrapeless 有助于在输入到达模型之前控制输入。 渲染页面,隔离有用内容,保留源 URL,仅发送任务所需的表示。
一个 LLM 从不按字符计数对网页收费。它对通过特定于模型的 tokenizer 拆分页面表示后生成的令牌进行计费。
这意味着两个工程选择决定了成本:哪个 tokenizer 计算输入,以及输入是否是原始 HTML、纯文本或清理过的 Markdown。
什么是 AI 令牌?
AI 令牌是由模型的 tokenizer 生成的一个单位,并在上下文和使用情况中计数。令牌不是通用的单词或字符。词汇、训练语料和分词算法改变了边界。
OpenAI tiktoken 项目 揭示了用于测量这些边界的编码。为一种编码生成的计数不应作为确切值转移到不同的模型系列中。
为什么同一页面生成不同计数
常见单词可能适合一个词汇条目,而不常见的标识符、代码、表情符号和非英语文本则拆分为多个部分。对跨语言分词的研究表明,词汇选择产生了不平等的表示成本;语言分词差异研究 衡量了该效应在语言群体之间的影响。
结构化输入增加了另一种变异来源。HTML 重复标签名称、属性、类值、脚本和样式数据。JSON 和工具模式添加了大括号、引用键和标点。这些字节对解析器很有用,但通常与模型的任务无关。
HTML、文本和 Markdown 是不同的输入
| 格式 | 保留 | 丢弃 | 最佳适配 |
|---|---|---|---|
| 原始 HTML | DOM 结构、属性、脚本、样式 | 无 | DOM 分析和选择工作 |
| 提取文本 | 可见单词 | 大多数层次结构和链接 | 简单分类或搜索 |
| 清理过的 Markdown | 标题、列表、表格、链接、可读文本 | 脚本、样式、大多数布局元素 | 研究、总结和 RAG |
Markdown 并不总是自动是最小化的表示。它的价值在于保留有用的文档结构,同时去除大量面向浏览器的字节。
可复现的令牌基准
使用固定页面集来反映生产工作负载:文档、产品页面、新闻、论坛和 JavaScript 应用程序(如果需要的话)。保存每种表示的确切获取字节和哈希值。
对于每个页面:
- 在选择的渲染策略后捕获原始 HTML。
- 提取主内容文本。
- 从相同的渲染源生成 Markdown。
- 使用每个提供商的官方计数器对这三种形式进行计数。
- 记录令牌、字符、内容哈希、提取设置和页面类别。
不要比较在不同日期收集的计数,特别是从变化的页面。格式是实验的独立变量;源字节必须保持固定。
开始使用 Scrapeless 进行抓取
使用 Scrapeless 提升您的网页抓取和自动化工作流程!
今天注册并获得 $5 的免费信用 — 无须信用卡。立刻在 Scrapeless Dashboard 领取您的免费信用。
使用供应商原生方法计数
使用提供商支持的计数器或 tokenizer 评估模型。不要依赖每个令牌的字符快捷方式进行预算或上下文接收。
对于较长的输入,保留计数边界,并记录任何分块方法。一个 tokenizer 可以跨越边界合并字符,因此独立计数的片段的总和可能与一个完整输入计数略有不同。
跨 tokenizer 压缩研究 解释了为什么简单的单词和字符启发式在各个领域失败。将测量的令牌计数视为数据,而不是一个通用的转换比例。
将令牌转化为有效成本
有效输入成本是测量的令牌乘以模型适用的输入价格。将基本输入、缓存输入、长上下文层次和输出使用作为单独的行,因为它们的计费规则不同。
公平的模型比较使用相同的内容集和任务。如果一个模型接收原始 HTML,而另一个接收 Markdown,则实验同时衡量管道设计和模型定价。
Scrapeless 的位置
Scrapeless 通用抓取 API 可以在模型调用之前获取网页内容。应用程序应保留源 URL 和渲染设置,然后根据下游任务选择原始 HTML、文本或清理过的表示。
当模型必须推理 DOM 结构时,原始 HTML 仍然合适。清洁 Markdown 通常是问答和检索的更好默认选项,因为标题、列表、链接和表格在没有完整浏览器文档的情况下依然存在。
LLM 抓取器比较 解释了源获取和 LLM 准备输出如何结合在一起。在 Scrapeless 定价页面 评估获取量。
首先优化什么
在更改模型之前,删除任务不需要的内容。导航、cookie 横幅、样式、脚本、重复的移动标记和不相关的推荐会消耗上下文,而不改善大多数答案。
然后使用清理后的输入比较分词器。HTML Living Standard 显示了为什么浏览器文档包含结构和脚本问题,超出了其可读内容。
最后,监控生产内容组合。一个由散文主导的基准无法预测一个由代码、表格或多语言页面主导的工作负载。
结论
令牌成本在模型调用之前就开始了。测量您的管道发送的确切表示,使用每个模型自己的方法计算它们,并删除任务不需要的浏览器导向字节。Scrapeless 提供获取层;应用程序决定哪种表示成为模型上下文。
准备在购买之前衡量网页上下文吗?
加入 Scrapeless 社区,进入 Discord 或 Telegram。从 app.scrapeless.com 开始,并以 HTML、文本和 Markdown 基准测试一个代表性页面集。
常见问题
Q: GPT、Claude 和 Gemini 是否以相同方式计算相同文本?
不。在每个模型系列中,使用各自的分词器和词汇,因此相同的字节可以产生不同的令牌计数。
Q: 一个令牌等于四个字符吗?
在不同的语言、代码、标记和模型系列中,没有一个固定的字符比例是可靠的。使用分词器或计数方法获得确切的模型。
Q: Markdown 是否总是使用比 HTML 少的令牌?
清洁的 Markdown 通常会删除脚本、样式、属性和重复的导航,但结果取决于提取工具和页面。在相同捕获源上测量两种表示。
Q: 原始 HTML 是否可以发送给 LLM?
当任务需要 DOM 结构、属性或选择器推理时,原始 HTML 是合理的。总结和研究通常只需要主要内容和链接。
Q: 如何比较不同模型之间的令牌成本?
使用每个模型支持的方法计算相同的生产样本,应用相关的价格等级,并将缓存输入、长上下文和输出费用分开。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。



