AIトークンコスト: HTML対マークダウン GPT、Claude、Gemini間で
Advanced Data Extraction Specialist
TL;DR:
- トークン数はモデル固有の測定値です。 GPT、Claude、Geminiは同じバイトを異なる方法で分割できるため、リスト価格だけでは入力コストを予測できません。
- 生のHTMLはマークアップ、スクリプト、スタイル、および繰り返しのナビゲーションに文脈を費やします。 メインコンテンツのMarkdownは通常、トークンごとにより多くの読者が目にする情報を保持します。
- フォーマットとトークナイザーを別の変数として測定します。 各プロバイダーのカウンターを使って、生のHTML、抽出されたテキスト、Markdownの同一ページを比較します。
- Scrapelessは入力がモデルに届く前に制御を助けます。 ページをレンダリングし、有益なコンテンツを孤立させ、ソースURLを保持し、タスクが必要とする表現のみを送信します。
LLMはウェブページを文字カウントで請求することはありません。モデル固有のトークナイザーがページ表現を分割した後に生成されたトークンに対して請求します。
つまり、コストを決定するのは2つのエンジニアリングの選択です:どのトークナイザーが入力をカウントするか、そして入力が生のHTML、プレーンテキスト、またはクリーンなMarkdownのいずれであるかです。
AIトークンとは何か?
AIトークンは、モデルのトークナイザーによって生成され、文脈と使用量に対してカウントされる単位です。トークンは普遍的な言葉や文字ではありません。語彙、トレーニングコーパス、およびトークン化アルゴリズムが境界を変えます。
OpenAI tiktokenプロジェクトは、これらの境界を測定するために使用されるエンコーディングを公開しています。あるエンコーディングのために生成されたカウントは、異なるモデルファミリーに正確な値として持ち込むべきではありません。
同じページが異なるカウントを生成する理由
一般的な言葉は1つの語彙エントリに収まることがありますが、一般的でない識別子、コード、絵文字、および非英語のテキストは複数の部分に分割されます。言語間のトークン化に関する研究は、語彙の選択が不均等な表現コストを生み出すことを示しています。言語トークン化の不均衡研究は、この影響を言語グループ全体で測定しています。
構造化入力は別の変動要因を追加します。HTMLはタグ名、属性、クラス値、スクリプト、およびスタイルデータを繰り返します。JSONおよびツールスキーマは中括弧、引用されたキー、および句読点を追加します。これらのバイトはパーサーには役立ちますが、モデルのタスクにはしばしば無関係です。
HTML、テキスト、およびMarkdownは異なる入力です
| フォーマット | 保持する | 除去する | 最適なフィット |
|---|---|---|---|
| 生のHTML | DOM構造、属性、スクリプト、スタイル | 何も | DOM解析およびセレクター作業 |
| 抽出テキスト | 可視の単語 | 大部分の階層およびリンク | 簡単な分類または検索 |
| クリーンMarkdown | 見出し、リスト、テーブル、リンク、可読テキスト | スクリプト、スタイル、大部分のレイアウトの装飾 | 研究、要約、およびRAG |
Markdownは自動的に最小限の表現とは限りません。それは、ブラウザ指向のバイトの大きなクラスを削除しつつ、有益な文書構造を保持するために価値があります。
再現可能なトークンベンチマーク
生産ワークロードを反映する固定ページセットを使用します:ドキュメント、製品ページ、ニュース、フォーラム、および重要なJavaScriptアプリケーション。各表現の正確に取得されたバイトとハッシュを保存します。
すべてのページについて:
- 選択したレンダーポリシーの後に生のHTMLをキャプチャします。
- メインコンテンツのテキストを抽出します。
- 同じレンダリングソースからMarkdownを生成します。
- 各プロバイダーの公式カウンターで3つの形式すべてをカウントします。
- トークン、文字数、コンテンツハッシュ、抽出設定、およびページカテゴリを記録します。
異なる日に収集されたカウントを、変更のあるページで比較しないでください。フォーマットは実験の独立変数であり、ソースバイトは固定されている必要があります。
Scrapelessを使ってスクレイピングを開始しよう
Scrapelessでウェブスクレイピングと自動化ワークフローを強化しましょう!
今すぐサインアップして、$5の無料クレジットをゲット — クレジットカードは不要です。Scrapeless Dashboardで無料クレジットを今すぐ請求しましょう。
プロバイダー固有の方法でカウントする
評価中のモデルに対して、プロバイダーがサポートするカウンターまたはトークナイザーを使用します。予算設定や文脈入場のために、トークンごとの文字数ショートカットに頼らないでください。
長い入力の場合、カウント境界を保持し、チャンクメソッドを文書化します。トークナイザーは境界を超えて文字をマージできるため、独立してカウントされた部分の合計は、完全な入力カウントとはわずかに異なる場合があります。
クロストークナイザー圧縮研究は、簡単な単語および文字のヒューリスティクスがドメイン全体で失敗する理由を説明します。測定されたトークン数をデータとして扱い、普遍的な変換比率として扱わないでください。
トークンを効果的なコストに変換する
効果的な入力コストは、測定されたトークンにモデルの適用可能な入力価格を掛けたものです。基本入力、キャッシュされた入力、長いコンテキストのティア、および出力使用を別々の行として保持してください。請求ルールが異なるためです。
公正なモデル比較は、同じコンテンツセットとタスクを使用します。1つのモデルが生のHTMLを受け取り、別のモデルがMarkdownを受け取る場合、実験はパイプライン設計とモデルの価格を同時に測定します。
Scrapelessの位置づけ
Scrapeless Universal Scraping API は、モデル呼び出しの前にウェブコンテンツを取得できます。アプリケーションはソースURLとレンダリング設定を保持し、その後、生のHTML、テキスト、またはクリーンな表現を下流のタスクに基づいて選択するべきです。
生のHTMLは、モデルがDOM構造について推論する必要がある場合に適切です。クリーンなMarkdownは、通常、質問応答や情報検索においてより優れたデフォルトであるため、見出し、リスト、リンク、テーブルは完全なブラウザ文書なしでも生き残ります。
LLMスクレイパー比較は、ソース取得とLLM対応出力がどのように適合するかを説明しています。Scrapeless価格ページで取得量を評価してください。
何を最初に最適化するべきか
モデルを変更する前に、タスクに必要ないコンテンツを削除してください。ナビゲーション、クッキー通知、スタイル、スクリプト、重複したモバイルマークアップ、および無関係な推奨は、ほとんどの回答を改善することなく文脈を消費します。
次に、クリーンな入力を使用してトークナイザーを比較します。HTML Living Standardは、ブラウザ文書が読みやすいコンテンツ以上の構造やスクリプトに関する懸念を含む理由を示しています。
最後に、制作内容のミックスを監視します。散文が支配するベンチマークは、コード、テーブル、または多言語のページが支配する作業負荷を予測することはできません。
結論
トークンコストはモデル呼び出しの前に始まります。パイプラインが送信する正確な表現を測定し、各モデルの独自の方法でそれらをカウントし、タスクに必要ないブラウザ指向のバイトを削除してください。Scrapelessは取得レイヤーを提供し、アプリケーションはどの表現がモデルコンテキストになるかを決定します。
購入する前にウェブコンテキストを測定する準備はできていますか?
Discord または Telegram でScrapelessコミュニティに参加してください。app.scrapeless.comから始め、HTML、テキスト、およびMarkdownで表現されたページセットのベンチマークを行いましょう。
FAQ
Q: GPT、Claude、Geminiは同じテキストを同じようにカウントしますか?
いいえ。各モデルファミリーは独自のトークナイザーと語彙を使用するため、同一のバイトが異なるトークンカウントを生成する場合があります。
Q: 1トークンは4文字に相当しますか?
言語、コード、マークアップ、およびモデルファミリーにわたって信頼できる固定キャラクター比率はありません。正確なモデルのためにトークナイザーまたはカウント方法を使用してください。
Q: Markdownは常にHTMLよりもトークンを少なくしますか?
クリーンなMarkdownは通常、スクリプト、スタイル、属性、重複したナビゲーションを除去しますが、その結果は抽出ツールとページに依存します。同じキャプチャされたソースで両方の表現を測定してください。
Q: 生のHTMLをLLMに送信するべきですか?
生のHTMLは、タスクがDOM構造、属性、またはセレクターの推論を必要とする場合に正当化されます。要約やリサーチは通常、メインコンテンツとリンクのみを必要とします。
Q: モデル間でトークンコストをどのように比較すべきですか?
同一の制作サンプルを各モデルのサポートされている方法でカウントし、関連する価格帯を適用し、キャッシュされた入力、長いコンテキスト、および出力料金を分けて保持します。
Scrapelessでは、適用される法律、規制、およびWebサイトのプライバシーポリシーを厳密に遵守しながら、公開されているデータのみにアクセスします。 このブログのコンテンツは、デモンストレーションのみを目的としており、違法または侵害の活動は含まれません。 このブログまたはサードパーティのリンクからの情報の使用に対するすべての責任を保証せず、放棄します。 スクレイピング活動に従事する前に、法律顧問に相談し、ターゲットウェブサイトの利用規約を確認するか、必要な許可を取得してください。



