Chi phí Token AI: HTML so với Markdown qua GPT, Claude, Gemini
Advanced Data Extraction Specialist
TL;DR:
- Số lượng token là những phép đo cụ thể cho từng mô hình. GPT, Claude, và Gemini có thể phân chia cùng một byte khác nhau, vì vậy giá danh sách đơn thuần không thể dự đoán chi phí nhập vào.
- HTML thô tiêu tốn ngữ cảnh cho việc đánh dấu, kịch bản, kiểu dáng và điều hướng lặp lại. Markdown nội dung chính thường lưu giữ nhiều thông tin có thể nhìn thấy hơn cho mỗi token.
- Đo lường định dạng và bộ phân tích token như các biến riêng biệt. So sánh các trang giống hệt trong HTML thô, văn bản trích xuất và Markdown với bộ đếm riêng của mỗi nhà cung cấp.
- Scrapeless giúp kiểm soát đầu vào trước khi nó đến mô hình. Kết xuất trang, cô lập nội dung hữu ích, bảo tồn URL nguồn, và chỉ gửi đại diện mà nhiệm vụ cần.
Một LLM không tính phí một trang web theo số lượng ký tự. Nó tính phí các token được tạo ra sau khi một bộ phân tích token cụ thể cho mô hình phân chia đại diện của trang.
Điều đó có nghĩa là hai lựa chọn kỹ thuật quyết định chi phí: bộ phân tích token nào đếm đầu vào, và liệu đầu vào có phải là HTML thô, văn bản thuần túy, hay Markdown được làm sạch.
Token AI Là Gì?
Một token AI là một đơn vị được tạo ra bởi bộ phân tích token của mô hình và được tính vào ngữ cảnh và mức sử dụng. Các token không phải là từ hoặc ký tự phổ quát. Từ vựng, tập huấn luyện, và thuật toán phân tích token thay đổi các ranh giới.
Dự án OpenAI tiktoken tiết lộ các mã hóa được sử dụng để đo lường những ranh giới đó. Một số lượng sản xuất cho một mã hóa không nên được đưa vào một gia đình mô hình khác như một giá trị chính xác.
Tại Sao Trang Tương Tự Sản Xuất Các Số Lượng Khác Nhau
Các từ thông dụng có thể phù hợp với một mục từ vựng, trong khi các định danh không thông dụng, mã, emoji, và văn bản không phải tiếng Anh bị chia thành nhiều phần. Nghiên cứu về phân tích token giữa các ngôn ngữ cho thấy rằng các lựa chọn từ vựng tạo ra chi phí đại diện không đồng đều; nghiên cứu sự chênh lệch phân tích token ngôn ngữ đo lường tác động đó giữa các nhóm ngôn ngữ.
Đầu vào có cấu trúc thêm một nguồn biến đổi khác. HTML lặp lại tên thẻ, thuộc tính, giá trị lớp, kịch bản, và dữ liệu kiểu. JSON và các sơ đồ công cụ thêm dấu ngoặc, khóa có dấu ngoặc kép, và dấu câu. Những byte đó hữu ích cho các bộ phân tích nhưng thường không liên quan đến nhiệm vụ của mô hình.
HTML, Văn Bản, và Markdown Là Các Đầu Vào Khác Nhau
| Định dạng | Giữ lại | Bỏ qua | Phù hợp nhất |
|---|---|---|---|
| HTML thô | Cấu trúc DOM, thuộc tính, kịch bản, kiểu | Không gì cả | Phân tích DOM và công việc chọn lọc |
| Văn bản trích xuất | Các từ có thể nhìn thấy | Hầu hết cấu trúc và liên kết | Phân loại đơn giản hoặc tìm kiếm |
| Markdown sạch | Tiêu đề, danh sách, bảng, liên kết, văn bản có thể đọc | Kịch bản, kiểu, hầu hết phần giao diện | Nghiên cứu, tóm tắt, và RAG |
Markdown không tự động là đại diện nhỏ nhất có thể. Nó có giá trị vì nó giữ lại cấu trúc tài liệu hữu ích trong khi loại bỏ các lớp byte lớn liên quan đến trình duyệt.
Một Chỉ Số Token Có Thể Tái Sản Xuất
Sử dụng một tập trang cố định phản ánh khối lượng công việc sản xuất: tài liệu, trang sản phẩm, tin tức, diễn đàn, và các ứng dụng JavaScript nếu chúng quan trọng. Lưu lại các byte đã thu được chính xác và một hash cho mỗi đại diện.
Đối với mỗi trang:
- Ghi lại HTML thô sau chính sách kết xuất đã chọn.
- Trích xuất văn bản nội dung chính.
- Tạo Markdown từ cùng một nguồn đã kết xuất.
- Đếm cả ba hình thức với bộ đếm chính thức của từng nhà cung cấp.
- Ghi lại số lượng token, ký tự, hash nội dung, cài đặt trích xuất, và danh mục trang.
Không so sánh số lượng thu thập vào những ngày khác nhau từ các trang thay đổi. Định dạng là biến độc lập của thí nghiệm; các byte nguồn phải giữ nguyên.
Bắt đầu thu thập dữ liệu với Scrapeless
Tăng cường quy trình thu thập dữ liệu web và tự động hóa của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.Nhận tín dụng miễn phí của bạn bây giờ trong Scrapeless Dashboard.
Đếm Bằng Các Phương Pháp Bản Địa Của Nhà Cung Cấp
Sử dụng bộ đếm hoặc bộ phân tích token được nhà cung cấp hỗ trợ cho mô hình đang được đánh giá. Đừng dựa vào cách tính số ký tự mỗi token để lập ngân sách hoặc cho phép ngữ cảnh.
Đối với các đầu vào dài, giữ ranh giới đếm và ghi lại bất kỳ phương pháp phân đoạn nào. Một bộ phân tích token có thể gộp các ký tự qua một ranh giới, vì vậy tổng số lượng các phần được đếm độc lập có thể khác một chút so với số đếm của đầu vào đầy đủ.
Nghiên cứu sự nén chéo bộ phân tích token giải thích tại sao các phương pháp heuristics đơn giản về từ và ký tự không hoạt động tốt giữa các lĩnh vực. Xem xét số lượng token đo được như dữ liệu, không phải như một tỷ lệ chuyển đổi phổ quát.
Chuyển Đổi Tokens Thành Chi Phí Hiệu Quả
Chi phí đầu vào hiệu quả được đo bằng số token nhân với giá đầu vào có thể áp dụng của mô hình. Giữ base input, cached input, các bậc ngữ cảnh dài, và việc sử dụng đầu ra như các hàng riêng biệt vì các quy tắc tính phí của chúng khác nhau.
Một so sánh mô hình công bằng sử dụng cùng một tập nội dung và nhiệm vụ. Nếu một mô hình nhận HTML thô và một mô hình khác nhận Markdown, thí nghiệm sẽ đo lường thiết kế pipeline và giá mô hình cùng một lúc.
Nơi Scrapeless Phù Hợp
Scrapeless Universal Scraping API có thể thu thập nội dung web trước khi gọi mô hình. Ứng dụng nên giữ lại URL nguồn và thiết lập render, sau đó chọn HTML thô, văn bản hoặc một đại diện đã được làm sạch dựa trên nhiệm vụ hạ nguồn.
HTML thô vẫn thích hợp khi mô hình phải suy luận về cấu trúc DOM. Markdown sạch thường là mặc định tốt hơn cho việc trả lời câu hỏi và truy xuất vì các tiêu đề, danh sách, liên kết và bảng vẫn tồn tại mà không cần tài liệu trình duyệt đầy đủ.
So sánh LLM scraper giải thích cách thu thập nguồn và kết quả sẵn sàng cho LLM kết hợp với nhau. Đánh giá khối lượng thu thập trên trang giá Scrapeless.
Những Gì Cần Tối Ưu Đầu Tiên
Xóa nội dung mà nhiệm vụ không cần trước khi thay đổi mô hình. Điều hướng, banner cookie, kiểu dáng, script, markup di động trùng lặp và đề xuất không liên quan tiêu tốn ngữ cảnh mà không cải thiện hầu hết các câu trả lời.
Sau đó so sánh các tokenizer sử dụng đầu vào đã được làm sạch. HTML Living Standard cho thấy lý do tại sao tài liệu trình duyệt chứa các mối quan tâm về cấu trúc và lập trình bên ngoài nội dung có thể đọc được của nó.
Cuối cùng, theo dõi sự pha trộn nội dung sản xuất. Một tiêu chuẩn bị chi phối bởi văn xuôi sẽ không dự đoán được khối lượng công việc bị chi phối bởi mã, bảng, hoặc trang đa ngôn ngữ.
Kết Luận
Chi phí token bắt đầu trước khi gọi mô hình. Đo lường các đại diện chính xác mà pipeline của bạn gửi, đếm chúng bằng phương pháp riêng của từng mô hình, và xóa các byte liên quan đến trình duyệt mà nhiệm vụ không cần. Scrapeless cung cấp lớp thu thập; ứng dụng quyết định đại diện nào trở thành ngữ cảnh của mô hình.
Sẵn Sàng Đo Lường Ngữ Cảnh Web Trước Khi Bạn Mua?
Tham gia cộng đồng Scrapeless trên Discord hoặc Telegram. Bắt đầu với app.scrapeless.com và chuẩn hóa một tập trang đại diện trong HTML, văn bản, và Markdown.
Câu Hỏi Thường Gặp
Q: Có phải GPT, Claude, và Gemini đếm cùng một văn bản giống nhau không?
Không. Mỗi gia đình mô hình sử dụng tokenizer và từ vựng riêng của nó, vì vậy các byte giống nhau có thể sản xuất số lượng token khác nhau.
Q: Một token có bằng bốn ký tự không?
Không có tỷ lệ ký tự cố định nào đáng tin cậy trên các ngôn ngữ, mã, markup, và gia đình mô hình. Sử dụng tokenizer hoặc phương pháp đếm cho mô hình chính xác.
Q: Markdown có luôn sử dụng ít token hơn HTML không?
Markdown sạch thường loại bỏ tập lệnh, kiểu dáng, thuộc tính, và điều hướng lặp lại, nhưng kết quả phụ thuộc vào bộ thu thập và trang. Đo lường cả hai đại diện trên cùng một nguồn đã được thu thập.
Q: HTML thô có bao giờ được gửi đến LLM không?
HTML thô được biện minh khi nhiệm vụ cần cấu trúc DOM, thuộc tính, hoặc suy luận bộ chọn. Tóm tắt và nghiên cứu thường chỉ cần nội dung chính và liên kết.
Q: Làm thế nào để so sánh chi phí token giữa các mô hình?
Đếm các mẫu sản xuất giống hệt với phương pháp hỗ trợ của từng mô hình, áp dụng mức giá liên quan, và giữ riêng đầu vào đã được lưu trữ, ngữ cảnh dài, và chi phí đầu ra.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



