Quay lại blog

Hướng dẫn API TikTok Scraper: Dữ liệu Hồ sơ, Bài đăng và Cửa hàng

Ava Wilson
Ava Wilson

Expert in Web Scraping Technologies

01-Sep-2026

TL;DR:

  • Ba diễn viên bao phủ quy trình cốt lõi. Sử dụng scraper.tiktok.user.detail cho chi tiết tài khoản công khai, scraper.tiktok.user.work cho bài đăng công khai của người sáng tạo, và scraper.tiktok.shop.page cho trang sản phẩm Shop.
  • Cuộc gọi hồ sơ là cầu nối đến dữ liệu bài đăng. Nó chấp nhận unique_id và trả về sec_uid, mà diễn viên bài đăng mong đợi.
  • Các yêu cầu Shop cần ngữ cảnh sản phẩm. Gửi cả product_idregion; đọc khu vực và tiền tệ trả về trước khi so sánh các bản ghi.
  • Phản hồi là JSON có cấu trúc. Lưu trữ định danh dưới dạng chuỗi, bảo tồn các trường có thể null, và giữ nguyên phản hồi gốc bên cạnh bất kỳ bảng chuẩn hóa nào.
  • API scraper TikTok trả về các bức ảnh chụp. Lập lịch, lịch sử, điểm số, và cảnh báo thuộc về quy trình gọi nó.
  • Miễn phí để bắt đầu. Các tài khoản Scrapeless mới bao gồm tín dụng miễn phí; tạo một tài khoản trong Bảng điều khiển Scrapeless.

Giới thiệu: một điểm cuối, ba tập dữ liệu TikTok hữu ích

Các dự án dữ liệu TikTok thường bắt đầu bằng một câu hỏi đơn giản: tài khoản công khai, bài đăng hoặc trường sản phẩm nào mà một quy trình có thể thu thập mà không cần duy trì một trình phân tích trình duyệt? Câu trả lời phụ thuộc vào đối tượng. Một hồ sơ người sáng tạo, một nguồn bài đăng của người sáng tạo, và một trang sản phẩm Shop có các định danh và hình dạng phản hồi khác nhau.

API scraper TikTok Scrapeless phơi bày các đối tượng đó thông qua các diễn viên được quản lý phía sau một điểm cuối yêu cầu. API trả về JSON qua HTTP, vì vậy nó phù hợp với các kịch bản, công việc dữ liệu, công cụ nội bộ, và quy trình của đại lý. Hướng dẫn này ánh xạ các diễn viên, gửi yêu cầu xác thực, và chuyển đổi phản hồi của chúng thành các bản ghi vẫn có thể hiểu được sau lần chạy đầu tiên.

Để có cái nhìn rộng hơn về các diễn viên được quản lý, đọc hướng dẫn API Scraper Scrapeless.

Những gì API Scraper TikTok làm

API chấp nhận một yêu cầu JSON chứa tên diễn viên và một đối tượng input. Scrapeless chạy diễn viên và trả về kết quả có cấu trúc của diễn viên đó. Phương thức vận chuyển tuân theo các ngữ nghĩa yêu cầu HTTP tiêu chuẩn được mô tả trong các thông số kỹ thuật HTTP, trong khi nội dung phản hồi sử dụng loại phương tiện JSON đã đăng ký được liệt kê bởi thông tin về loại phương tiện của IANA.

Ba diễn viên TikTok phục vụ các công việc khác nhau:

Diễn viên Đầu vào yêu cầu Kết quả chính
scraper.tiktok.user.detail unique_id Chi tiết hồ sơ công khai và thống kê tài khoản
scraper.tiktok.user.work sec_uid Bài đăng công khai kèm theo phương tiện, nhạc, hashtag, và các trường tương tác
scraper.tiktok.shop.page product_id, region Sản phẩm, người bán, giá cả, tồn kho, tùy chọn, SKU, và các trường vận chuyển

Những bề mặt này không cung cấp danh sách người theo dõi, nhân khẩu học người dùng, văn bản bình luận, danh mục TikTok hoàn chỉnh, hoặc sổ cái đơn hàng. Xem mỗi phản hồi như một quan sát theo thời điểm của đối tượng công khai được yêu cầu.

Những gì bạn có thể xây dựng với nó

  • Nghiên cứu người sáng tạo. Kết hợp thống kê hồ sơ với mẫu bài đăng gần đây trước khi một người xem xét sự phù hợp của thương hiệu.
  • Giám sát nội dung. Ghi lại mô tả, URL bài đăng, dấu thời gian, hashtag, và số lượng tương tác công khai cho các tài khoản được chọn.
  • Kiểm tra danh mục. Đọc một sản phẩm Shop đã biết bằng ID và khu vực, bao gồm giá cả, tiền tệ, tồn kho, và thông tin biến thể.
  • Các bức ảnh chụp sản phẩm. Lưu các phản hồi sản phẩm lặp lại cùng với dấu thời gian thu thập để xây dựng một bảng lịch sử.
  • Nâng cao nội bộ. Thêm các trường TikTok công khai vào một bản ghi người sáng tạo hoặc sản phẩm hiện có mà không cần thu thập mã đánh dấu trang đã được hiển thị.

Điểm cuối và Tham số

Cả ba diễn viên đều sử dụng cùng một điểm cuối:

POST https://api.scrapeless.com/api/v1/scraper/request

Xác thực sử dụng tiêu đề yêu cầu x-api-token. Nội dung bao gồm actorinput.

Tham số hồ sơ

scraper.tiktok.user.detail chấp nhận unique_id, tên người dùng mà không có @ ở đầu. Phản hồi của nó có thể bao gồm account_id, unique_id, sec_uid, biệt danh, URL hồ sơ, tiểu sử, avatar, thống kê tài khoản công khai, thời gian tạo tài khoản, ngôn ngữ, quốc gia, và các cờ kiểu boolean như xác thực, quyền riêng tư, và trạng thái người bán.

Tham số bài đăng

scraper.tiktok.user.work yêu cầu sec_uid. Nó cũng chấp nhận cursor dưới dạng chuỗi và count dưới dạng số nguyên dương. Giá trị mặc định của cursor0, và giá trị mặc định đã được tài liệu count35. Phản hồi chứa một mảng items. Không tạo một trường tiếp tục: chỉ tiến lên khi phản hồi và tài liệu hiện tại cung cấp một giá trị tiếp tục xác thực cho quy trình.

Tham số Shop

scraper.tiktok.shop.page yêu cầu product_idregion. Các ví dụ về khu vực trong tài liệu bao gồm GB, SG, JP, và US; chúng là ví dụ hơn là danh sách thị trường đầy đủ. region của phản hồi đại diện cho trang sản phẩm đã được giải quyết và nên đi kèm với giá cả và tiền tệ.

Các chi tiết về diễn viên có sẵn trong tài liệu chi tiết người dùng TikTok, tài liệu công việc người dùng TikTok, và tài liệu trang Shop TikTok.

Điều kiện tiên quyết

  • Một tài khoản Scrapeless và mã API từ Bảng điều khiển Scrapeless
  • Một tên người dùng TikTok công khai hoặc ID sản phẩm TikTok Shop đã biết
  • Một mục đích được phép và chính sách bảo lưu cho dữ liệu được thu thập

Các ví dụ yêu cầu một mã API Scrapeless trực tiếp. Xuất nó dưới dạng SCRAPELESS_API_KEY trước khi chạy mã.

Gửi Yêu Cầu Đã Xác Thực

Gọi curl này lấy dữ liệu hồ sơ công khai. Thay thế tên người dùng bằng tài khoản mà quy trình làm việc của bạn được phép nghiên cứu.

bash Copy
curl --request POST 'https://api.scrapeless.com/api/v1/scraper/request' \
  --header "x-api-token: ${SCRAPELESS_API_KEY}" \
  --header 'content-type: application/json' \
  --data '{
    "actor": "scraper.tiktok.user.detail",
    "input": {"unique_id": "tiktok"}
  }'

Cùng một phong bì hoạt động cho các diễn viên khác. Chỉ có diễn viên và các trường đầu vào thay đổi.

Bắt đầu thu thập dữ liệu với Scrapeless

Nâng cao quy trình thu thập dữ liệu và tự động hóa của bạn với Scrapeless!
Đăng ký hôm nay và nhận $5 tín dụng miễn phíkhông cần thẻ tín dụng.

Nhận tín dụng miễn phí của bạn ngay bây giờ trong Bảng điều khiển Scrapeless.

Kết hợp Dữ liệu Hồ sơ và Bài đăng trong Python

Khóa kết hợp hữu ích là sec_uid. Chương trình sau lấy nó từ phản hồi hồ sơ, sau đó yêu cầu một mẫu bài đăng có giới hạn. Tài liệu thư viện JSON của Python giải thích hành vi tuần tự hóa được sử dụng ở đây.

python Copy
import json
import os
from urllib.request import Request, urlopen

ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
TOKEN = os.environ["SCRAPELESS_API_KEY"]


def run_actor(actor, actor_input):
    body = json.dumps({"actor": actor, "input": actor_input}).encode()
    request = Request(
        ENDPOINT,
        data=body,
        headers={
            "x-api-token": TOKEN,
            "content-type": "application/json",
        },
        method="POST",
    )
    with urlopen(request, timeout=60) as response:
        return json.load(response)


profile = run_actor(
    "scraper.tiktok.user.detail",
    {"unique_id": "tiktok"},
)

posts = run_actor(
    "scraper.tiktok.user.work",
    {"sec_uid": profile["sec_uid"], "cursor": "0", "count": 10},
)

record = {
    "profile": {
        "account_id": str(profile.get("account_id", "")),
        "unique_id": profile.get("unique_id"),
        "sec_uid": profile.get("sec_uid"),
        "nickname": profile.get("nickname"),
        "statistics": profile.get("statistics", {}),
    },
    "posts": posts.get("items", []),
}

print(json.dumps(record, ensure_ascii=False, indent=2))

Giữ ID dưới dạng chuỗi ngay cả khi chúng chỉ chứa các chữ số. Điều đó tránh mất độ chính xác trong các công cụ hạ nguồn mà đại diện cho các số lớn với độ chính xác số có giới hạn.

Đọc Sơ đồ Phản hồi mà không cần Đoán

Phản hồi hồ sơ, bài đăng và Shop cần quy tắc chuẩn hóa riêng biệt.

Đối với hồ sơ, giữ các trường danh tính bên cạnh đối tượng thống kê lồng nhau. Đối với các bài đăng, giữ lại ID bài đăng và URL, mô tả, thời gian tạo, các số đếm công khai, các trường phương tiện, thẻ, ngôn ngữ, cờ ghim hoặc quảng cáo, nhạc, phụ đề và quyền khi có mặt. URL phương tiện và phụ đề có thể để trống, vì vậy giá trị trống khác với một yêu cầu không thành công.

Đối với các sản phẩm Shop, tách các trường cấp sản phẩm khỏi các trường cấp SKU. Giá hiển thị, tổng kho, người bán, danh mục và chi tiết vận chuyển mô tả phản hồi sản phẩm. Mỗi SKU có thể có tùy chọn và tính khả dụng riêng. sold_count là giá trị được trả về bởi trang sản phẩm; nó không phải là sổ cái đơn hàng đã được xác minh hoặc con số GMV cụ thể theo thời gian.

Xử lý Đầu ra Cấu trúc

Một bảng bền vững bắt đầu với bốn lựa chọn:

  1. Thêm một dấu thời gian thu thập bên ngoài phản hồi của diễn viên.
  2. Bảo tồn JSON thô để kiểm toán và xử lý lại.
  3. Chuẩn hóa hồ sơ, bài đăng, sản phẩm và SKU vào các bảng riêng biệt.
  4. Xem xét các trường vắng mặt và trống như không xác định cho đến khi ngữ nghĩa nguồn thiết lập ý nghĩa khác.

Đối với dữ liệu cá nhân, chỉ thu thập các trường công khai cần thiết cho mục đích đã nêu. Khung Bảo mật NIST cung cấp một cấu trúc hữu ích để xác định rủi ro quyền riêng tư và thiết lập các biện pháp kiểm soát xung quanh việc thu thập, truy cập và bảo lưu.

Scrapeless gói những diễn viên này dưới API Thu thập Dữ liệu. Kiểm tra trang giá hiện tại trước khi ước tính khối lượng sản xuất.

Các Vấn Đề Thường Gặp Cần Ngăn Chặn

  • Sử dụng một tên người dùng khi sec_uid là cần thiết. Giải quyết hồ sơ trước và chuyển sec_uid của nó cho diễn viên bài đăng.
  • Xem xét mọi trường phương tiện trống là một lỗi. Các trường tùy chọn có thể trống trong một phản hồi hợp lệ.
  • Gộp kho sản phẩm và SKU. Giữ cả hai cấp độ để một thay đổi biến thể không ghi đè lên bức tranh sản phẩm.
  • So sánh giá mà không có khu vực và tiền tệ. Lưu cả hai trường trên mọi quan sát.
  • Gọi một bản chụp là một trình theo dõi. Một trình theo dõi cần một bộ lập lịch, kho lưu trữ theo thời gian, logic so sánh, và một đích báo động.

Kết luận: xây dựng xung quanh các đối tượng ổn định

API trình thu thập dữ liệu TikTok giảm ba công việc phổ biến thành các cuộc gọi chính xác: giải quyết một tài khoản, thu thập một mẫu bài đăng công khai có giới hạn, hoặc lấy một sản phẩm Shop đã biết trong một khu vực. Công việc kỹ thuật chính chuyển sang mô hình hóa dữ liệu: bảo tồn các định danh, giữ phản hồi thô, gắn thời gian, và tách biệt hồ sơ sản phẩm khỏi các biến thể.

Sẵn sàng để Xây dựng Dòng Dữ liệu TikTok của Bạn?

Tham gia Scrapeless Discord hoặc cộng đồng Telegram để so sánh ghi chú triển khai. Tạo một tài khoản trong Scrapeless Dashboard khi bạn sẵn sàng gửi yêu cầu đầu tiên.

Câu hỏi thường gặp

Q: API trình thu thập dữ liệu TikTok là gì?

Một API trình thu thập dữ liệu TikTok chuyển đổi các trang TikTok công khai được hỗ trợ thành dữ liệu có cấu trúc thông qua một yêu cầu HTTP. Scrapeless công khai các diễn viên riêng biệt cho chi tiết người dùng, bài đăng của người dùng, và các trang sản phẩm Shop.

Q: API có thể lấy bài đăng từ một tên người dùng TikTok không?

Có, thông qua một quy trình hai cuộc gọi. Giải quyết tên người dùng với scraper.tiktok.user.detail, sau đó truyền sec_uid đã trả về cho scraper.tiktok.user.work.

Q: API có trả về bình luận hoặc danh sách người theo dõi không?

Không. Các diễn viên được tài liệu hóa ở đây không trả về văn bản bình luận, danh sách người theo dõi, hoặc nhân khẩu học khán giả.

Q: Phản hồi từ Shop TikTok có bao gồm dữ liệu SKU không?

Có. Diễn viên Shop có thể trả về các tùy chọn và hồ sơ SKU cùng với giá cấp sản phẩm, tiền tệ, hàng tồn kho, người bán, danh mục, hình ảnh, đánh giá, nhận xét, và các trường vận chuyển.

Q: Việc thu thập dữ liệu công khai trên TikTok có hợp pháp không?

Tính hợp pháp phụ thuộc vào khu vực pháp lý, dữ liệu, mục đích, phương thức truy cập, và các điều khoản áp dụng. Chỉ sử dụng dữ liệu công khai, tối thiểu hóa việc thu thập, bảo vệ các hồ sơ đã lưu trữ, và nhận tư vấn pháp lý cho dự án cụ thể.

Q: Tôi có cần quản lý proxy hoặc bảo vệ trang không?

Diễn viên được quản lý xử lý bề mặt thu thập phía sau cuộc gọi API. Ứng dụng của bạn vẫn cần đầu vào hợp lệ, xử lý lỗi rõ ràng và lập kế hoạch yêu cầu bảo thủ.

Q: Quy trình có thể chạy mà không cần tác nhân AI không?

Có. Bất kỳ khách hàng HTTP nào có thể gửi JSON và tiêu đề x-api-token có thể gọi đến điểm cuối.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục