返回博客

TikTok 抓取 API 指南:资料、帖子和商店数据

Ava Wilson
Ava Wilson

Expert in Web Scraping Technologies

01-Sep-2026

TL;DR:

  • 三个角色覆盖核心工作流程。 使用 scraper.tiktok.user.detail 作为公共账户细节,scraper.tiktok.user.work 作为创作者的公共帖子,scraper.tiktok.shop.page 作为商店产品页面。
  • 个人资料调用是连接帖子数据的桥梁。 它接受 unique_id 并返回 sec_uid,这是帖子角色所期望的。
  • 商店请求需要产品上下文。 发送 product_idregion;在比较记录之前读取返回的区域和货币。
  • 响应是结构化的 JSON。 将标识符存储为字符串,保留可为 null 的字段,并将原始响应保留在任何规范化表旁边。
  • TikTok 抓取 API 返回快照。 调度、历史、评分和警报应包含在调用它的管道中。
  • 免费开始。 新的 Scrapeless 账户包含免费信用;在 Scrapeless 仪表板中创建账户。

介绍:一个端点,三个有用的 TikTok 数据集

TikTok 数据项目通常以一个简单的问题开始:工作流程可以在不维护浏览器解析器的情况下收集哪种公共账户、帖子或产品字段?答案取决于对象。创作者个人资料、创作者的帖子供稿和商店产品页面具有不同的标识符和响应形状。

Scrapeless TikTok 抓取 API 通过一个请求端点通过管理的角色暴露这些对象。API 通过 HTTP 返回 JSON,因此它适用于脚本、数据作业、内部工具和代理工作流程。本指南绘制了各个角色,发送经过身份验证的请求,并将它们的响应转换为在第一次运行后仍然可理解的记录。

有关管理角色的更广泛视图,请阅读 Scrapeless Scraper API 指南

TikTok 抓取 API 的功能

API 接受包含 Actor 名称和 input 对象的 JSON 请求。Scrapeless 运行该 actor,并返回该 actor 的结构化结果。传输遵循 HTTP 语义规范 中描述的标准 HTTP 请求语义,而响应体使用 IANA 媒体类型注册表 中列出的注册 JSON 媒体类型。

这三个 TikTok 角色服务于不同的工作:

Actor 必要输入 主要结果
scraper.tiktok.user.detail unique_id 公共个人资料细节和账户统计
scraper.tiktok.user.work sec_uid 公共帖子以及媒体、音乐、标签和参与度字段
scraper.tiktok.shop.page product_id, region 产品、卖家、价格、库存、选项、SKU 和运费字段

这些接口不提供关注者列表、受众人口统计、评论文本、完整的 TikTok 目录或订单分类账。将每个响应视为请求的公共对象的时间点观察。

你可以用它构建什么

  • 创作者研究。 在人类评估品牌适合度之前,将个人资料统计与最近的帖子样本结合起来。
  • 内容监控。 捕获选定账户的描述、帖子 URL、时间戳、标签和公共参与计数。
  • 目录检查。 通过 ID 和区域读取已知的商店产品,包括价格、货币、库存和变体信息。
  • 产品快照。 保存重复的产品响应及其收集时间戳,以构建历史表。
  • 内部丰富。 将公共 TikTok 字段添加到现有的创作者或产品记录中,而无需抓取渲染的页面标记。

端点和参数

所有三个角色使用相同的端点:

POST https://api.scrapeless.com/api/v1/scraper/request

身份验证使用 x-api-token 请求标头。请求体包含 actorinput

个人资料参数

scraper.tiktok.user.detail 接受 unique_id,即没有前导 @ 的用户名。其响应可以包括 account_idunique_idsec_uid、昵称、个人资料 URL、个人简介、头像、公共账户统计、账户创建时间、语言、国家和诸如验证、隐私和卖家状态等布尔标志。

帖子参数

scraper.tiktok.user.work 需要 sec_uid。它也接受 cursor 作为字符串和 count 作为正整数。默认 cursor0,文档中列出的默认值 count35。响应包含 items 数组。请勿自创续订字段:仅在响应和当前文档提供了工作流的验证续订值时推进。

商店参数

scraper.tiktok.shop.page 需要 product_idregion。文档中的区域示例包括 GBSGJPUS;它们是示例而不是详尽的市场列表。响应的 region 代表已解析的产品页面,并应与价格和货币一起传递。

演员的详细信息可以在 TikTok 用户详细文档TikTok 用户工作文档TikTok 商店页面文档 中找到。

前提条件

  • 一个 Scrapeless 账户和来自 Scrapeless Dashboard 的 API 令牌
  • 一个公共的 TikTok 用户名或已知的 TikTok 商店产品 ID
  • 数据收集的允许目的和保留政策

示例需要一个有效的 Scrapeless API 令牌。在运行代码之前将其导出为 SCRAPELESS_API_KEY

发送认证请求

此 curl 调用获取公共个人资料数据。用您的工作流被授权研究的账户替换用户名。

bash Copy
curl --request POST 'https://api.scrapeless.com/api/v1/scraper/request' \
  --header "x-api-token: ${SCRAPELESS_API_KEY}" \
  --header 'content-type: application/json' \
  --data '{
    "actor": "scraper.tiktok.user.detail",
    "input": {"unique_id": "tiktok"}
  }'

相同的信封适用于其他参与者。只有参与者和输入字段会改变。

使用 Scrapeless 开始抓取

通过 Scrapeless 提升您的网络抓取和自动化工作流程!
今天注册,获得 5 美元的免费积分 - 无须信用卡

立即在 Scrapeless Dashboard 申请您的免费积分。

在 Python 中关联个人资料和帖子的数据显示

有用的连接键是 sec_uid。以下程序从个人资料响应中获取该键,然后请求一个边界帖子样本。Python 的 JSON 库文档 解释了这里使用的序列化行为。

python Copy
import json
import os
from urllib.request import Request, urlopen

ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
TOKEN = os.environ["SCRAPELESS_API_KEY"]


def run_actor(actor, actor_input):
    body = json.dumps({"actor": actor, "input": actor_input}).encode()
    request = Request(
        ENDPOINT,
        data=body,
        headers={
            "x-api-token": TOKEN,
            "content-type": "application/json",
        },
        method="POST",
    )
    with urlopen(request, timeout=60) as response:
        return json.load(response)


profile = run_actor(
    "scraper.tiktok.user.detail",
    {"unique_id": "tiktok"},
)

posts = run_actor(
    "scraper.tiktok.user.work",
    {"sec_uid": profile["sec_uid"], "cursor": "0", "count": 10},
)

record = {
    "profile": {
        "account_id": str(profile.get("account_id", "")),
        "unique_id": profile.get("unique_id"),
        "sec_uid": profile.get("sec_uid"),
        "nickname": profile.get("nickname"),
        "statistics": profile.get("statistics", {}),
    },
    "posts": posts.get("items", []),
}

print(json.dumps(record, ensure_ascii=False, indent=2))

即使 ID 仅包含数字,也要将其保留为字符串。这可以避免在使用有限数字精度表示大数字的下游工具中出现精度丢失。

在不猜测的情况下读取响应架构

个人资料、帖子和商店响应需要单独的归一化规则。

对于个人资料,将身份字段与嵌套的统计对象并列保留。对于帖子,当存在时保留帖子 ID 和 URL、描述、创建时间、公开计数、媒体字段、标签、语言、固定或广告标志、音乐、字幕和权限。媒体 URL 和字幕可以为空,因此空值与请求失败是不同的。

对于商店产品,将产品级字段与 SKU 级字段分开。显示的价格、总库存、卖家、类别和运输细节描述了产品响应。每个 SKU 可以有自己的选项和可用性。 sold_count 是产品页面返回的值;它不是经过验证的订单帐簿或特定时期的 GMV 数字。

处理结构化输出

持久表格从四个选择开始:

  1. 在参与者响应外添加一个集合时间戳。
  2. 保留原始 JSON 以供审计和重新处理。
  3. 将个人资料、帖子、产品和 SKU 正规化到单独的表格中。
  4. 在源语义建立其他含义之前,将缺失和空字段视为未知。

对于个人数据,仅收集所需的公共字段,以满足所述目的。 NIST 隐私框架 提供了识别隐私风险和设置有关收集、访问和保留的控制措施的有用结构。

Scrapeless 将这些参与者打包在 抓取 API 下。在估算生产数量之前,请查看 当前定价页面

常见问题以避免

  • 在需要 sec_uid 的地方使用用户名。 首先解析个人资料并将其 sec_uid 传递给帖子参与者。
  • 将每个空白媒体字段视为错误。 可选字段在有效响应中可以为空。
  • 合并产品与 SKU 库存。 保留两个级别,以便变体更改不会覆盖产品快照。
  • 在没有区域和货币的情况下比较价格。 在每个观察中存储这两个字段。
  • 将快照称为追踪器。 追踪器需要调度程序、带时间戳的存储、比较逻辑和警报目标。

结论:围绕稳定对象构建

TikTok 爬虫 API 将三项常见任务简化为明确的操作调用:解析帐户、收集有限的公共帖子样本或获取某地区已知的商店产品。主要的工程工作转移到数据建模:保留标识符、保存原始响应、附加时间戳,并将产品记录与变体分开。

准备好构建你的 TikTok 数据管道了吗?

加入 Scrapeless DiscordTelegram 社区 来比较实现笔记。当你准备好发送第一个请求时,请在 Scrapeless Dashboard 创建一个帐户。

常见问题

问:什么是 TikTok 爬虫 API?

TikTok 爬虫 API 通过 HTTP 请求将支持的公共 TikTok 页面转换为结构化数据。Scrapeless 为用户详细信息、用户帖子和商店产品页面提供了单独的操作。

问:API 能否获取 TikTok 用户名的帖子?

是的,通过两次调用的工作流程。使用 scraper.tiktok.user.detail 解析用户名,然后将返回的 sec_uid 传递给 scraper.tiktok.user.work

问:API 是否返回评论或关注者列表?

不。此处记录的操作不返回评论文本、关注者列表或受众人口统计信息。

问:TikTok 商店响应是否包括 SKU 数据?

是的。商店操作可以返回选项和 SKU 记录,以及产品级别的价格、货币、库存、卖家、类别、图像、评级、评论和运输字段。

问:抓取公共 TikTok 数据合法吗?

合法性取决于司法管辖区、数据、目的、访问方式和适用条款。仅使用公共数据,尽量减少收集,保护存储记录,并为具体项目获得法律建议。

问:我需要管理代理或页面防御吗?

托管操作处理 API 调用背后的收集表面。你的应用仍然需要有效的输入、明确的错误处理和保守的请求规划。

问:工作流程可以在没有 AI 代理的情况下运行吗?

可以。任何能够发送 JSON 和 x-api-token 头的 HTTP 客户端都可以调用该端点。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录