返回博客

TikTok影响者分析:评估创作者候选名单

Isabella Garcia
Isabella Garcia

Web Data Collection Specialist

01-Sep-2026

TL;DR:

  • 创作者短名单需要两个层次的证据。 结合公共个人资料统计数据与创作者公共帖子的有限样本。
  • 使用透明的计分卡。 记录输入、转换、权重和人工决策,而不是生成无法解释的排名。
  • 更倾向于分布而不是单一病毒帖子。 中位数互动和发布节奏更公平地描述样本,而不是单一的最大值。
  • 请勿推断不可用的观众特征。 有文档的参与者不提供关注者人口统计、关注者列表或虚假关注者标签。
  • 品牌适配仍需人工审查。 内容主题、披露质量、安全背景和创意适配不能仅仅归结为公共计数。
  • 免费开始。 新的 Scrapeless 账户通过 Scrapeless Dashboard 包括免费信用。

引言:将一系列用户名转化为可审核的短名单

网红选择通常始于一个用户名的电子表格。关注者数量使得该列表可以排序,但它并不能显示一个账户是否持续发帖、最近的内容是否吸引互动,或者内容是否适合特定的简报。

更好的 TikTok 网红分析结合了两个有记录的 Scrapeless 参与者。 scraper.tiktok.user.detail 解析每个公共个人资料,并返回账户统计数据和 sec_uidscraper.tiktok.user.work 使用该 sec_uid 返回有限的一组公共帖子和互动字段。然后,管道计算描述性特征并为人工审核生成计分卡。

关于更广泛的请求模式,请参见 Scrapeless 数据参与者指南

管道一览

阶段 输入 输出
解析 创作者用户名 个人资料记录和 sec_uid
样本 sec_uid, 游标, 计数 最近公共帖子项目
转换 个人资料和帖子 JSON 可比较的描述性特征
审核 特征和内容链接 人工备注和资格决定
存储 决定包 带时间戳的短名单记录

输出是一个决策辅助工具。它并不证明观众的真实性、销售影响或未来活动的表现。

在收集数据之前定义评估

在打开 API 之前写下决策规则。一个有用的简报如下所示:

  • 目标市场和活动类别
  • 最低内容相关性要求
  • 每位创作者使用的帖子样本大小
  • 取消资格的内容或披露问题
  • 哪些公共指标是描述性的而非决定性的
  • 谁进行最终审查

网红披露是审核的一部分。 FTC 对社交媒体网红的披露指导 解释了物质联系应向观众清晰可见。 使用适用于活动市场的当地规则。

先决条件

  • 一个 Scrapeless 账户和来自 Scrapeless Dashboard 的 API 令牌
  • 被允许的公共 TikTok 用户名列表
  • 一份书面的计分卡和人工审核政策
  • 个人资料、帖子和决策记录的保留期限

该代码在 SCRAPELESS_API_KEY 中需要一个实时令牌和一个名为 creators.txt 的以换行符分隔的文件。

阶段 1 — 解析每个公共个人资料

使用 scraper.tiktok.user.detail 调用 unique_id。 保留 account_id、用户名、sec_uid、个人资料 URL、公共统计数据、账户标志和采集时间戳。 用户详细信息参与者文档 列出了支持的响应字段。

当可选字段为空时,请勿默默丢弃创作者。 以明确的收集状态存储个人资料,以便审核者可以区分不完整数据与被拒绝账户。

阶段 2 — 收集可比较的帖子样本

使用 scraper.tiktok.user.work 结合返回的 sec_uid。 为每位创作者提供相同的请求 count 和起始 cursor,以便初始比较遵循一个采样规则。 该参与者可以返回帖子描述、URL、时间戳、公共互动计数、媒体字段、标签、语言、帖子标志、音乐、字幕和权限。

用户工作参与者文档cursor 记录为字符串,count 记录为正整数。 仅当当前响应和文档揭示经过验证的续值时,才需继续超出第一次响应。

使用Scrapeless开始抓取数据

通过Scrapeless提升您的网络抓取和自动化工作流程!
立即注册并获得5美元的免费信用无需信用卡

现在在Scrapeless仪表盘领取您的免费信用。

阶段3 — 计算描述性特征

下面的程序解决了个人资料问题,请求相同的有界帖子样本,并计算中位数。它保持分数卡的描述性:没有不可用的人口统计信息,也没有虚假关注者标签。

python Copy
import json
import os
import statistics
from urllib.request import Request, urlopen

ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
TOKEN = os.environ["SCRAPELESS_API_KEY"]


def actor(name, actor_input):
    request = Request(
        ENDPOINT,
        data=json.dumps({"actor": name, "input": actor_input}).encode(),
        headers={"x-api-token": TOKEN, "content-type": "application/json"},
        method="POST",
    )
    with urlopen(request, timeout=60) as response:
        return json.load(response)


def median(items, field):
    values = [item[field] for item in items if isinstance(item.get(field), (int, float))]
    return statistics.median(values) if values else None


def evaluate(username):
    profile = actor("scraper.tiktok.user.detail", {"unique_id": username.lstrip("@")})
    posts = actor(
        "scraper.tiktok.user.work",
        {"sec_uid": profile["sec_uid"], "cursor": "0", "count": 20},
    ).get("items", [])
    return {
        "unique_id": profile.get("unique_id"),
        "profile_url": profile.get("profile_url"),
        "is_verified": profile.get("is_verified"),
        "is_private": profile.get("is_private"),
        "profile_statistics": profile.get("statistics") or {},
        "sample_size": len(posts),
        "median_play_count": median(posts, "play_count"),
        "median_like_count": median(posts, "like_count"),
        "median_comment_count": median(posts, "comment_count"),
        "median_share_count": median(posts, "share_count"),
        "content_links": [post.get("url") for post in posts if post.get("url")],
    }


with open("creators.txt", encoding="utf-8") as source:
    usernames = [line.strip() for line in source if line.strip()]

results = [evaluate(username) for username in usernames]
print(json.dumps(results, ensure_ascii=False, indent=2))

Python的 统计模块文档 定义了中位数的计算。中位数减少一个异常值的影响,但并不能消除抽样偏差或建立因果关系。

阶段4 — 添加人工审核

每个创作者包应显示个人资料URL、公共摘要统计信息、样本大小、中位数帖子特征及采样内容的链接。然后审核者记录:

  • 与活动主题的相关性
  • 内容质量和制作适配性
  • 关于赞助材料的披露实践
  • 安全或适宜性问题
  • 基于可观察内容的语言和市场适配性
  • 接受、保留或拒绝的决定及简短理由

不要根据用户名、个人简介或参与计数推测年龄、种族、收入、健康状况或受众组成。行为者不提供人口统计面板,自动猜测会增加风险而没有可靠证据。

阶段5 — 存储决策包

保持源观察和决策分开。个人资料统计和帖子指标可能会改变;人类决策属于特定样本和简要信息。一个有用的记录包含简要ID、创作者ID、观察时间、采样帖子ID、派生特征、审核者、决策和理由。

NIST隐私框架 可以帮助团队识别隐私风险并设置收集、访问、保留和删除的控制措施。将存储的数据限制在活动评估所需的内容。

Scrapeless通过抓取API提供了两个行为者。当短名单大小和帖子样本已知时,请查看当前定价

如何避免误导性排名

  • 不要对不可用值进行除法。 如果分母缺失或为零,请将派生指标记录为未知。
  • 不要在没有披露的情况下比较不平等样本。 保持每一行的请求和返回样本大小。
  • 不要设置普遍的参与阈值。 类别、账户规模、内容格式和样本窗口会影响观察到的分布。
  • 不要根据公共计数标记账户为欺诈。 行为者返回观察,而不是真实性的裁决。
  • 不要自动化最终适配决策。 审核者需要检查实际内容和活动简要。

结论:使短名单具有可解释性

TikTok影响者分析最好作为一个文档化的管道:解决公共个人档案,收集一致的帖子样本,计算简单的描述性特征,并将证据发送给人工审核者。将源快照与决策保持在一起,以便其他审核者理解短名单是如何产生的。

准备建立创作者审核管道吗?

加入Scrapeless DiscordTelegram社区讨论数据模型。当短名单政策准备好时,在Scrapeless仪表盘创建账户。

常见问题解答

问:什么数据支持TikTok影响者分析?

记录的行为者提供公共个人资料详细信息、账户统计数据和公共帖子字段,如描述、URL、时间戳和参与计数。

问:API能识别虚假关注者吗?

不能。它不返回关注者身份或真实性标签,因此公共计数不应作为欺诈的证据。

问:比较最近帖子有什么公正的方法?

对每个创作者使用相同的抽样规则,保持样本大小,总结分布,并向审核者展示基础内容链接。

问:公共指标能确定品牌适配性吗?

不能。公共指标可以组织审核,而内容相关性、披露、适宜性和创意适配性需要人工判断。

问:收集公共创作者数据合法吗?
合法性取决于管辖权、目的、领域、访问方法和适用条款。最小化数据,记录目的,限制访问,并为活动获取法律建议。

问:我需要管理代理、页面防御或DOM变化吗?

Scrapeless处理底层采集表面。该应用程序管理输入、结构化输出、采样和决策记录。

问:管道可以在没有AI代理的情况下运行吗?

可以。直接的HTTP调用和普通的Python统计足以满足此处显示的工作流程。

在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。

最受欢迎的文章

目录