TikTok影响者分析:评估创作者候选名单
Web Data Collection Specialist
TL;DR:
- 创作者短名单需要两个层次的证据。 结合公共个人资料统计数据与创作者公共帖子的有限样本。
- 使用透明的计分卡。 记录输入、转换、权重和人工决策,而不是生成无法解释的排名。
- 更倾向于分布而不是单一病毒帖子。 中位数互动和发布节奏更公平地描述样本,而不是单一的最大值。
- 请勿推断不可用的观众特征。 有文档的参与者不提供关注者人口统计、关注者列表或虚假关注者标签。
- 品牌适配仍需人工审查。 内容主题、披露质量、安全背景和创意适配不能仅仅归结为公共计数。
- 免费开始。 新的 Scrapeless 账户通过 Scrapeless Dashboard 包括免费信用。
引言:将一系列用户名转化为可审核的短名单
网红选择通常始于一个用户名的电子表格。关注者数量使得该列表可以排序,但它并不能显示一个账户是否持续发帖、最近的内容是否吸引互动,或者内容是否适合特定的简报。
更好的 TikTok 网红分析结合了两个有记录的 Scrapeless 参与者。 scraper.tiktok.user.detail 解析每个公共个人资料,并返回账户统计数据和 sec_uid。 scraper.tiktok.user.work 使用该 sec_uid 返回有限的一组公共帖子和互动字段。然后,管道计算描述性特征并为人工审核生成计分卡。
关于更广泛的请求模式,请参见 Scrapeless 数据参与者指南。
管道一览
| 阶段 | 输入 | 输出 |
|---|---|---|
| 解析 | 创作者用户名 | 个人资料记录和 sec_uid |
| 样本 | sec_uid, 游标, 计数 |
最近公共帖子项目 |
| 转换 | 个人资料和帖子 JSON | 可比较的描述性特征 |
| 审核 | 特征和内容链接 | 人工备注和资格决定 |
| 存储 | 决定包 | 带时间戳的短名单记录 |
输出是一个决策辅助工具。它并不证明观众的真实性、销售影响或未来活动的表现。
在收集数据之前定义评估
在打开 API 之前写下决策规则。一个有用的简报如下所示:
- 目标市场和活动类别
- 最低内容相关性要求
- 每位创作者使用的帖子样本大小
- 取消资格的内容或披露问题
- 哪些公共指标是描述性的而非决定性的
- 谁进行最终审查
网红披露是审核的一部分。 FTC 对社交媒体网红的披露指导 解释了物质联系应向观众清晰可见。 使用适用于活动市场的当地规则。
先决条件
- 一个 Scrapeless 账户和来自 Scrapeless Dashboard 的 API 令牌
- 被允许的公共 TikTok 用户名列表
- 一份书面的计分卡和人工审核政策
- 个人资料、帖子和决策记录的保留期限
该代码在 SCRAPELESS_API_KEY 中需要一个实时令牌和一个名为 creators.txt 的以换行符分隔的文件。
阶段 1 — 解析每个公共个人资料
使用 scraper.tiktok.user.detail 调用 unique_id。 保留 account_id、用户名、sec_uid、个人资料 URL、公共统计数据、账户标志和采集时间戳。 用户详细信息参与者文档 列出了支持的响应字段。
当可选字段为空时,请勿默默丢弃创作者。 以明确的收集状态存储个人资料,以便审核者可以区分不完整数据与被拒绝账户。
阶段 2 — 收集可比较的帖子样本
使用 scraper.tiktok.user.work 结合返回的 sec_uid。 为每位创作者提供相同的请求 count 和起始 cursor,以便初始比较遵循一个采样规则。 该参与者可以返回帖子描述、URL、时间戳、公共互动计数、媒体字段、标签、语言、帖子标志、音乐、字幕和权限。
用户工作参与者文档 将 cursor 记录为字符串,count 记录为正整数。 仅当当前响应和文档揭示经过验证的续值时,才需继续超出第一次响应。
使用Scrapeless开始抓取数据
通过Scrapeless提升您的网络抓取和自动化工作流程!
立即注册并获得5美元的免费信用 — 无需信用卡。
现在在Scrapeless仪表盘领取您的免费信用。
阶段3 — 计算描述性特征
下面的程序解决了个人资料问题,请求相同的有界帖子样本,并计算中位数。它保持分数卡的描述性:没有不可用的人口统计信息,也没有虚假关注者标签。
python
import json
import os
import statistics
from urllib.request import Request, urlopen
ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
TOKEN = os.environ["SCRAPELESS_API_KEY"]
def actor(name, actor_input):
request = Request(
ENDPOINT,
data=json.dumps({"actor": name, "input": actor_input}).encode(),
headers={"x-api-token": TOKEN, "content-type": "application/json"},
method="POST",
)
with urlopen(request, timeout=60) as response:
return json.load(response)
def median(items, field):
values = [item[field] for item in items if isinstance(item.get(field), (int, float))]
return statistics.median(values) if values else None
def evaluate(username):
profile = actor("scraper.tiktok.user.detail", {"unique_id": username.lstrip("@")})
posts = actor(
"scraper.tiktok.user.work",
{"sec_uid": profile["sec_uid"], "cursor": "0", "count": 20},
).get("items", [])
return {
"unique_id": profile.get("unique_id"),
"profile_url": profile.get("profile_url"),
"is_verified": profile.get("is_verified"),
"is_private": profile.get("is_private"),
"profile_statistics": profile.get("statistics") or {},
"sample_size": len(posts),
"median_play_count": median(posts, "play_count"),
"median_like_count": median(posts, "like_count"),
"median_comment_count": median(posts, "comment_count"),
"median_share_count": median(posts, "share_count"),
"content_links": [post.get("url") for post in posts if post.get("url")],
}
with open("creators.txt", encoding="utf-8") as source:
usernames = [line.strip() for line in source if line.strip()]
results = [evaluate(username) for username in usernames]
print(json.dumps(results, ensure_ascii=False, indent=2))
Python的 统计模块文档 定义了中位数的计算。中位数减少一个异常值的影响,但并不能消除抽样偏差或建立因果关系。
阶段4 — 添加人工审核
每个创作者包应显示个人资料URL、公共摘要统计信息、样本大小、中位数帖子特征及采样内容的链接。然后审核者记录:
- 与活动主题的相关性
- 内容质量和制作适配性
- 关于赞助材料的披露实践
- 安全或适宜性问题
- 基于可观察内容的语言和市场适配性
- 接受、保留或拒绝的决定及简短理由
不要根据用户名、个人简介或参与计数推测年龄、种族、收入、健康状况或受众组成。行为者不提供人口统计面板,自动猜测会增加风险而没有可靠证据。
阶段5 — 存储决策包
保持源观察和决策分开。个人资料统计和帖子指标可能会改变;人类决策属于特定样本和简要信息。一个有用的记录包含简要ID、创作者ID、观察时间、采样帖子ID、派生特征、审核者、决策和理由。
NIST隐私框架 可以帮助团队识别隐私风险并设置收集、访问、保留和删除的控制措施。将存储的数据限制在活动评估所需的内容。
Scrapeless通过抓取API提供了两个行为者。当短名单大小和帖子样本已知时,请查看当前定价。
如何避免误导性排名
- 不要对不可用值进行除法。 如果分母缺失或为零,请将派生指标记录为未知。
- 不要在没有披露的情况下比较不平等样本。 保持每一行的请求和返回样本大小。
- 不要设置普遍的参与阈值。 类别、账户规模、内容格式和样本窗口会影响观察到的分布。
- 不要根据公共计数标记账户为欺诈。 行为者返回观察,而不是真实性的裁决。
- 不要自动化最终适配决策。 审核者需要检查实际内容和活动简要。
结论:使短名单具有可解释性
TikTok影响者分析最好作为一个文档化的管道:解决公共个人档案,收集一致的帖子样本,计算简单的描述性特征,并将证据发送给人工审核者。将源快照与决策保持在一起,以便其他审核者理解短名单是如何产生的。
准备建立创作者审核管道吗?
加入Scrapeless Discord或Telegram社区讨论数据模型。当短名单政策准备好时,在Scrapeless仪表盘创建账户。
常见问题解答
问:什么数据支持TikTok影响者分析?
记录的行为者提供公共个人资料详细信息、账户统计数据和公共帖子字段,如描述、URL、时间戳和参与计数。
问:API能识别虚假关注者吗?
不能。它不返回关注者身份或真实性标签,因此公共计数不应作为欺诈的证据。
问:比较最近帖子有什么公正的方法?
对每个创作者使用相同的抽样规则,保持样本大小,总结分布,并向审核者展示基础内容链接。
问:公共指标能确定品牌适配性吗?
不能。公共指标可以组织审核,而内容相关性、披露、适宜性和创意适配性需要人工判断。
问:收集公共创作者数据合法吗?
合法性取决于管辖权、目的、领域、访问方法和适用条款。最小化数据,记录目的,限制访问,并为活动获取法律建议。
问:我需要管理代理、页面防御或DOM变化吗?
Scrapeless处理底层采集表面。该应用程序管理输入、结构化输出、采样和决策记录。
问:管道可以在没有AI代理的情况下运行吗?
可以。直接的HTTP调用和普通的Python统计足以满足此处显示的工作流程。
在Scrapeless,我们仅访问公开可用的数据,并严格遵循适用的法律、法规和网站隐私政策。本博客中的内容仅供演示之用,不涉及任何非法或侵权活动。我们对使用本博客或第三方链接中的信息不做任何保证,并免除所有责任。在进行任何抓取活动之前,请咨询您的法律顾问,并审查目标网站的服务条款或获取必要的许可。



