Phân tích Người Ảnh Hưởng TikTok: Đánh giá Danh sách Người Tạo Nội Dung
Web Data Collection Specialist
TL;DR:
- Danh sách người sáng tạo cần bằng chứng ở hai cấp độ. Kết hợp số liệu từ hồ sơ công khai với một mẫu giới hạn các bài đăng công khai của người sáng tạo.
- Sử dụng bảng điểm minh bạch. Ghi lại các đầu vào, các biến đổi, trọng số, và các quyết định con người thay vì sản xuất một bảng xếp hạng không giải thích.
- Ưu tiên phân bố hơn một bài viết lan truyền. Tương tác trung bình và tần suất đăng bài mô tả mẫu một cách công bằng hơn là một tối đa đơn lẻ.
- Không suy ra các đặc điểm khán giả không có sẵn. Các diễn viên đã được tài liệu hóa không trả lại thông tin về nhân khẩu học của người theo dõi, danh sách người theo dõi, hoặc nhãn hiệu người theo dõi giả.
- Phù hợp thương hiệu vẫn cần đánh giá của con người. Chủ đề nội dung, chất lượng công bố, bối cảnh an toàn, và sự phù hợp sáng tạo không thể chỉ giảm xuống các số liệu công khai.
- Miễn phí để bắt đầu. Các tài khoản Scrapeless mới bao gồm tín dụng miễn phí thông qua Bảng điều khiển Scrapeless.
Giới thiệu: biến danh sách các tài khoản thành một danh sách có thể xem xét
Việc chọn lựa người ảnh hưởng thường bắt đầu bằng một bảng tính chứa các tên người dùng. Số lượng người theo dõi làm cho danh sách đó có thể sắp xếp, nhưng nó không cho thấy liệu một tài khoản có đăng bài một cách nhất quán hay không, liệu nội dung gần đây có thu hút tương tác hay không, hoặc liệu nội dung có phù hợp với một yêu cầu cụ thể hay không.
Một phân tích người ảnh hưởng TikTok tốt hơn kết hợp hai diễn viên Scrapeless đã được tài liệu hóa. scraper.tiktok.user.detail giải quyết từng hồ sơ công khai và trả về số liệu tài khoản cùng với sec_uid. scraper.tiktok.user.work sử dụng sec_uid để trả về một tập hợp các bài đăng công khai và các trường tương tác hạn chế. Dòng công việc sau đó tính toán các đặc điểm mô tả và tạo ra một bảng điểm cho việc đánh giá của con người.
Đối với mẫu yêu cầu rộng hơn, hãy xem hướng dẫn về các diễn viên dữ liệu Scrapeless.
Dòng công việc tổng quan
| Giai đoạn | Đầu vào | Đầu ra |
|---|---|---|
| Giải quyết | Tên người sáng tạo | Hồ sơ và sec_uid |
| Mẫu | sec_uid, con trỏ, số lượng |
Các mục bài đăng công khai gần đây |
| Biến đổi | Hồ sơ và JSON bài đăng | Các đặc điểm mô tả so sánh được |
| Đánh giá | Các đặc điểm và liên kết nội dung | Ghi chú của con người và quyết định đủ điều kiện |
| Lưu trữ | Gói quyết định | Hồ sơ danh sách tạm thời có dấu thời gian |
Đầu ra là một công cụ hỗ trợ quyết định. Nó không chứng minh tính xác thực của khán giả, tác động doanh số, hoặc hiệu suất chiến dịch trong tương lai.
Định nghĩa Đánh giá Trước khi Thu thập Dữ liệu
Viết các quy tắc quyết định trước khi mở API. Một yêu cầu hữu ích nêu rõ:
- thị trường mục tiêu và loại chiến dịch
- yêu cầu về độ liên quan tối thiểu của nội dung
- kích thước mẫu bài đăng sử dụng cho mỗi người sáng tạo
- các vấn đề nội dung hoặc công bố không đủ điều kiện
- các số liệu công khai nào là mô tả hơn là quyết định
- ai thực hiện việc đánh giá cuối cùng
Sự công bố của người ảnh hưởng là một phần của việc đánh giá. Hướng dẫn công bố của FTC cho những người ảnh hưởng truyền thông xã hội giải thích rằng các mối liên kết vật chất nên rõ ràng với khán giả. Sử dụng các quy tắc địa phương áp dụng cho thị trường chiến dịch.
Điều kiện tiên quyết
- Một tài khoản Scrapeless và mã thông báo API từ Bảng điều khiển Scrapeless
- Một danh sách các tên người dùng TikTok công khai được phép
- Một bảng điểm đã viết và chính sách đánh giá thủ công
- Một khoảng thời gian lưu giữ cho hồ sơ, bài đăng, và quyết định
Mã cần một mã thông báo trực tiếp trong SCRAPELESS_API_KEY và một tệp phân tách dòng có tên creators.txt.
Giai đoạn 1 — Giải quyết Từng Hồ sơ Công khai
Gọi scraper.tiktok.user.detail với unique_id. Giữ account_id, tên người dùng, sec_uid, URL hồ sơ, số liệu công khai, cờ tài khoản, và dấu thời gian thu thập. Tài liệu về diễn viên chi tiết người dùng cung cấp danh sách các trường phản hồi được hỗ trợ.
Không nên lặng lẽ loại bỏ một người sáng tạo khi một trường tùy chọn bị bỏ trống. Lưu hồ sơ với một trạng thái thu thập rõ ràng để người đánh giá có thể phân biệt dữ liệu không hoàn chỉnh với một tài khoản bị từ chối.
Giai đoạn 2 — Thu thập Mẫu Bài đăng So sánh
Sử dụng scraper.tiktok.user.work với sec_uid đã trả về. Cung cấp cho mỗi người sáng tạo cùng một count được yêu cầu và cursor bắt đầu để so sánh ban đầu theo một quy tắc lấy mẫu. Diễn viên có thể trả về mô tả bài đăng, URL, dấu thời gian, số lượng tương tác công khai, các trường phương tiện, hashtag, ngôn ngữ, cờ bài đăng, nhạc, phụ đề, và quyền hạn.
Tài liệu về diễn viên công việc người dùng đưa ra cursor như một chuỗi và count như một số nguyên dương. Tiếp tục sau phản hồi đầu tiên chỉ khi phản hồi hiện tại và tài liệu tiết lộ một giá trị tiếp tục đã được xác minh.
Bắt đầu thu thập dữ liệu với Scrapeless
Nâng cao quy trình thu thập dữ liệu web và tự động hóa của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.
Claim tín dụng miễn phí của bạn ngay bây giờ trong Bảng điều khiển Scrapeless.
Giai đoạn 3 — Tính toán Các đặc điểm mô tả
Chương trình dưới đây giải quyết các hồ sơ, yêu cầu mẫu bài đăng được giới hạn giống nhau và tính toán trung vị. Nó giữ cho bảng điểm mô tả: không có nhân khẩu học không khả dụng và không có nhãn người theo dõi giả.
python
import json
import os
import statistics
from urllib.request import Request, urlopen
ENDPOINT = "https://api.scrapeless.com/api/v1/scraper/request"
TOKEN = os.environ["SCRAPELESS_API_KEY"]
def actor(name, actor_input):
request = Request(
ENDPOINT,
data=json.dumps({"actor": name, "input": actor_input}).encode(),
headers={"x-api-token": TOKEN, "content-type": "application/json"},
method="POST",
)
with urlopen(request, timeout=60) as response:
return json.load(response)
def median(items, field):
values = [item[field] for item in items if isinstance(item.get(field), (int, float))]
return statistics.median(values) if values else None
def evaluate(username):
profile = actor("scraper.tiktok.user.detail", {"unique_id": username.lstrip("@")})
posts = actor(
"scraper.tiktok.user.work",
{"sec_uid": profile["sec_uid"], "cursor": "0", "count": 20},
).get("items", [])
return {
"unique_id": profile.get("unique_id"),
"profile_url": profile.get("profile_url"),
"is_verified": profile.get("is_verified"),
"is_private": profile.get("is_private"),
"profile_statistics": profile.get("statistics") or {},
"sample_size": len(posts),
"median_play_count": median(posts, "play_count"),
"median_like_count": median(posts, "like_count"),
"median_comment_count": median(posts, "comment_count"),
"median_share_count": median(posts, "share_count"),
"content_links": [post.get("url") for post in posts if post.get("url")],
}
with open("creators.txt", encoding="utf-8") as source:
usernames = [line.strip() for line in source if line.strip()]
results = [evaluate(username) for username in usernames]
print(json.dumps(results, ensure_ascii=False, indent=2))
Tài liệu module thống kê của Python định nghĩa cách tính trung vị. Một trung vị làm giảm ảnh hưởng của một quan sát lớn bất thường, nhưng không loại bỏ thiên lệch mẫu hoặc thiết lập nguyên nhân.
Giai đoạn 4 — Thêm Xem xét của Con Người
Mỗi gói nhà sáng tạo nên hiển thị URL hồ sơ, thống kê tóm tắt công khai, kích thước mẫu, các đặc điểm bài đăng trung vị và các liên kết đến nội dung đã được lấy mẫu. Người đánh giá sau đó ghi lại:
- sự liên quan đến chủ đề chiến dịch
- chất lượng nội dung và sự phù hợp với sản xuất
- các thực hành tiết lộ về tài liệu tài trợ
- các mối quan tâm về an toàn hoặc sự phù hợp
- sự phù hợp về ngôn ngữ và thị trường dựa trên nội dung quan sát được
- một quyết định chấp nhận, giữ lại hoặc từ chối với lý do ngắn gọn
Không suy ra tuổi tác, dân tộc, thu nhập, trạng thái sức khỏe, hoặc thành phần khán giả từ tên người dùng, tiểu sử, hoặc số lượng tương tác. Diễn viên không cung cấp một bảng nhân khẩu học, và một ước lượng tự động sẽ gia tăng rủi ro mà không có bằng chứng tin cậy.
Giai đoạn 5 — Lưu trữ Gói Quyết định
Giữ cho các quan sát nguồn và quyết định tách biệt. Thống kê hồ sơ và chỉ số bài đăng có thể thay đổi; quyết định của con người thuộc về một mẫu và tóm tắt cụ thể. Một bản ghi hữu ích chứa ID tóm tắt, ID nhà sáng tạo, thời gian quan sát, ID bài đăng đã được lấy mẫu, các đặc điểm đã rút ra, người đánh giá, quyết định và lý do.
Khung Bảo mật NIST có thể giúp các nhóm xác định rủi ro về quyền riêng tư và thiết lập kiểm soát cho việc thu thập, truy cập, lưu trữ và xóa. Giới hạn dữ liệu lưu trữ theo những gì đánh giá chiến dịch cần.
Scrapeless cung cấp cả hai diễn viên thông qua API Thống kê. Xem bảng giá hiện tại khi kích thước danh sách rút gọn và mẫu bài đăng đã được biết.
Cách tránh xếp hạng gây hiểu lầm
- Không chia cho các giá trị không khả dụng. Nếu mẫu số thiếu hoặc bằng không, ghi lại chỉ số đã rút ra là không xác định.
- Không so sánh các mẫu không bằng nhau mà không có tiết lộ. Giữ kích thước mẫu được yêu cầu và trả lại với mỗi hàng.
- Không đặt ngưỡng tương tác toàn cầu. Danh mục, kích thước tài khoản, định dạng nội dung và khoảng thời gian mẫu ảnh hưởng đến phân phối quan sát được.
- Không gán nhãn tài khoản là gian lận từ các số liệu công khai. Các diễn viên trả lại các quan sát, không phải một phán quyết về tính xác thực.
- Không tự động hóa quyết định phù hợp cuối cùng. Một người đánh giá cần kiểm tra nội dung thực tế và tóm tắt chiến dịch.
Kết luận: làm cho danh sách rút gọn có thể giải thích
Phân tích người ảnh hưởng TikTok hoạt động tốt nhất như một quy trình đã tài liệu hóa: giải quyết các hồ sơ công khai, thu thập một mẫu bài đăng nhất quán, tính toán các đặc điểm mô tả đơn giản, và gửi chứng cứ đến một người đánh giá. Giữ bản chụp nguồn bên cạnh quyết định để một người đánh giá khác có thể hiểu cách mà danh sách rút gọn được sản xuất.
Sẵn sàng để Xây dựng Một Đường Dẫn Đánh Giá Nhà Sáng Tạo?
Tham gia Discord của Scrapeless hoặc cộng đồng Telegram để thảo luận về các mô hình dữ liệu. Tạo một tài khoản trong Bảng điều khiển Scrapeless khi chính sách danh sách rút gọn đã sẵn sàng.
Câu Hỏi Thường Gặp
Q: Dữ liệu nào hỗ trợ phân tích người ảnh hưởng TikTok?
Các diễn viên đã được tài liệu hóa cung cấp chi tiết hồ sơ công khai, thống kê tài khoản, và các trường bài đăng công khai như mô tả, URL, thời gian, và số lượng tương tác.
Q: API có thể xác định người theo dõi giả không?
Không. Nó không trả lại danh tính người theo dõi hoặc nhãn xác thực, vì vậy các số lượng công khai không nên được trình bày như bằng chứng về gian lận.
Q: Cách nào là hợp lý để so sánh bài đăng gần đây?
Sử dụng cùng một quy tắc lấy mẫu cho mỗi nhà sáng tạo, giữ kích thước mẫu, tóm tắt phân phối, và hiển thị các liên kết nội dung cơ bản cho người đánh giá.
Q: Các chỉ số công khai có thể xác định sự phù hợp của thương hiệu không?
Không. Các chỉ số công khai có thể tổ chức một đánh giá, trong khi sự liên quan của nội dung, tiết lộ, sự phù hợp, và sự sáng tạo yêu cầu phán đoán của con người.
Q: Việc thu thập dữ liệu nhà sáng tạo công khai có hợp pháp không?
Tính hợp pháp phụ thuộc vào khu vực pháp lý, mục đích, lĩnh vực, phương thức truy cập và các điều khoản áp dụng. Giảm thiểu dữ liệu, tài liệu hóa mục đích, hạn chế truy cập và nhận tư vấn pháp lý cho chiến dịch.
H: Tôi có cần quản lý proxy, phòng thủ trang hay thay đổi DOM không?
Scrapeless xử lý bề mặt thu thập cơ bản. Ứng dụng quản lý đầu vào, đầu ra có cấu trúc, lấy mẫu và hồ sơ quyết định.
H: Liệu pipeline có thể chạy mà không có đại lý AI không?
Có. Các cuộc gọi HTTP trực tiếp và thống kê Python thông thường là đủ cho quy trình công việc như đã trình bày ở đây.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



