Scrapeless Weekly Changelog: Cập nhật từ 24–30 tháng 8, 2026
Senior Web Scraping Engineer
TL;DR:
- TikTok Scraper hiện đã có sẵn chính thức. Tài liệu công khai bây giờ bao gồm hồ sơ người sáng tạo, danh sách video của người sáng tạo và chi tiết sản phẩm TikTok Shop.
- Máy chủ Scrapeless MCP hiện bao gồm LLM Chat Scraper. Công cụ mới mang lại sự thu thập câu trả lời AI vào các quy trình làm việc kết nối với MCP.
- Chế độ AI của Google hiện chấp nhận một URL làm đầu vào. Một liên kết truy cập hoàn chỉnh vào chế độ AI có thể thay thế các tham số đầu vào dựa trên lời nhắc thông thường.
- Tìm kiếm và thu thập AI nhận được các bản cập nhật độ tin cậy. Google Search API có một bản phát hành mới, một số máy thu thập LLM có tỷ lệ thành công cao hơn và các phản hồi của Amazon Rufus bao gồm phân tích nguồn tham chiếu được cải thiện.
TikTok Scraper đã chuyển từ chế độ xem trước sang phát hành chính thức. Trong khoảng thời gian từ 24–30 tháng 8, Scrapeless cũng đã thêm LLM Chat Scraper vào Máy chủ MCP của mình và giới thiệu thu thập dựa trên URL cho Chế độ AI của Google. Bản phát hành bao gồm các cải tiến của Google Search API cho khối lượng công việc thương mại lớn hơn, tỷ lệ thành công tốt hơn của máy thu thập AI và dữ liệu nguồn phong phú hơn từ Amazon Rufus.
💥 TikTok Scraper Chính Thức Được Phát Hành
TikTok Scraper hiện có tài liệu API công khai cho ba nhiệm vụ thu thập:
| Năng lực | Diễn viên | Trường hợp sử dụng điển hình |
|---|---|---|
| Hồ sơ người sáng tạo | scraper.tiktok.user.detail |
Nghiên cứu hồ sơ người sáng tạo công khai |
| Danh sách video của người sáng tạo | scraper.tiktok.user.work |
Theo dõi nội dung đã xuất bản của một người sáng tạo |
| Chi tiết sản phẩm TikTok Shop | scraper.tiktok.shop.page |
Thu thập dữ liệu trang sản phẩm cho nghiên cứu thương mại |
Các nhóm hiện có thể sử dụng các tham chiếu yêu cầu và phản hồi đã công bố để xây dựng tích hợp. Các diễn viên riêng lẻ cho phép các nhà phát triển chọn nguồn dữ liệu mà quy trình của họ cần, bất kể đó là hồ sơ người sáng tạo, danh sách nội dung, hay trang sản phẩm.
Đối với các dự án dữ liệu người sáng tạo, hãy giữ việc thu thập giới hạn ở thông tin công khai và chỉ lưu trữ các trường cần thiết cho dự án. Việc có sẵn công khai không loại bỏ nhu cầu xem xét các điều khoản của nền tảng và các yêu cầu xử lý dữ liệu áp dụng.
💫 LLM Chat Scraper Tham Gia Máy chủ Scrapeless MCP
Máy chủ Scrapeless MCP hiện cung cấp llm_chat_scraper để tạo các nhiệm vụ thu thập câu trả lời AI. Tài liệu Scrapeless MCP Server tool reference liệt kê hỗ trợ cho ChatGPT, Gemini, Perplexity, Copilot, Google AI Mode, Google AI Overview, Grok, và Alexa.
Điều này mang lại cho các tác nhân kết nối MCP một công cụ trực tiếp để yêu cầu dữ liệu từ AI-engine cùng với các khả năng tìm kiếm, duyệt web và thu thập hiện có của máy chủ. Một quy trình nghiên cứu có thể sử dụng các câu trả lời đã thu thập để so sánh các công cụ hoặc giám sát khả năng hiển thị AI theo định kỳ.
Khách hàng MCP phát hiện các công cụ được đặt tên và các sơ đồ đầu vào của chúng thông qua MCP tool-discovery interface. Kiểm tra danh sách công cụ được máy chủ kết nối của bạn cung cấp trước khi thêm hành động mới vào quy trình. Bản tổng quan về Scrapeless MCP Server giải thích về việc tích hợp rộng hơn.
Bắt Đầu Thu Thập Với Scrapeless
Tăng cường quy trình thu thập web và tự động hóa của bạn với Scrapeless!
Đăng ký hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.Nhận tín dụng miễn phí của bạn ngay bây giờ trong Bảng Điều Khiển Scrapeless.
🌟 Chế Độ AI Của Google Hỗ Trợ Đầu Vào Dựa Trên URL
Máy Scraper Chế Độ AI của Google hiện chấp nhận một chuỗi url chứa một liên kết truy cập hoàn chỉnh vào Chế Độ AI của Google. Điều này thêm một tùy chọn đầu vào cho các quy trình làm việc đã có URL của Chế Độ AI.
Tài liệu tham chiếu đầu vào Chế độ AI của Google chỉ ra một quy tắc quan trọng: khi url được cung cấp, các tham số đầu vào khác không cần thiết và sẽ bị bỏ qua nếu được bao gồm. Đừng mong đợi một lời nhắc riêng biệt, tham số quốc gia, mua sắm, hoặc thiết lập vị trí để ghi đè lên URL đã cung cấp.
Gửi liên kết hoàn chỉnh thay vì xây dựng lại nó từ các phần đã chọn. Nếu ứng dụng của bạn phân tích hoặc lưu trữ liên kết, hãy bảo tồn các thành phần truy vấn và mã hóa của nó bằng cách sử dụng hành vi được xác định trong Tiêu chuẩn URL.
⬆️ Cải Thiện Dịch Vụ
Google Search API Cập Nhật Để Xử Lý Khối Lượng Lớn
Google Search API đã nhận được một bản phát hành mới tập trung vào sử dụng thương mại quy mô lớn, với sự ổn định và đầy đủ dữ liệu được cải thiện. Cập nhật này hỗ trợ các nhóm thực hiện thu thập dữ liệu tìm kiếm định kỳ cho giám sát, nghiên cứu và các ứng dụng sản xuất.
Tỷ Lệ Thành Công Cao Hơn Trên Các Trình Tìm Kiếm AI
Copilot, Perplexity, và Gemini đã nhận được cải thiện tỷ lệ thành công cho Áo (AT). Tổng quan AI của Google cũng đã nhận được một cải thiện về tỷ lệ thành công. Đây là các cập nhật dịch vụ chất lượng; kết quả vẫn phụ thuộc vào động cơ, yêu cầu, và bối cảnh thu thập.
Tham Chiếu Nguồn Amazon Rufus Được Phân Tích Đầy Đủ Hơn
Trình Tìm Kiếm Amazon Rufus hiện phân tích thêm các trường tham chiếu nguồn từ các phản hồi. Thông tin bổ sung này giúp các nhóm kiểm tra các tham chiếu liên quan đến câu trả lời của Rufus và mang bối cảnh đó vào phân tích sau. Xử lý dữ liệu nguồn khi nó có mặt thay vì giả định rằng mọi câu trả lời đều bao gồm các tham chiếu.
Kết Luận
Bản phát hành tuần này làm cho việc thu thập TikTok có sẵn thông qua các diễn viên đã được tài liệu hóa, thêm thu thập câu trả lời AI vào MCP, và cung cấp cho Google AI Mode một đường dẫn đầu vào dựa trên URL. Độ tin cậy tìm kiếm và phân tích nguồn Rufus cũng cải thiện dữ liệu có sẵn cho các quy trình làm việc hạ nguồn.
Chọn diễn viên liên quan từ Scrapeless Scraping API, và xem xét bảng giá Scrapeless khi lập kế hoạch cho khối lượng công việc của bạn.
Sẵn Sàng Xây Dựng Quy Trình Dữ Liệu Tiếp Theo Của Bạn?
Kết nối với các nhà phát triển xây dựng dữ liệu web công khai và quy trình trả lời AI trong cộng đồng Scrapeless: Discord · Telegram.
Đăng ký tại app.scrapeless.com để bắt đầu.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



