Scrapeless Weekly Changelog: 7–13 tháng 9, 2026
Advanced Bot Mitigation Engineer
TL;DR:
- Tài liệu API Tìm kiếm của Google đã hoạt động. Các nhà phát triển hiện có một phần giới thiệu và tham khảo yêu cầu dành riêng cho dữ liệu Tìm kiếm của Google có cấu trúc.
- ChatGPT Scraper thêm điều khiển tìm kiếm web ở cấp yêu cầu. Tham số
web_searchcho phép mỗi nhiệm vụ chọn có sử dụng tìm kiếm web hay không. - Phản hồi từ ChatGPT hiện bao gồm
conversation_id. Trường dữ liệu mới giúp dễ dàng liên kết các kết quả lưu trữ với cuộc hội thoại nguồn của chúng. - ChatGPT Scraper thêm tùy chọn đầu ra HTML và SSE. Các nhóm có thể chọn đại diện phản hồi phù hợp với quy trình xử lý của họ.
- Các vấn đề về ngôn ngữ và điều phối nhiệm vụ đã được khắc phục. Cập nhật bao gồm dữ liệu phát tán Perplexity và các lỗi “kế hoạch không tìm thấy” tạm thời trên AI Scraper.
Bản phát hành từ ngày 7–13 tháng 9 cung cấp cho các nhà phát triển nhiều quyền kiểm soát hơn đối với việc thu thập câu trả lời từ AI và một lối đi rõ ràng hơn vào dữ liệu Tìm kiếm của Google. Tài liệu API Tìm kiếm của Google mới hiện đã có sẵn, và ChatGPT Scraper đã có thêm điều khiển tìm kiếm web, các định danh cuộc hội thoại và hai tùy chọn đầu ra bổ sung. Bản phát hành cũng sửa chữa các vấn đề về lựa chọn ngôn ngữ và điều phối nhiệm vụ trên AI Scraper.
🌟 Tài Liệu API Tìm Kiếm của Google Đã Hoạt Động
Tài liệu API Tìm kiếm của Google mới giới thiệu bề mặt API dành riêng cho việc trích xuất dữ liệu Tìm kiếm của Google có cấu trúc theo thời gian thực.
Tài liệu này bao gồm các điều khiển yêu cầu chung như truy vấn, quốc gia, ngôn ngữ, miền Google, loại kết quả, phân trang và số lượng kết quả. Nó cung cấp cho các nhóm một tham khảo duy nhất để thiết kế quy trình giám sát tìm kiếm, nghiên cứu và làm giàu dữ liệu mà không cần duy trì trình duyệt và ngăn phân tích của riêng họ.
API Tìm kiếm của Google vẫn có sẵn thông qua các sản phẩm dữ liệu tìm kiếm của Scrapeless. Các nhóm có kế hoạch tích hợp mới có thể xem trang sản phẩm API Tìm kiếm của Google cùng với tài liệu tham khảo vừa được công bố.
💫 ChatGPT Scraper Thêm Kiểm Soát Yêu Cầu và Đầu Ra Nhiều Hơn
Cập nhật ChatGPT Scraper tuần này bao gồm cách một nhiệm vụ sử dụng tìm kiếm web, cách cuộc hội thoại của nó được xác định, và cách dữ liệu phản hồi có thể được cung cấp.
Chọn Tìm Kiếm Web Theo Yêu Cầu
Diễn viên scraper.chatgpt hiện hỗ trợ đầu vào web_search tùy chỉnh. Đặt boolean cho mỗi yêu cầu để chọn liệu tìm kiếm web của ChatGPT có được kích hoạt cho nhiệm vụ đó hay không. Điều này hữu ích khi một tập dữ liệu kết hợp các lời nhắc chỉ mô hình với các lời nhắc cần thông tin web hiện tại và kết quả nguồn.
Tài liệu tham khảo ChatGPT Scraper ghi lại web_search như một boolean tùy chọn. Hành vi rộng hơn của các câu trả lời và trích dẫn kết nối web được mô tả trong hướng dẫn tìm kiếm web chính thức.
Xác Định Cuộc Hội Thoại Nguồn
Phản hồi từ ChatGPT Scraper hiện bao gồm conversation_id. Các nhóm dữ liệu có thể lưu trữ định danh cùng với câu trả lời, lời nhắc, trích dẫn và dấu thời gian thu thập để các bản ghi từ cùng một cuộc hội thoại nguồn dễ dàng được theo dõi và nhóm lại.
Trường này xác định cuộc hội thoại liên quan đến phản hồi. Ghi chú phát hành này không giả định rằng nó có thể được gửi lại để tiếp tục một cuộc hội thoại; các tích hợp nên tuân theo tài liệu yêu cầu hiện tại cho các đầu vào được hỗ trợ.
Chọn Đầu Ra HTML hoặc SSE
ChatGPT Scraper hiện có thể cung cấp định dạng đầu ra HTML và SSE. HTML hữu ích khi một ứng dụng cần đại diện phản hồi đã được xác thực. SSE phù hợp với các quy trình có tiêu thụ luồng sự kiện cơ bản hoặc bảo lưu nó để xử lý sau này.
HTML Living Standard xác định cú pháp tài liệu mà các ứng dụng có thể sử dụng khi xác thực hoặc chuyển đổi HTML được trả về. Những người tiêu thụ SSE nên phân tích luồng như dữ liệu sự kiện thay vì coi nó như một tài liệu HTML duy nhất. Đặc tả Sự kiện được gửi từ máy chủ định nghĩa mô hình luồng sự kiện và quy tắc phân tích được các khách hàng tiêu chuẩn sử dụng.
Để có cái nhìn tổng quát hơn về các câu trả lời và trích dẫn có cấu trúc của ChatGPT, hãy xem hướng dẫn thu thập ChatGPT.
Bắt Đầu Thu Thập Dữ Liệu Với Scrapeless
Tăng cường quy trình thu thập dữ liệu web và tự động hóa của bạn với Scrapeless!
Đăng ký hôm nay và nhận 5 đô la tín dụng miễn phí — không yêu cầu thẻ tín dụng.
Nhận tín dụng miễn phí của bạn ngay bây giờ tại Scrapeless Dashboard.
⬆️ Sửa lỗi độ tin cậy AI Scraper
Hai sửa lỗi cải thiện tính nhất quán trong các phản hồi của AI Scraper:
- Xử lý ngôn ngữ phân tán perplexity. Dữ liệu phân tán không còn trả về ngôn ngữ không chính xác trong các trường hợp bị ảnh hưởng.
- Lỗi định tuyến tác vụ ngẫu nhiên. Phản hồi “kế hoạch không tìm thấy” thỉnh thoảng ảnh hưởng đến các tác vụ AI Scraper đã được sửa.
Đây là các sửa lỗi ở phía dịch vụ. Các tích hợp hiện có không cần yêu cầu di chuyển lược đồ cho hành vi đã được sửa.
📍Kết luận
Bản phát hành này làm cho Google Search API dễ dàng hơn để áp dụng và mở rộng các cách mà các nhóm có thể thu thập và quản lý câu trả lời AI. ChatGPT Scraper hiện cung cấp điều khiển tìm kiếm web theo yêu cầu, mã định danh cuộc trò chuyện và đầu ra HTML hoặc SSE. Các sửa lỗi đi kèm cải thiện tính nhất quán ngôn ngữ và thực thi tác vụ trên toàn bộ AI Scraper.
AI Scraper là một phần của Universal Scraping API. Xem xét giá cả Scrapeless khi lập kế hoạch cho khối lượng công việc sản xuất.
👀 Sẵn sàng xây dựng quy trình làm việc tìm kiếm dữ liệu AI của bạn?
Tham gia các nhà phát triển xây dựng quy trình làm việc tìm kiếm dữ liệu và câu trả lời AI trong cộng đồng Scrapeless: Discord · Telegram.
Đăng ký tại app.scrapeless.com để bắt đầu.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



