🎯 Trình duyệt đám mây tùy chỉnh, chống phát hiện được hỗ trợ bởi Chromium tự phát triển, thiết kế dành cho trình thu thập dữ liệu webtác nhân AI. 👉Dùng thử ngay
Quay lại blog

Nhật ký thay đổi hàng tuần không bị thiếu: Cập nhật từ 13 đến 19 tháng 7 năm 2026

Isabella Garcia
Isabella Garcia

Web Data Collection Specialist

20-Jul-2026

Tóm tắt:

  • Kho lưu trữ Amazon Scraper chính thức hiện đã công khai dưới tổ chức GitHub Scrapeless.
  • Kho lưu trữ Google Search Scraper chính thức hiện đã công khai với các ví dụ cho kết quả web, hình ảnh, địa phương, video, mua sắm và tin tức.
  • Xử lý phản hồi Gemini đã được tinh chỉnh để giảm thiểu việc cắt ngắn nội dung.
  • Xử lý dữ liệu mua sắm của Google AI Mode đã được cải thiện để tạo ra đầu ra có cấu trúc đầy đủ hơn.

Dưới đây là những gì đã được ra mắt tại Scrapeless trong tuần từ ngày 13–19 tháng 7 năm 2026: hai kho lưu trữ scrapper công khai mới và cải tiến đầu ra nhắm đến cho Gemini và Google AI Mode.

🌟 Cập nhật quan trọng

Kho lưu trữ Amazon Scraper hiện đã công khai

Scrapeless đã thêm một kho lưu trữ Amazon Scraper dành riêng vào tổ chức GitHub chính thức. Kho lưu trữ này cung cấp cho các nhà phát triển một vị trí công khai duy nhất cho dự án scraper Amazon và các tài liệu hỗ trợ của nó.

Kho lưu trữ Google Search Scraper mới cung cấp một điểm vào thực tế để thu thập dữ liệu tìm kiếm Google có cấu trúc thông qua API Scraping của Scrapeless.

Kho lưu trữ bao gồm sáu bề mặt tìm kiếm:

  • Kết quả web
  • Hình ảnh Google
  • Địa phương Google
  • Video Google
  • Mua sắm Google
  • Tin tức Google

Nó cũng bao gồm các ví dụ yêu cầu bằng Python, Node.js, Go, Java và PHP, giúp dễ dàng kết nối scraper với một ngăn xếp ứng dụng hiện có.

Các nhà phát triển có thể kiểm soát ngôn ngữ tìm kiếm, quốc gia, vị trí, phân trang và các bộ lọc cụ thể theo chiều dọc thông qua đầu vào yêu cầu. Kết quả là dữ liệu tìm kiếm có cấu trúc có thể phục vụ cho việc theo dõi SEO, nghiên cứu thị trường, thu thập thông tin địa phương và các quy trình dữ liệu tự động.

⬆️ Cải tiến dịch vụ

Cải thiện xử lý độ dài phản hồi Gemini

Chúng tôi đã tinh chỉnh cách xử lý nội dung Gemini để giảm thiểu các trường hợp mà văn bản phản hồi có thể bị cắt ngắn. Các quy trình thu thập câu trả lời dài hơn giờ đây nên nhận được nội dung đầy đủ hơn cho phân tích, so sánh và lưu trữ tiếp theo.

Cải thiện dữ liệu mua sắm từ Google AI Mode

Chúng tôi đã cải thiện việc xử lý dữ liệu mua sắm được trả về bởi Google AI Mode. Cập nhật lần này tập trung vào việc thu thập và cấu trúc thông tin liên quan đến thương mại một cách nhất quán hơn khi nó xuất hiện trong các phản hồi của AI Mode.

Điều này rất hữu ích cho các nhóm làm việc về phát hiện sản phẩm, theo dõi thương hiệu, nghiên cứu bán lẻ và khả năng hiển thị tìm kiếm AI.

👀 Điều này có ý nghĩa gì cho các nhà phát triển

Các cập nhật của tuần này giúp hai bề mặt dữ liệu phổ biến dễ dàng hơn để phát hiện và tích hợp từ GitHub, đồng thời cải thiện độ hoàn chỉnh của dữ liệu phản hồi do AI tạo ra.

Các kho lưu trữ công khai cung cấp các điểm khởi đầu có thể tái sử dụng cho các dự án Amazon và Google Search. Cải tiến của Gemini và Google AI Mode giảm bớt công việc làm sạch trong các quy trình phụ thuộc vào văn bản câu trả lời đầy đủ và dữ liệu mua sắm.

Khám phá API Scraping của Scrapeless, xem xét giá cả, hoặc đọc bản cập nhật trước Weekly Changelog.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục