🎯 Trình duyệt đám mây tùy chỉnh, chống phát hiện được hỗ trợ bởi Chromium tự phát triển, thiết kế dành cho trình thu thập dữ liệu webtác nhân AI. 👉Dùng thử ngay
Quay lại blog

Hướng dẫn API Alexa Scraper: Trích xuất câu trả lời, trích dẫn và sản phẩm

Ava Wilson
Ava Wilson

Expert in Web Scraping Technologies

14-Jul-2026

Tóm tắt:

  • Alexa Scraper chuyển một yêu cầu thành dữ liệu câu trả lời có cấu trúc. Diễn viên scraper.alexa trả về các câu trả lời định dạng Markdown và văn bản thuần cùng với tham khảo, nguồn, gợi ý và bản ghi sản phẩm có điều kiện.
  • Yêu cầu có hai đầu vào diễn viên bắt buộc. Gửi một prompt bằng ngôn ngữ tự nhiên và mã country đến diễn viên Alexa.
  • Điểm cuối được tài liệu hiện tại là /api/v2/scraper/request. Xác thực với tiêu đề x-api-token và gửi JSON qua HTTP POST.
  • Các trường sản phẩm có thể là null theo thiết kế. Mảng products có thể trống khi câu trả lời của Alexa không có ngữ cảnh sản phẩm.
  • Các tham khảo và nguồn nên luôn gắn liền với câu trả lời. Giữ các bản ghi con này với kết quả giúp bảo tồn bằng chứng cho phân tích thương hiệu, GEO và sản phẩm hạ nguồn.
  • Miễn phí để bắt đầu. Tài khoản Scrapeless mới bao gồm quyền truy cập vào kế hoạch miễn phí tại app.scrapeless.com.

Giới thiệu: Câu trả lời Alexa cần một giao diện dữ liệu ổn định

Một câu trả lời Alexa chứa nhiều hơn một câu. Nó có thể mang định dạng Markdown, văn bản thuần, các tham khảo, liên kết nguồn, câu hỏi tiếp theo được gợi ý, các định danh trò chuyện, chỉ thị xử lý và các bản ghi sản phẩm. Việc sao chép câu trả lời hiển thị làm mất nhiều cấu trúc đó.

Scrapeless Alexa Scraper hiển thị phản hồi thông qua diễn viên scraper.alexa. Một khách hàng gửi một yêu cầu và quốc gia, và diễn viên trả về các trường có thể được lưu trữ mà không cần phân tích giao diện trợ lý giọng nói. Điều này làm cho hình dạng yêu cầu tương tự có thể hữu ích cho việc giám sát GEO, xem xét chất lượng câu trả lời, phân tích nguồn và công việc hiển thị sản phẩm.

Hướng dẫn này sử dụng tài liệu hiện tại của Alexa Scraper. Nó bao gồm điểm cuối, xác thực, tham số yêu cầu, các trường phản hồi, một yêu cầu cURL, một khách hàng Python và một mẫu lưu trữ cho đầu ra có cấu trúc.


Những gì bạn có thể làm với Alexa Scraper

Alexa Scraper hỗ trợ các quy trình làm việc cần câu trả lời và bằng chứng xung quanh trong một bản ghi.

  • Chụp văn bản câu trả lời. Lưu trữ md_text cho nội dung đã được định dạng và raw_text cho xử lý văn bản thuần.
  • Kiểm tra tài liệu tham khảo. Đọc ID tham khảo, tiêu đề và URL từ references.
  • Bản đồ liên kết nguồn. Lưu trữ văn bản hiển thị nguồn, URL, loại và URI đoạn từ sources.
  • Khám phá gợi ý câu hỏi tiếp theo. Thu thập các giá trị văn bản và tin nhắn mà Alexa trình bày trong suggestions.
  • Theo dõi ngữ cảnh phản hồi. Bảo tồn trạng thái hoàn thành, sửa đổi câu trả lời, ID yêu cầu hội thoại, ID điểm cuối, số lượng đoạn và ID hội thoại.
  • Phân tích hiển thị sản phẩm. Đọc các định danh sản phẩm, liên kết tài liệu, tiêu đề, hình ảnh, URL, giá cả, văn bản giao hàng, chi tiết và mục đích khi dữ liệu sản phẩm áp dụng.

Diễn viên trả về dữ liệu chụp. Các chỉ số như tỷ lệ đề cập, nồng độ nguồn, độ nhất quán của câu trả lời và tỷ lệ xuất hiện sản phẩm là các phép toán hạ nguồn được xác định bởi nhóm sử dụng dữ liệu.


Tại sao chọn Scrapeless Alexa Scraper

Scrapeless Alexa Scraper cung cấp một giao diện diễn viên được tài liệu hóa để chụp các phản hồi của Alexa trên nhiều thị trường.

Giá trị thực hiện đến từ hình dạng phản hồi:

  • Văn bản câu trả lời đến dưới định dạng Markdown và văn bản thuần.
  • Các tài liệu tham khảo và liên kết nguồn là các mảng riêng biệt thay vì được nhúng chỉ trong văn bản.
  • Các gợi ý lại được trả về dưới dạng các bản ghi có cấu trúc.
  • Thông tin sản phẩm có sẵn dưới dạng một mảng có điều kiện.
  • Quốc gia là một đầu vào yêu cầu rõ ràng cho việc chụp dữ liệu theo thị trường cụ thể.
  • Các định danh cuộc trò chuyện và câu trả lời có thể được giữ lại để theo dõi.

Scrapeless LLM Chat Scraper là một phần của dòng API Scraping Universal. Trang sản phẩm Universal Scraping API là trang chính của sản phẩm, và các chi tiết về kế hoạch hiện tại được liệt kê trên trang giá.


Điều kiện tiên quyết

Bạn cần:

  • Một tài khoản Scrapeless và API key từ app.scrapeless.com
  • cURL cho ví dụ shell
  • Python và gói requests cho ví dụ Python
  • Một mã quốc gia được hỗ trợ cho thị trường mà bạn muốn chụp

Đầu vào country sử dụng một mã quốc gia ngắn. Tiêu chuẩn ISO 3166 mã quốc gia giải thích định dạng alpha-2 phổ biến; sử dụng danh sách các quốc gia được Scrapeless hỗ trợ để xác nhận tính khả dụng của sản phẩm cho một mã cụ thể.

Lưu ý: Các yêu cầu được xác thực bên dưới cần một khóa API Scrapeless thực và webhook có thể truy cập. Nếu không có những thông tin xác thực đó, các khối có thể được kiểm tra cú pháp nhưng không thể tạo ra kết quả Alexa trực tiếp.


Cách hoạt động của API Alexa Scraper

Yêu cầu Alexa Scraper là một HTTP POST, chỉ định diễn viên, cung cấp câu lệnh và quốc gia, và cung cấp địa chỉ webhook.

Điểm cuối được tài liệu hóa hiện tại là:

https://api.scrapeless.com/api/v2/scraper/request

HTTP xác định các phương thức yêu cầu và các trường tiêu đề thông qua tiêu chuẩn ngữ nghĩa HTTP. Trong yêu cầu này, Content-Type: application/json mô tả định dạng nội dung và x-api-token chứa khóa API Scrapeless.

Giữ khóa API đó trong kho bí mật hoặc biến môi trường được bảo vệ thay vì mã nguồn. Hướng dẫn quản lý bí mật của OWASP phác thảo các kiểm soát thực tế cho việc lưu trữ, xoay vòng và truy cập.

Tham số yêu cầu

Tham số Loại Bắt buộc Mô tả
actor chuỗi Sử dụng scraper.alexa
input.prompt chuỗi Câu lệnh bằng ngôn ngữ tự nhiên gửi đến Alexa
input.country chuỗi Mã quốc gia hoặc khu vực
webhook.url chuỗi Không URL callback cho quy trình yêu cầu

Giữ câu lệnh và quốc gia trong cùng một bản ghi cơ sở dữ liệu với câu trả lời được trả về. Hai đầu vào đó xác định quan sát và làm cho các so sánh sau này có thể tái sản xuất.

Ghi nhanh với cURL

Đặt SCRAPELESS_API_KEYSCRAPELESS_WEBHOOK_URL trong shell trước khi thực hiện yêu cầu.

Lưu ý: Khối này là yêu cầu có kiểm soát thông tin xác thực. Nó cần một khóa API Scrapeless thực và một URL webhook công khai.

bash Copy
curl 'https://api.scrapeless.com/api/v2/scraper/request' \
  --header 'Content-Type: application/json' \
  --header "x-api-token: ${SCRAPELESS_API_KEY}" \
  --data-binary @- <<JSON
{
  "actor": "scraper.alexa",
  "input": {
    "prompt": "Những điểm thu hút khuyên nên ở New York",
    "country": "US"
  },
  "webhook": {
    "url": "${SCRAPELESS_WEBHOOK_URL}"
  }
}
JSON

Nội dung là JSON, ngữ pháp tương thích của nó được định nghĩa bởi RFC 8259. Giữ các giá trị chuỗi được bao bởi dấu ngoặc kép và tránh bình luận bên trong nội dung đã gửi.

Các trường phản hồi

Kết quả của diễn viên nhóm các trường thành nội dung câu trả lời, định danh, chỉ thị, tham chiếu, nguồn, gợi ý và sản phẩm.

Nhóm Các trường
Câu trả lời user_text, md_text, raw_text, completed
Định danh câu trả lời answer_fragment_uri, answer_revision, dialog_request_id, endpoint_id, fragment_count
Cuộc trò chuyện conversation.id
Chỉ thị name, namespace, message_id, dialog_request_id, fragment_count
Tham chiếu id, title, url
Nguồn text, url, type, fragment_uri
Gợi ý text, message, type, fragment_uri
Sản phẩm product_id, citation_id, title, image_url, url, price, delivery, details, fragment_uri, purpose

JSON sau là một hình dạng minh họa được xây dựng từ danh sách trường tài liệu. Các giá trị là ví dụ, không phải là một lần chạy diễn viên đã ghi lại.

json Copy
{
  "user_text": "Máy pha cà phê nào phù hợp với một căn bếp nhỏ?",
  "md_text": "Một máy pha cà phê nhỏ gọn nên cân bằng giữa diện tích và công suất.",
  "raw_text": "Một máy pha cà phê nhỏ gọn nên cân bằng giữa diện tích và công suất.",
  "completed": true,
  "answer_revision": 1,
  "conversation": {
    "id": "identification-example"
  },
  "references": [
    {
      "id": "cite_example",
      "title": "Hướng dẫn mua sắm minh họa",
      "url": "https://example.com/huong-dan-mua-sam-minh-hoa"
    }
  ],
  "sources": [
    {
      "text": "Nguồn minh họa",
      "url": "https://example.com/huong-dan-mua-sam-minh-hoa",
      "type": "OpenURL",
      "fragment_uri": "mor-hinh-minh-hoa"
    }
  ],
  "suggestions": [
    {
      "text": "So sánh các mẫu nhỏ gọn",
      "message": "So sánh các máy pha cà phê nhỏ gọn",
      "type": "TextMessage",
      "fragment_uri": "mor-gay-gan-minh-hoa"
    }
  ],
  "products": []
}

Mảng sản phẩm trống là có chủ ý. Thông tin sản phẩm là điều kiện, vì vậy các bộ phân tích phải chấp nhận một danh sách trống.

Nhận khóa API của bạn trên gói miễn phí: app.scrapeless.com


Tích hợp Alexa Scraper trong Python

Một client Python có thể gửi yêu cầu đã được tài liệu hóa và in phản hồi quy trình yêu cầu. Kết quả diễn viên cuối cùng của Alexa được gửi qua quy trình đã được cấu hình và nên được chuyển cho hàm chuẩn hóa được hiển thị sau yêu cầu.
Cài đặt phụ thuộc bên thứ ba duy nhất. Bước thiết lập này yêu cầu truy cập vào chỉ mục gói Python.

bash Copy
python -m pip install requests

Lưu ý: Khối yêu cầu dưới đây là một ví dụ yêu cầu thông tin xác thực. Nó yêu cầu các biến môi trường SCRAPELESS_API_KEYSCRAPELESS_WEBHOOK_URL.

python Copy
import os
import requests

API_URL = "https://api.scrapeless.com/api/v2/scraper/request"

api_key = os.environ["SCRAPELESS_API_KEY"]
webhook_url = os.environ["SCRAPELESS_WEBHOOK_URL"]

payload = {
    "actor": "scraper.alexa",
    "input": {
        "prompt": "Những điểm tham quan được đề xuất ở New York",
        "country": "US",
    },
    "webhook": {
        "url": webhook_url,
    },
}

response = requests.post(
    API_URL,
    headers={
        "Content-Type": "application/json",
        "x-api-token": api_key,
    },
    json=payload,
    timeout=60,
)
response.raise_for_status()
print(response.json())

Giữ chìa khóa API trong biến môi trường. Không đặt nó vào trong hệ thống kiểm soát nguồn, sổ tay, ảnh chụp màn hình, hoặc tải trọng webhook bị chặn.


Chuẩn hóa Đầu Ra của Alexa cho Lưu Trữ

Một bản ghi Alexa chuẩn hóa giữ câu trả lời ở cấp cha và lưu trữ các mảng lặp lại dưới dạng bản ghi con.

Sử dụng bảng captures cha với:

  • ID ghi nhận nội bộ
  • Prompt đã gửi
  • Quốc gia đã gửi
  • user_text, md_text, và raw_text
  • completedanswer_revision
  • Các định danh cuộc trò chuyện và đối thoại
  • Dấu thời gian ghi nhận được tạo bởi hệ thống của bạn

Lưu trữ references, sources, suggestions, directives, và products trong các bảng riêng biệt có khóa ID ghi nhận. Điều này tránh việc sao chép câu trả lời đầy đủ cho mỗi nguồn hoặc sản phẩm.

Mối quan hệ nguồn nên được giữ rõ ràng và có thể truy vấn. Diễn viên đã công khai những mối quan hệ đó thông qua ID trích dẫn, URL nguồn, và URI đoạn. Bảo tồn chúng thay vì làm phẳng chúng vào một trường văn bản không có cấu trúc.

Đối với các hàng sản phẩm, giữ citation_id ngay cả khi nó bằng null. Khi có mặt, nó có thể liên kết sản phẩm với một tài liệu tham khảo đã ghi nhận. Khi không có, giá trị null chính xác ghi nhận rằng không có liên kết trích dẫn trực tiếp nào được trả về trong trường đó.


Cách Tránh Các Vấn Đề Tích Hợp Thường Gặp

Các tích hợp Alexa Scraper vẫn dễ đoán khi các trường có thể null, phạm vi quốc gia, và bằng chứng phản hồi được xử lý một cách rõ ràng.

Xử Lý Các Mảng Điều Kiện Như Các Bộ Sưu Tập Trống

Mảng products có thể trống khi thông tin sản phẩm không áp dụng. Mẫu phòng thủ tương tự cũng hữu ích cho references, sources, suggestions, và directives: đọc một mảng thiếu hoặc null như một bộ sưu tập trống trong lớp chuyển đổi, trong khi giữ nguyên tải trọng gốc để kiểm tra.

Giữ Markdown và Văn Bản Thuần

md_textraw_text hỗ trợ các tác vụ khác nhau. Markdown hữu ích cho việc hiển thị và bảo tồn cấu trúc có thể nhìn thấy. Văn bản thuần thì dễ hơn để phân tích, so sánh, và tìm kiếm. Lưu trữ cả hai ngăn ngừa việc một ống dẫn sau đó phải khôi phục một định dạng từ định dạng khác.

Ghi Quốc Gia Trong Mỗi Bản Ghi

Không dựa vào một thị trường mặc định trong lưu trữ giảm vào. Lưu lại quốc gia đã gửi chính xác bên cạnh prompt và kết quả. Các so sánh thị trường thất bại khi các bản ghi không thể gắn kết lại với ngữ cảnh yêu cầu.

Bảo Tồn ID Trích Dẫn Trước Khi Nhóm Theo Miền

Báo cáo theo miền là hữu ích, nhưng nó nên được lấy từ các bản ghi tham khảo và nguồn gốc ban đầu. Giữ ID trích dẫn, tiêu đề, URL đầy đủ, loại nguồn, và URI đoạn trước khi thêm các trường miền đã chuẩn hóa.

Tách Đầu Ra Diễn Viên Ra Khỏi Điểm Số Được Tính Toán

Diễn viên trả về các trường câu trả lời và ngữ cảnh. Tỷ lệ đề cập, tỷ lệ trích dẫn, sự đa dạng nguồn, độ chính xác yêu cầu, và sự xuất hiện của sản phẩm là các phân tích tạo ra sau khi ghi nhận. Lưu trữ điểm số tính toán trong một bảng hoặc không gian tên riêng để người xem có thể phân biệt đầu ra API từ cách giải thích của nhóm.


Đọc Thêm Về Dữ Liệu Engine Câu Trả Lời

Alexa Scraper bao phủ một bề mặt câu trả lời LLM. Hướng dẫn Google AI Overview Scraper API cho thấy một mẫu diễn viên liên quan cho một trải nghiệm câu trả lời định hướng tìm kiếm với mô hình trường riêng của nó.

Sử dụng một hợp đồng lưu trữ chung giữa các diễn viên chỉ cho các trường thực sự đồng điệu: prompt đã gửi, quốc gia, văn bản câu trả lời, URL nguồn, ID ghi nhận, và thời gian ghi nhận. Giữ các trường cụ thể của diễn viên trong các bảng riêng của chúng để các đoạn sản phẩm, tin nhắn gợi ý, và các định danh nền tảng không biến mất vào một sơ đồ tối thiểu phổ biến.


Kết Luận: Bảo Tồn Câu Trả Lời và Bằng Chứng Của Nó

Tích hợp Alexa Scraper có một bề mặt yêu cầu nhỏ: diễn viên, prompt, quốc gia, tiêu đề xác thực, và quy trình webhook. Mô hình phản hồi rộng hơn vì nó bảo tồn câu trả lời, các tham chiếu, nguồn gốc, gợi ý, chỉ thị, ngữ cảnh cuộc trò chuyện, và các sản phẩm điều kiện.
Bắt đầu bằng cách lưu trữ payload thô và một bản chụp cha đã chuẩn hóa. Thêm các bảng con cho các bản ghi lặp lại, giữ lại các trường sản phẩm có thể null và giữ phân tích được derived tách biệt với đầu ra của tác nhân. Cấu trúc đó hỗ trợ các trường hợp sử dụng thương hiệu, GEO, sản phẩm và thị trường trong tương lai mà không cần viết lại lớp thu thập.


Sẵn Sàng Xây Dựng Với Alexa Scraper?

Tham gia cộng đồng của chúng tôi để yêu cầu một kế hoạch miễn phí và kết nối với các nhà phát triển đang xây dựng các pipeline dữ liệu trả lời LLM: Discord · Telegram.

Đăng ký tại app.scrapeless.com và thử nghiệm tác nhân với một prompt, một quốc gia được hỗ trợ, và một điểm cuối webhook mà bạn kiểm soát.


Câu Hỏi Thường Gặp

Q: Endpoint nào mà Alexa Scraper sử dụng?

Alexa Scraper sử dụng POST https://api.scrapeless.com/api/v2/scraper/request trong tài liệu tác nhân hiện tại. Yêu cầu sử dụng scraper.alexa làm giá trị tác nhân.

Q: Các đầu vào nào của Alexa Scraper là bắt buộc?

Tác nhân yêu cầu một prompt và mã quốc gia bên trong đối tượng input. Ví dụ yêu cầu được tài liệu cũng bao gồm một URL webhook cho quy trình làm việc yêu cầu.

Q: Sự khác biệt giữa md_textraw_text là gì?

md_text là câu trả lời Alexa được định dạng Markdown, trong khi raw_text là câu trả lời văn bản thuần. Lưu trữ cả hai khi pipeline cần rendering trung thành và phân tích văn bản.

Q: Alexa Scraper có luôn trả về trích dẫn không?

Alexa Scraper cung cấp các mảng referencessources, nhưng mã bên dưới nên cho phép các mảng đó là rỗng. Sự hiện diện của trích dẫn phụ thuộc vào câu trả lời được trả về.

Q: Alexa Scraper có luôn trả về sản phẩm không?

Không. Thông tin sản phẩm là có điều kiện, và mảng products có thể rỗng khi không áp dụng.

Q: Có thể sử dụng Alexa Scraper mà không cần Python không?

Có. Bất kỳ khách hàng nào có thể gửi một POST JSON được xác thực và nhận phản hồi của quy trình làm việc yêu cầu đều có thể sử dụng tác nhân. Ví dụ cURL là đủ cho bài kiểm tra tích hợp trực tiếp.

Q: Nên lưu trữ khóa API như thế nào?

Lưu trữ khóa API Scrapeless trong một biến môi trường hoặc một kho bí mật được quản lý. Đừng cam kết khóa vào kiểm soát nguồn hoặc bao gồm nó trong nhật ký webhook.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục