Quay lại blog

Cách Lấy Dữ Liệu từ Google Scholar Với Trình Duyệt Lấy Dữ Liệu Không Gây Tốn Kém

Isabella Garcia
Isabella Garcia

Web Data Collection Specialist

19-Aug-2026

TL;DR:

  • Google Scholar cung cấp giao diện tìm kiếm, không phải API kết quả hàng loạt chung. Hỗ trợ công khai của nó mô tả tìm kiếm, xuất trích dẫn, cảnh báo và giới hạn quyền truy cập, vì vậy các quy trình làm việc trên trình duyệt phải giữ nhỏ gọn và tôn trọng.
  • Đơn vị trích xuất ổn định là thẻ kết quả. Đọc tiêu đề, URL đích, dòng tác giả/nguồn, đoạn trích, liên kết trích dẫn, liên kết phiên bản, và liên kết văn bản đầy đủ công khai một cách độc lập; một số trường là tùy chọn.
  • Phân trang dựa vào URL. Khám phá liên kết trang tiếp theo từ trang được hiển thị thay vì tính toán số lượng trang mà Scholar không hứa hẹn.
  • Trình duyệt Scrapeless Scraping giữ việc hiển thị và trạng thái phiên trong đám mây. Logic trích xuất có thể tập trung vào hợp đồng thẻ kết quả của Scholar.
  • Hồ sơ nghiên cứu cần có nguồn gốc. Lưu truy vấn, URL kết quả chuẩn, thời gian quan sát, và dòng tác giả/nguồn thô bên cạnh các trường đã chuẩn hóa.
  • Miễn phí để bắt đầu. Các tài khoản Scrapeless mới bao gồm thời gian chạy trình duyệt Scraping miễn phí — đăng ký tại app.scrapeless.com.

Giới thiệu: Kết quả Tìm kiếm Là Quan Sát, Không Phải Cơ Sở Dữ Liệu Tài Liệu

Kết quả Google Scholar kết hợp phát hiện học thuật với các liên kết đến nhà xuất bản, kho lưu trữ, xem trích dẫn và các phiên bản thay thế. Điều này làm cho trang trở nên hữu ích cho các công cụ nghiên cứu, nhưng cũng có nghĩa là hồ sơ công khai là một quan sát tìm kiếm hơn là một hồ sơ xuất bản chuẩn hoàn chỉnh.

Một trình thu thập dữ liệu Google Scholar thực tiễn nên làm tốt hai công việc: bảo tồn những gì mà trang kết quả thực sự hiển thị và cung cấp các định danh ổn định như DOI hoặc URL xuất bản chuẩn cho dịch vụ metadata tài liệu khi cần thiết. Nó không nên suy diễn các tác giả thiếu, hợp nhất các phiên bản mà không có chứng cứ, hoặc coi số lượng trích dẫn hiển thị là vĩnh viễn.

Hướng dẫn này sử dụng Scrapeless Scraping Browser để hiển thị một trang tìm kiếm Scholar công khai, khám phá các thẻ kết quả, trích xuất các trường nullable, theo dõi điều khiển trang tiếp theo, và trả về một hình dạng JSON sẵn sàng cho nghiên cứu.

Google Scholar Có API Chính Thức Không?

Google Scholar không công bố một API kết quả tìm kiếm chung hoặc nguồn cấp dữ liệu bản ghi hàng loạt trong bề mặt trợ giúp công khai của mình.

Tài liệu Google Scholar Search Help mô tả tìm kiếm tương tác, cảnh báo, xuất trích dẫn, và giao diện kết quả công khai. Nó cũng thông báo cho người dùng tự động tôn trọng robots.txt của Scholar và nêu rằng quyền truy cập hàng loạt là không khả dụng.

Ranh giới đó thay đổi thiết kế. Sử dụng trang tìm kiếm cho một nhiệm vụ phát hiện nhỏ, đã định nghĩa. Đối với việc truy xuất metadata rộng hơn sau khi phát hiện, một nguồn được thiết kế cho metadata học thuật có cấu trúc thường là sự lựa chọn tốt hơn; Crossref REST API cung cấp metadata tài liệu đã gửi trong JSON.

Dữ Liệu Nào Có Thể Được Thu Thập?

Một thẻ kết quả Google Scholar công khai có thể hiển thị một tập hợp các trường hữu ích nhưng biến đổi.

Trường Bề mặt Scholar Quy tắc chuẩn hóa
title Tiêu đề kết quả Bảo tồn văn bản hiển thị mà không có nhãn định dạng
result_url Liên kết tiêu đề Giải quyết thành một URL tuyệt đối
authors_publication Dòng metadata Giữ nguyên dòng thô; phân tích cẩn thận
snippet Đoạn trích kết quả Nullable; không coi như tóm tắt
cited_by_url Dòng hành động Nullable; lưu trữ URL và nhãn hiển thị riêng biệt
versions_url Dòng hành động Nullable; hữu ích cho các bản sao thay thế
full_text_url Liên kết truy cập PDF hoặc HTML Nullable và phụ thuộc vào quyền truy cập của nguồn
scholar_result_id Thuộc tính thẻ kết quả công khai Nullable; chỉ hữu ích như một khóa quan sát

Trang kết quả có thể hiển thị năm xuất bản bên trong dòng tác giả/nguồn, nhưng dòng đó không phải là một trích dẫn có cấu trúc đảm bảo. Giữ nguyên giá trị thô và làm phong phú nó sau từ DOI, hồ sơ nhà xuất bản, hoặc metadata kho lưu trữ.

Tại Sao Google Scholar Khó Tự Động Hóa

Tự động hóa Google Scholar bị hạn chế bởi chính sách truy cập, đánh dấu kết quả thay đổi, các trường tùy chọn, và phân trang phụ thuộc vào truy vấn.

Một số kết quả liên kết trực tiếp đến một nhà xuất bản trong khi những kết quả khác liên kết đến một PDF, một bản sao kho lưu trữ, hoặc không có tiêu đề có thể nhấp vào. Các hành động trích dẫn và phiên bản chỉ xuất hiện khi Scholar có những mối quan hệ đó. Ngôn ngữ địa phương thay đổi các nhãn hiển thị. Lưu lượng tự động cũng có thể dẫn đến một trang nội dung thay vì một trang kết quả.

Trình thu thập phải kiểm tra trang trước khi trích xuất. Nếu thẻ kết quả không có, hãy ghi lại trạng thái trang và dừng chạy; không hiểu một thông điệp truy cập như là một kết quả nghiên cứu trống.

Giao thức Exclusion Robots định nghĩa cách một dịch vụ có thể công bố quy tắc truy cập cho trình thu thập. RFC 9309 mô tả tiêu chuẩn, trong khi trợ giúp của Scholar vẫn là hướng dẫn sản phẩm kiểm soát cho bề mặt này.

Tại Sao Chọn Scrapeless Scraping Browser

Scrapeless Scraping Browser là một trình duyệt đám mây tùy chỉnh, chống phát hiện được thiết kế cho các bot web và đại lý AI. Đối với một trình thu thập thông tin Google Scholar, nó cung cấp khả năng kết xuất JavaScript phía đám mây, phiên trạng thái, và thông tin nhận thức khu vực trong khi để lại các bộ chọn thẻ kết quả dưới sự kiểm soát của bạn.

Sự tách biệt đó quan trọng vì hợp đồng lấy dữ liệu là đặc thù cho Scholar. Trình duyệt trả về trang đã được kết xuất; mã của bạn quyết định thẻ nào được tính là kết quả, trường nào có thể nhận giá trị null, và khi nào thì dừng phân trang.

Xem sản phẩm Scraping Browser, giá cả, và tài liệu hướng dẫn nhanh trước khi kết nối một quy trình làm việc sản xuất.

Điều kiện tiên quyết

  • Node.js 18 hoặc mới hơn.
  • scrapeless-scraping-browser CLI.
  • Một tài khoản Scrapeless và khóa API từ app.scrapeless.com.
  • jq để đọc ID phiên và định dạng JSON.
  • Một tập hợp truy vấn nhỏ đã được phê duyệt và một mục đích nghiên cứu đã được tài liệu hóa.

Lưu ý: Khối phiên đám mây bên dưới yêu cầu khóa API Scrapeless của bạn. Nó không thể được thực thi trong môi trường xác minh không cần chứng chỉ; hợp đồng bộ chọn đã được kiểm tra so với một trang kết quả Scholar công khai trực tiếp, và không có đầu ra đám mây nào được trình bày như một lần chạy hoàn thành.

Cài đặt

Cài đặt CLI với npm install -g scrapeless-scraping-browser, sau đó cấu hình khóa với scrapeless-scraping-browser config set apiKey your_api_token_here. Xác nhận cấu hình cục bộ với scrapeless-scraping-browser config get apiKey trước khi tạo một phiên.

Nếu một đại lý AI sẽ vận hành trình duyệt, hãy cài đặt kỹ năng Scrapeless trong đại lý đó như một bước riêng biệt. CLI là thời gian chạy; kỹ năng dạy cho đại lý quy trình khám phá → trích xuất.

Cách bạn thực sự sử dụng điều này: Khuyến khích đại lý của bạn

Sau khi cài đặt, bạn có thể đưa ra yêu cầu nghiên cứu có giới hạn cho đại lý thay vì dán bộ chọn vào mỗi cuộc trò chuyện.

Lời nhắc Dự kiến trả về
“Tìm kiếm Google Scholar cho retrieval augmented generation và trả về trang kết quả công khai đầu tiên dưới dạng JSON.” Các bản ghi kết quả với URL nguồn và các trường có thể null
“Thu thập tiêu đề và liên kết trích dẫn; không mở PDF.” Tập hợp kết quả chỉ chứa metadata
“Theo liên kết trang tiếp theo hiện thấy một lần và loại bỏ trùng lặp theo URL kết quả.” Hai trang đã quan sát với một trường trang nguồn
“Dừng lại nếu Scholar hiển thị một thông điệp truy cập thay vì thẻ kết quả.” Bản ghi trạng thái trang, không phải danh sách kết quả trống
“Xuất các bản ghi đã chuẩn hóa dưới dạng NDJSON.” Một đối tượng JSON cho mỗi kết quả

Một lời nhắc mạnh mẽ đặt tên cho truy vấn, số lượng trang tối đa, các trường, định dạng đầu ra, và điều kiện dừng. Nó cũng nêu rõ rằng chỉ có kết quả tìm kiếm công khai nằm trong phạm vi.

Bước 1 — Kết nối, Khám phá, và Trích xuất Thẻ Kết quả

Chảy dưới nắp tạo ra một phiên, mở một truy vấn có giới hạn, kiểm tra các thẻ kết quả, trích xuất mỗi trường một cách độc lập, và chỉ theo liên kết trang tiếp theo hiện thấy.

Lưu ý: Chạy khối này chỉ sau khi cấu hình khóa API Scrapeless của bạn như đã mô tả trong Điều kiện tiên quyết.

bash Copy
QUERY='retrieval augmented generation'
SESSION=$(scrapeless-scraping-browser new-session \
  --name scholar-research --ttl 300 --proxy-country US --json \
  | jq -r '.data.taskId')

scrapeless-scraping-browser --session-id "$SESSION" open \
  "https://scholar.google.com/scholar?q=$(printf '%s' "$QUERY" | jq -sRr @uri)&hl=en"
scrapeless-scraping-browser --session-id "$SESSION" wait 4000

scrapeless-scraping-browser --session-id "$SESSION" eval '
JSON.stringify({
  pageState: document.querySelector(".gs_r.gs_or") ? "results" : "not-results",
  nextPageUrl: document.querySelector("#gs_n a[href*=\"start=\"]")?.href ?? null,
  results: Array.from(document.querySelectorAll(".gs_r.gs_or")).map(card => ({
    scholarResultId: card.getAttribute("data-cid") || null,
    title: card.querySelector(".gs_rt")?.textContent?.replace(/^\[[^\]]+\]\s*/, "").trim() || null,
    resultUrl: card.querySelector(".gs_rt a")?.href || null,
    authorsPublication: card.querySelector(".gs_a")?.textContent?.trim() || null,
    snippet: card.querySelector(".gs_rs")?.textContent?.trim() || null,
    citedByUrl: card.querySelector(".gs_fl a[href*=\"cites=\"]")?.href || null,
    versionsUrl: card.querySelector(".gs_fl a[href*=\"cluster=\"]")?.href || null,
    fullTextUrl: card.querySelector(".gs_ggs a")?.href || null
  }))
})' | jq .

scrapeless-scraping-browser stop "$SESSION"

Chiến lược bộ chọn có hai lớp. .gs_r.gs_or khám phá một đối tượng kết quả công khai; các bộ chọn con sau đó đọc các trường một cách độc lập. Một đoạn mã hoặc hành động trích dẫn thiếu không làm mất toàn bộ bản ghi.

Bước 2 — Xử lý Phân trang mà không Đoán

Phân trang Scholar nên theo liên kết mà trang đã kết xuất cung cấp.

Đọc nextPageUrl từ đầu ra trích xuất. Nếu nó là null, dừng lại. Nếu nó có mặt và giới hạn trang đã được phê duyệt chưa đạt, hãy mở URL đó trong cùng một phiên, chờ đợi các thẻ kết quả, và trích xuất lại. Lưu URL trang trên mỗi bản ghi để các cuộc kiểm toán sau này có thể tái hiện quan sát.

Loại bỏ trùng lặp theo resultUrl chuẩn khi có sẵn. Khi nó vắng mặt, hãy sử dụng một khóa quan sát tổng hợp được xây dựng từ tiêu đề đã chuẩn hóa và dòng tác giả/nguyên liệu thô. Đừng giả định rằng cùng một tác phẩm sẽ luôn chiếm cùng một thứ hạng hoặc hiển thị cùng một liên kết truy cập.

Bước 3 — Định nghĩa Sơ đồ Đầu ra

Đầu ra phân biệt các trường quan sát trên Scholar từ việc làm phong phú thư mục sau này.

json Copy
{
  "query": "retrieval augmented generation",
  "sourcePage": "https://scholar.google.com/scholar?q=...",
  "observedAt": "illustrative timestamp",
  "pageState": "results",
  "results": [
    {
      "scholarResultId": "illustrative public card ID",
      "title": "Illustrative paper title",
      "resultUrl": "https://example.org/paper",
      "authorsPublication": "Illustrative author and source line",
      "snippet": null,
      "citedByUrl": null,
      "versionsUrl": null,
      "fullTextUrl": null
    }
  ]
}

Sơ đồ phản ánh các trường được phát ra bởi Bước 1. Các giá trị trên là mẫu minh họa, và các trường tùy chọn vẫn có thể null.

Bắt đầu Thu thập Dữ liệu với Scrapeless

Tăng cường quy trình thu thập dữ liệu và tự động hóa web của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phíkhông yêu cầu thẻ tín dụng.
Claim your free credit now in the Scrapeless Dashboard.
Scrapeless Dashboard showing $5.00 in Team Credits

Những Gì Bạn Nhận Được

Một công cụ lấy dữ liệu Google Scholar hữu ích sẽ trả về một tập hợp các quan sát kết quả có thể theo dõi, không phải là một tuyên bố về việc bao quát hoàn toàn các tài liệu học thuật.

Việc xác minh trang công khai đã xác nhận rằng các thẻ kết quả hiển thị tiêu đề, tác giả/nguồn, đoạn trích, hàng hành động, và liên kết văn bản đầy đủ, nhưng không phải thẻ nào cũng chứa tất cả các trường. Xử lý các hành vi sau như bình thường:

  • Một tiêu đề có thể là văn bản thuần chứ không phải là một liên kết đến đích.
  • Đoạn trích hiển thị có thể không có và không nên được gán nhãn lại là một tóm tắt.
  • Các hành động được trích dẫn và phiên bản là điều kiện.
  • Một liên kết văn bản đầy đủ công khai có thể chỉ đến một kho lưu trữ hoặc nhà xuất bản và có thể có các điều kiện truy cập khác nhau.
  • Thứ tự kết quả và số lượng hiển thị có thể thay đổi giữa các quan sát.

Đối với các mô hình tự động hóa công cụ tìm kiếm rộng hơn, quy trình tìm kiếm Google Scrapeless cho thấy cách tiếp cận khám phá đầu tiên tương tự trong một bề mặt kết quả đa dạng hơn.

Xuất Dữ Liệu cho Quy Trình Nghiên Cứu

Xuất một bản ghi mỗi dòng dưới dạng NDJSON khi đường ống sẽ phát trực tiếp kết quả vào một kho lưu trữ hoặc công việc làm phong phú. Sử dụng CSV chỉ khi các trường lồng có thể null đã được làm phẳng một cách có chủ ý.

Giữ authorsPublication nguyên vẹn trong quan sát thô. Nếu một DOI có sẵn tại đích, làm phong phú bản ghi từ một nhà xuất bản hoặc hồ sơ tài liệu và lưu trữ nguồn làm phong phú riêng biệt. Đoạn trích kết quả của Scholar và hồ sơ siêu dữ liệu của một đăng ký trả lời các câu hỏi khác nhau và không nên ghi đè lên nhau.

Chuẩn hóa một DOI đã phát hiện như là định danh của nó thay vì ràng buộc bản ghi vào một URL của nhà xuất bản. Hướng dẫn định danh của Quỹ DOI giải thích tại sao một DOI vẫn hữu ích khi vị trí hiện tại của đối tượng thay đổi.

Sử Dụng Có Trách Nhiệm

Tự động hóa Scholar có trách nhiệm là nhỏ, có giới hạn mục đích, và nhận thức về nguồn gốc.

Tôn trọng hướng dẫn sản phẩm của Scholar và quy tắc robots. Không cố gắng thu thập hàng loạt, không truy cập nội dung đăng ký mà không có sự cho phép, và không xem một liên kết kết quả công khai như là sự cho phép để phân phối lại công việc đã liên kết. Giữ độ đồng thời là một công nhân cho Scholar và dừng hoạt động khi trang không còn chứa thẻ kết quả.

Chỉ lưu trữ siêu dữ liệu mà công việc nghiên cứu cần. Số lượng trích dẫn là các quan sát có thể thay đổi; ghi lại thời gian quan sát và không trình bày chúng như là các biện pháp ổn định về chất lượng. Khi một dự án cần siêu dữ liệu xuất bản toàn diện, hãy sử dụng một nguồn tài liệu thích hợp hoặc sắp xếp truy cập với chủ sở hữu dữ liệu.

Kết Luận: Bảo Tồn Quan Sát Tìm Kiếm

Một công cụ lấy dữ liệu Google Scholar trở nên đáng tin cậy khi nó bảo tồn ranh giới giữa dữ liệu tìm kiếm hiển thị và siêu dữ liệu xuất bản chính thức. Thực hiện một truy vấn được phê duyệt, khám phá các thẻ kết quả, trích xuất các trường có thể null, theo dõi liên kết trang tiếp theo hiển thị, và giữ nguyên nguồn gốc trên mỗi bản ghi.

Trình duyệt Lấy Dữ liệu Scrapeless xử lý lớp trình duyệt đám mây và phiên. Trình trích xuất giữ cho nhỏ gọn đủ để kiểm tra, và đầu ra trung thực về những gì Scholar đã làm và không làm.


Sẵn Sàng Xây Dựng Một Đường Ống Dữ Liệu Nghiên Cứu?

Tham gia cộng đồng của chúng tôi để nhận một kế hoạch miễn phí và kết nối với các nhà phát triển xây dựng quy trình nghiên cứu công khai: Discord · Telegram.

Đăng ký tại app.scrapeless.com để được sử dụng miễn phí thời gian chạy Trình duyệt Lấy Dữ liệu và điều chỉnh hợp đồng thẻ kết quả của bạn để phù hợp với các truy vấn nghiên cứu được phê duyệt.


Câu Hỏi Thường Gặp

H: Việc lấy dữ liệu Google Scholar có hợp pháp không?

Câu trả lời phụ thuộc vào quyền tài phán, mục đích, phương pháp truy cập, điều khoản, và cách sử dụng sau đó. Giới hạn việc thu thập vào các kết quả công khai, tuân theo hướng dẫn và quy tắc robots của Scholar, tránh nội dung đăng ký mà không có sự cho phép, và có được đánh giá pháp lý hoặc tổ chức khi cần thiết.

H: Google Scholar có cung cấp API chính thức không?

Google Scholar không công bố một API kết quả tìm kiếm chung hoặc nguồn cung cấp hàng loạt trong trợ giúp công khai của mình. Bề mặt công khai cung cấp tìm kiếm tương tác, cảnh báo, và xuất trích dẫn.

H: Tôi có cần một proxy cho một công cụ lấy dữ liệu Google Scholar không?

Sử dụng đầu ra trình duyệt đồng vùng khi quy trình đã được phê duyệt phải tái tạo kết quả cho một vị trí. Một proxy không thay đổi chính sách truy cập của Scholar hoặc ủy quyền khối lượng thu thập cao hơn.
Q: Scraper nên làm gì khi Scholar hiển thị thông điệp truy cập?

Scraper nên ghi lại pageState: "not-results" và dừng chạy. Nó không nên chuyển đổi một trang trung gian thành một tập kết quả trống.

Q: Scraper nên xử lý các thay đổi DOM như thế nào?

Chạy lại quá trình khám phá trên thẻ kết quả trực tiếp, xác nhận container và các trường con ổn định, sau đó cập nhật bộ điều hợp và thiết bị của nó trước khi chạy được phê duyệt tiếp theo.

Q: Quy trình làm việc của Scholar nên sử dụng bao nhiêu độ song song?

Sử dụng một worker cho Google Scholar. Quy trình làm việc được thiết kế cho một truy vấn nghiên cứu có giới hạn, không phải thu thập khối lượng lớn.

Q: Quy trình làm việc này có thể chạy mà không có tác nhân AI không?

Có. Khối CLI thực hiện các bước trình duyệt và trích xuất trực tiếp; kỹ năng tác nhân là một giao diện tùy chọn dựa trên lời nhắc.

Q: Quy trình có nên tạo các URL trang bằng cách tăng dần một độ lệch không?

Không. Theo dõi neo trang kế tiếp hiển thị từ trang đã render và dừng lại khi neo đó không còn hoặc hạn mức trang đã được phê duyệt đạt.

Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến ​​cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.

Bài viết phổ biến nhất

Danh mục