Tìm Kiếm Trang Web Công Ty với Google Search API
Expert Network Defense Engineer
TL;DR:
- Khám phá website công ty tạo ra các ứng viên trước khi xác nhận các kết quả. Một kết quả chứa tên công ty không xác lập quyền sở hữu website.
- Tìm kiếm với ngữ cảnh thực thể. Bảo tồn mã nhận diện công ty, tên, thị trường và mô tả doanh nghiệp để người xem có thể phân biệt các tổ chức tương tự.
- Ghi lại bằng chứng đứng sau sự khớp. Giữ lại URL của ứng viên, kiểm tra thực thể, sự không chắc chắn và quyết định cuối cùng của người xem trong bảng công ty-website.
Một danh sách công ty thường chứa tên mà không có URL website đáng tin cậy. Một số tên được chia sẻ bởi các doanh nghiệp không liên quan; những tên khác đề cập đến một công ty con, một thương hiệu cũ, hoặc một địa điểm. Việc chọn kết quả tìm kiếm đầu tiên có thể biến sự mơ hồ đó thành một lỗi trông có vẻ tự tin và lan tỏa qua phần còn lại của tập dữ liệu.
API Tìm kiếm Google không cần thu thập cung cấp kết quả tìm kiếm có cấu trúc cho việc khám phá website công ty. Quy trình làm việc ở đây sử dụng những kết quả đó để xây dựng hàng đợi ứng viên và một bản đồ đã được xem xét. Nó không tuyên bố cung cấp một cơ sở dữ liệu công ty hoàn chỉnh, thông tin liên hệ, hoặc địa chỉ email đã xác minh.
Xác định Công Ty nào và Website nào Bạn Cần
Bắt đầu với một mã nhận diện công ty ổn định từ bộ dữ liệu đầu vào của bạn. Một tên thì hữu ích cho việc tìm kiếm, nhưng nó không nên là khóa chính cho việc lập bản đồ. Hai bản ghi có thể chia sẻ một tên và vẫn đại diện cho các thực thể khác nhau.
Giữ nguyên tên tổ chức chính xác như đã nhận và thêm ngữ cảnh đã biết vào các trường riêng biệt: thị trường hoạt động, ngành, địa điểm, tổ chức mẹ, hoặc tên sản phẩm. Bảo tồn nguồn của ngữ cảnh đó. Sự gia tăng chưa được xác minh không nên lặng lẽ trở thành bằng chứng được sử dụng để xác minh trường tiếp theo.
Quyết định URL mong muốn đại diện cho điều gì. Một trang chính của công ty, một trang khu vực, một trang thương hiệu, và một trang công ty con là những điểm đến khác nhau. Một trang công ty con hợp lệ không nên bị từ chối chỉ vì một quy tắc không được nói rõ yêu cầu miền gốc của công ty mẹ.
Xác định các kết quả chấp nhận trước khi nghiên cứu: kết quả xác nhận, ứng viên có khả năng cần xem xét, sự mơ hồ chưa được giải quyết, và không có sự khớp đã được xác minh trong mẫu đã thu thập. Một bản ghi không có sự khớp đã xác nhận vẫn có ích khi lý do được nhìn thấy.
Xây dựng Truy vấn Từ Ngữ cảnh Đã Biết
Sử dụng tên công ty với một chút ngữ cảnh liên quan. Ngành hoặc địa lý có thể giúp phân biệt một tên được chia sẻ. Giữ mỗi truy vấn chính xác và mã nhận diện công ty cùng nhau để người xem biết thực thể nào mà tìm kiếm dự định tìm.
Không thêm những sự thật tưởng tượng để làm cho truy vấn trông cụ thể hơn. Một thành phố được đoán có thể hướng tìm kiếm về hướng tổ chức sai và sau đó có vẻ như xác nhận được dự đoán. Nếu bản ghi đầu vào thiếu ngữ cảnh, đánh dấu sự mơ hồ và yêu cầu dữ liệu nguồn tốt hơn trong quy trình làm việc của riêng bạn.
Các tham số Tìm kiếm Google cung cấp kiểm soát quốc gia, ngôn ngữ và địa điểm. Cấu hình chúng một cách cẩn thận, và giữ nguyên yêu cầu hoàn chỉnh. Ngữ cảnh quốc gia không phải là bằng chứng của việc đăng ký hoặc quyền sở hữu công ty; nó mô tả tìm kiếm mà bạn đã yêu cầu quan sát.
Sử dụng truy vấn thứ hai, được chứng minh độc lập khi nó giải quyết một sự không chắc chắn cụ thể, chẳng hạn như liệu công ty có sử dụng một tên cũ hay không. Bảo tồn các quan sát tách biệt. Sự biến đổi truy vấn là hoạt động nghiên cứu, không phải là lý do để viết lại bản ghi đầu vào gốc.
Thu thập Ứng viên Với Bằng chứng Gốc của Chúng
Quy trình yêu cầu Tìm kiếm Google sử dụng scraper.google.search với POST https://api.scrapeless.com/api/v1/scraper/request và tiêu đề x-api-token. Các cài đặt thuộc về input. Việc thu thập trực tiếp yêu cầu khóa tài khoản của bạn và kiểm tra phản hồi thực tế; quy trình làm việc này không tuyên bố thực hiện xác thực.
Lưu trữ yêu cầu hoàn chỉnh, phản hồi thô, thời gian quan sát của khách hàng, và mã nhận diện công ty. HTTP 200 mang dữ liệu nhiệm vụ; HTTP 201 có nghĩa là một nhiệm vụ đang chờ. Không gán nhãn một công ty là không có website chỉ vì việc thu thập đang chờ hoặc thất bại.
Đối với các kết quả hữu cơ, giữ lại tiêu đề, URL, đoạn trích, và vị trí đã được trả về khi có. Giữ nguyên các trường bị thiếu hoặc null trong bản ghi thô thay vì thay thế chúng bằng văn bản tưởng tượng. Mô hình dữ liệu JSON hỗ trợ sự khác biệt đó.
Tạo các hàng ứng viên trước khi gán quyền sở hữu. Một danh sách thư mục, một bài báo tin tức, hoặc một công ty có tên tương tự có thể là bằng chứng hữu ích mà không phải là trang chính mong muốn. Đánh dấu vai trò rõ ràng của ứng viên riêng biệt với việc liệu nó có phải là sự khớp hay không.
Nhóm Tên miền mà Không Đòi Quyền Sở Hữu
Sử dụng một bộ phân tích URL để tách biệt giao thức, tên miền, đường dẫn và truy vấn. Tham khảo thông tin phân tích URL giải thích các thành phần đó và cũng làm rõ rằng việc phân tích không phải là xác thực danh tính của một trang web.
Tránh các quy tắc sở hữu chuỗi con. Một tên miền chứa một từ thương hiệu có thể thuộc về một bên không liên quan. So sánh các tên miền đã được kiểm tra rõ ràng và giữ lại các URL gốc. Nếu tổ chức của bạn nhóm các tên miền con đã chọn lại với nhau, hãy ghi lại chính sách đó thay vì giả định mỗi hậu tố chung đều xác định cùng một doanh nghiệp.
Một phép tính tên miền gốc cũng cần được chăm sóc. Các hậu tố công cộng khác nhau, vì vậy việc lấy các nhãn cuối cùng của một tên miền không phải là một bài kiểm tra sở hữu chung. Tham khảo giải thích Danh sách Hậu tố Công cộng giúp làm rõ ranh giới miền; nó vẫn không xác minh được doanh nghiệp đứng sau một miền.
Giữ lại các thư mục và hồ sơ xã hội trong hàng đợi bằng chứng, nhưng phân biệt chúng với trang web của công ty. Chúng có thể giúp làm rõ một tổ chức sau khi kiểm tra mà không trở thành trang chính cuối cùng mặc định.
Bắt đầu thu thập dữ liệu với Scrapeless
Nâng cao quy trình thu thập và tự động hóa web của bạn với Scrapeless!
Đăng ký ngay hôm nay và nhận $5 tín dụng miễn phí — không cần thẻ tín dụng.Nhận tín dụng miễn phí của bạn ngay bây giờ tại Bảng điều khiển Scrapeless.
Xác minh Thực thể trên Trang Đích
Mở từng điểm đến hứa hẹn và kiểm tra danh tính doanh nghiệp. So sánh mô tả tổ chức, vị trí, sản phẩm và mối quan hệ cha mẹ với bối cảnh đầu vào đã biết. Bảo tồn URL yêu cầu và điểm đến cuối cùng nếu điều hướng chuyển hướng.
Đừng để tên công ty đơn lẻ quyết định. Một tên chia sẻ cộng với một ngành không tương thích là một xung đột, ngay cả khi kết quả xếp hạng cao. Một tên trùng khớp cộng với bối cảnh kinh doanh nhất quán là bằng chứng mạnh hơn, nhưng hãy ghi lại những gì đã được kiểm tra thay vì ẩn nó sau một điểm số tự tin chưa được giải thích.
Các đoạn tìm kiếm vẫn giữ vai trò bằng chứng khám phá. Google mô tả cách các đoạn được tạo ra; chúng có thể nhấn mạnh văn bản liên quan đến truy vấn. Xem xét điểm đến trước khi khẳng định nó xác định công ty mục tiêu.
Đối với một đầu vào giả định gọi là Harbor Analytics, một reviewer có thể tìm thấy một doanh nghiệp phần mềm và một công ty tư vấn không liên quan. Ví dụ đó minh họa quy trình quyết định, không phải là một kết quả tìm kiếm đã quan sát. Phản ứng đúng với bối cảnh đầu vào không đủ là một sự trùng khớp chưa được giải quyết, không phải là một trang chính được đoán.
Tạo Bảng Công ty tới Trang Web Có Thể Đánh Giá
Bảng cuối cùng nên làm cho quyết định có thể được kiểm tra. Giữ lại ID công ty, tên đầu vào, URL được chọn, tên miền được chọn, vai trò trang web, trạng thái khớp, tham chiếu bằng chứng, người xem xét và thời gian xem xét. Một bảng ứng cử viên riêng biệt có thể giữ lại tất cả các URL đã kiểm tra và lý do loại trừ.
Sử dụng một URL được chọn trống chỉ bên cạnh một trạng thái rõ ràng. “Không có khớp đã xác minh” có thể có nghĩa là các ứng cử viên đã thu thập không đủ, trong khi “không rõ ràng” có thể có nghĩa là nhiều điểm đến phù hợp với bối cảnh có sẵn. Không có một câu nào chứng minh rằng tổ chức không có trang web.
Bảo tồn các chuyển hướng và tên lịch sử như là các quan sát với ngày tháng trong hệ thống nội bộ của bạn. Không tự động ghi đè một bản đồ đã xác nhận khi một tìm kiếm sau đó trả về một trang đích khác. Tạo một sự kiện kiểm tra với bằng chứng cũ và mới thay vào đó.
Nếu tập dữ liệu tiếp cận một CRM, đính kèm bản đồ cấp công ty với hồ sơ tổ chức đúng. Giữ cho nhiệm vụ giới hạn tại các trang web công ty. Việc thu thập thông tin liên lạc cá nhân và xác minh email là những quy trình riêng biệt và không phải là đầu ra của quy trình này.
Đo Lường Chất Lượng Xem Xét Trước Khi Mở Rộng Bộ Sưu Tập
Xem xét một mẫu các khớp đã được chấp nhận và từ chối dựa trên cùng một tiêu chí viết. Ghi lại sự không đồng ý giữa các người xem xét và nguồn gốc của sự không rõ ràng. Điều này làm sáng tỏ xem vấn đề nằm ở bối cảnh truy vấn, quy tắc vai trò trang web, hoặc dữ liệu nguồn không đủ.
Giữ cho độ bao phủ bộ sưu tập tách biệt khỏi kết quả khớp. Một báo cáo có thể chỉ rõ tìm kiếm nào đã hoàn thành và công ty nào đã nhận được các khớp đã được xem xét. Đừng sử dụng tất cả các tìm kiếm đã gửi như thể mỗi cái đều tạo ra bằng chứng hữu ích.
Một hàng đợi chưa được giải quyết hữu ích ghi lại thông tin tiếp theo cần thiết: một tên pháp lý, một thị trường, một mối quan hệ cha mẹ, hoặc một điểm đến đã được xem xét. Đó là một sự chuyển giao thực tế cho chủ sở hữu dữ liệu. Một nhãn tự tin thấp chung chung thường để lại cho người tiếp theo không có hành động rõ ràng.
Kết luận
Xây dựng quy trình khám phá trang web công ty như một quá trình khớp dựa trên bằng chứng. Tìm kiếm tìm các đích ứng viên; xử lý tên miền tổ chức chúng; đánh giá trang thiết lập xem chúng có phù hợp với thực thể và vai trò trang web dự kiến hay không. Giữ lại sự không chắc chắn để một bảng sạch sẽ không che giấu các khớp không chính xác.
Các trang web công ty đã được xem xét cũng có thể giúp xác định phân tích khoảng cách nội dung bằng cách phân biệt các tổ chức đứng sau các trang trước khi so sánh nội dung của chúng.
Xây Dựng Quan Sát Tìm Kiếm Tiếp Theo Của Bạn
Sử dụng Scrapeless Google Search API để thu thập bằng chứng tìm kiếm cho quy trình công việc này. Xem xét giá Scrapeless khi lập kế hoạch ngân sách thu thập của bạn, và giữ các tham số tìm kiếm Google bên cạnh cấu hình yêu cầu của bạn.
Thảo luận về việc triển khai của bạn với cộng đồng trên Discord hoặc Telegram.
Câu Hỏi Thường Gặp
Q: Kết quả hữu cơ đầu tiên có phải là trang web chính thức của công ty không?
Không nhất thiết. Nó là một ứng viên. So sánh danh tính doanh nghiệp của đích đến với ngữ cảnh công ty đã biết trước khi chấp nhận.
Q: Việc tìm một tên miền có xác minh địa chỉ email không?
Không. Quy trình công việc này ánh xạ các công ty với các trang web đã được xem xét. Nó không thu thập hoặc xác thực địa chỉ email.
Q: Có nên loại bỏ danh sách thư mục không?
Nó có thể duy trì như bằng chứng hỗ trợ sau khi xem xét, nhưng nó nên được gán nhãn là một danh bạ thay vì trang chính của công ty.
Q: Làm gì nếu nhiều công ty có cùng tên?
Sử dụng ngữ cảnh đáng tin cậy như ngành, thị trường hoặc tổ chức mẹ. Giữ cho việc khớp chưa được giải quyết nếu bằng chứng có sẵn không thể phân biệt chúng.
Q: Không có khớp được xác minh có nghĩa là công ty không có trang web không?
Không. Nó mô tả kết quả của mẫu nghiên cứu này. Việc thu thập không đầy đủ, ngữ cảnh không đủ hoặc các ứng viên chưa được giải quyết có thể ngăn cản một khớp được xác minh.
Tại Scrapless, chúng tôi chỉ truy cập dữ liệu có sẵn công khai trong khi tuân thủ nghiêm ngặt các luật, quy định và chính sách bảo mật trang web hiện hành. Nội dung trong blog này chỉ nhằm mục đích trình diễn và không liên quan đến bất kỳ hoạt động bất hợp pháp hoặc vi phạm nào. Chúng tôi không đảm bảo và từ chối mọi trách nhiệm đối với việc sử dụng thông tin từ blog này hoặc các liên kết của bên thứ ba. Trước khi tham gia vào bất kỳ hoạt động cạo nào, hãy tham khảo ý kiến cố vấn pháp lý của bạn và xem xét các điều khoản dịch vụ của trang web mục tiêu hoặc có được các quyền cần thiết.



