GPTBot là gì?
API Scraping Universal không rác thu thập nội dung web có thể truy cập công khai cho các quy trình dữ liệu được quản lý, tách biệt với crawler GPTBot của OpenAI.
TL;DR
- GPTBot là crawler web định hướng đào tạo của OpenAI. OpenAI cho biết GPTBot thu thập nội dung có thể được sử dụng để làm cho các mô hình nền tảng AI sinh ra của nó hữu ích và an toàn hơn.
- GPTBot tách biệt với crawler tìm kiếm của OpenAI. OAI-SearchBot quản lý khả năng đủ điều kiện cho kết quả tìm kiếm ChatGPT, trong khi GPTBot thể hiện quyền kiểm soát sử dụng đào tạo.
- ChatGPT-User đại diện cho các chuyến thăm do người dùng kích hoạt. OpenAI mô tả nó như một đại lý hành động của người dùng hơn là một crawler web tự động, vì vậy mô hình kiểm soát của nó khác biệt.
- robots.txt là kiểm soát chính được công bố cho trang web dành cho GPTBot. Một trang web có thể cho phép hoặc cấm mã người dùng GPTBot và có thể áp dụng các quy tắc theo đường dẫn cụ thể.
- Nhận dạng nhật ký cần nhiều hơn một sự trùng hợp tên. Chuỗi mã người dùng có thể được sao chép, vì vậy các nhà điều hành cũng nên xem xét các dải IP được công bố của OpenAI và chứng cứ yêu cầu của riêng họ.
GPTBot được xác định
GPTBot là một crawler web do OpenAI điều hành. Tài liệu hướng dẫn crawler chính thức của OpenAI cho biết GPTBot thu thập nội dung có thể được sử dụng trong việc đào tạo các mô hình nền tảng AI sinh ra của OpenAI. Việc cấm GPTBot cho thấy rằng nội dung của một trang không nên được sử dụng cho mục đích đào tạo đó.
Crawler tự xác định mình bằng mã người dùng GPTBot bên trong một chuỗi mã người dùng giống như trình duyệt đầy đủ hơn. OpenAI lưu ý rằng số phiên bản có thể thay đổi, vì vậy việc khớp một chuỗi đủ đầy đóng băng là dễ bị tổn thương. Các quy tắc trang web nên nhắm mục tiêu vào mã sản phẩm được tài liệu hóa, và phân tích nhật ký nên lưu trữ chuỗi được quan sát thay vì chuẩn hóa các chi tiết phiên bản hữu ích.
GPTBot không phải là một nhãn xếp hạng tìm kiếm, một cuộc trò chuyện ChatGPT, hoặc một tên chung cho lưu lượng OpenAI. OpenAI công bố những danh tính riêng biệt cho các chức năng riêng biệt. Sự tách biệt đó cho phép một quản trị web đưa ra một quyết định về việc thu thập dữ liệu mô hình đào tạo và một quyết định khác về việc xuất hiện trong trải nghiệm tìm kiếm ChatGPT.
Một danh tính crawler mô tả mục đích đã nêu của một yêu cầu. Nó không chứng minh rằng mọi yêu cầu sử dụng văn bản đều đến từ OpenAI, và nó không giải quyết các câu hỏi về bản quyền, quyền riêng tư, hợp đồng hoặc bảo vệ dữ liệu. Các nhà điều hành cần các điều khiển kỹ thuật, nhật ký yêu cầu, xem xét chính sách, và phân tích pháp lý của riêng họ.
Cách Kiểm Soát Quyền Truy Cập GPTBot
Một trang công bố hướng dẫn crawler trong tệp robots.txt tại gốc nguồn. Tệp có thể bao gồm một nhóm mã người dùng cho GPTBot và các quy tắc cho phép hoặc cấm cho các đường dẫn. Một chính sách cấm toàn bộ trang và một chính sách đường dẫn lựa chọn thể hiện những lựa chọn khác nhau. Cấu hình nên được thử nghiệm chống lại máy chủ chính xác vì các miền phụ và nguồn gốc riêng biệt có thể có tệp robots của riêng họ.
Tiêu đề mã người dùng cho biết máy chủ crawler nào tuyên bố đang thực hiện yêu cầu. Tài liệu của OpenAI cung cấp một ví dụ về chuỗi GPTBot và cảnh báo rằng phiên bản của nó có thể thay đổi. Do đó, các quy tắc máy chủ nên tránh phụ thuộc vào văn bản phiên bản trình duyệt ngẫu nhiên. Nhật ký nên giữ lại dấu thời gian, máy chủ, đường dẫn, phản hồi, mã người dùng, và nguồn mạng để một nhà điều hành có thể điều tra sau này.
OpenAI cũng công bố các dải IP của GPTBot trong định dạng JSON có thể đọc được máy tính.Các dải mạng có thể hỗ trợ xác thực và chính sách tường lửa, nhưng chúng có thể thay đổi. Một mã người dùng được sao chép từ một địa chỉ không liên quan không tương đương với một yêu cầu từ một dải công bố. Một sự khớp dải cũng không nên thay thế chính sách và ghi nhật ký theo đường dẫn.
Các điều khiển robots là hướng dẫn tư vấn cho các crawler tuân thủ. Chúng không phải là xác thực, mã hóa, hoặc kiểm soát truy cập. Nội dung bí mật hoặc hạn chế thuộc về quyền ủy quyền thực sự. Nếu một trang không nên được truy cập công khai, việc chặn một mã người dùng crawler là biện pháp an ninh không đủ.
GPTBot so với các Đại lý Người dùng Khác của OpenAI
Các danh tính crawler của OpenAI nên được quản lý theo mục đích được công bố của chúng hơn là nhóm dưới một quy tắc AI-bot chung.
| Kích thước | Ý nghĩa chính | Sai lầm phổ biến |
|---|---|---|
| GPTBot | Thu thập định hướng đào tạo cho nội dung có thể được sử dụng với các mô hình nền tảng AI sinh ra. | Giả định nó kiểm soát việc một trang xuất hiện trong tìm kiếm ChatGPT. |
| OAI-SearchBot | Thu thập tự động được sử dụng để xuất hiện các trang trong kết quả tìm kiếm ChatGPT. | Chặn nó trong khi mong đợi đủ điều kiện bình thường cho các câu trả lời tìm kiếm. |
| ChatGPT-User | Các chuyến thăm liên quan đến các hành động của người dùng nhất định trong ChatGPT hoặc Custom GPTs. | Xem như nó là crawler tìm kiếm tự động hoặc đào tạo. |
| robots.txt | Hướng dẫn được công bố theo tác nhân người dùng và đường dẫn. | Xem như nó là ranh giới an ninh cho nội dung riêng tư. |
| Dải IP | Chứng cứ bổ sung cho xác minh yêu cầu và chính sách mạng. | Cứng mã một dải mãi mãi mà không kiểm tra tệp được công bố. |
Tại Sao Chủ Sở Hữu Trang Web Xem Xét GPTBot
Quản trị GPTBot nằm ở giao điểm của hoạt động nội dung, hạ tầng, bảo mật và chính sách.
Chính sách thu thập dữ liệu
Các nhóm web quyết định liệu có cho phép toàn bộ trang công cộng, chặn nó, hay loại trừ các đường dẫn được chọn.
Giám sát yêu cầu
Các đội hạ tầng tách biệt lưu lượng GPTBot đã được yêu cầu khỏi tìm kiếm và các tác nhân OpenAI do người dùng kích hoạt trong nhật ký.
Danh mục nội dung
Các nhà xuất bản xác định các trang công cộng có chính sách sử dụng đào tạo khác với việc lập chỉ mục thông thường hoặc khám phá tìm kiếm.
Quản lý thay đổi
Các nhóm kiểm tra cập nhật robot, ghi lại chủ sở hữu và lý do, và theo dõi nhật ký để xem hành vi mong đợi sau khi triển khai.
Một Quy Trình Quản Trị GPTBot Thực Tế
Kiểm kê mọi nguồn gốc công khai trước tiên. Miền chính, máy chủ tài liệu, trung tâm hỗ trợ, miền phụ marketing và miền tài sản có thể phục vụ nội dung khác nhau và các tệp robots.txt khác nhau. Ghi lại chủ sở hữu và chính sách dự kiến cho mỗi nguồn gốc. Một quy tắc đơn lẻ trên trang chính không tự động áp dụng cho một tên miền khác.
Tách riêng các lớp nội dung. Tài liệu sản phẩm công cộng, trang báo chí, khu vực tài khoản, máy chủ thử nghiệm, hồ sơ do người dùng tạo, phương tiện đã cấp phép và các trang dữ liệu cá nhân có thể yêu cầu cách xử lý khác nhau. Nếu một đường dẫn là riêng tư, hãy bảo mật nó bằng xác thực. Nếu nó là công khai nhưng bị loại trừ khỏi GPTBot, hãy thể hiện sự lựa chọn đó trong quy tắc robot và ghi lại lý do chính sách.
Triển khai các nhóm robot ít gây hiểu nhầm nhất. Tránh sao chép một danh sách chặn chung mà không kiểm tra thứ tự user-agent và phạm vi đường dẫn. Lấy tệp đã triển khai từ mỗi nguồn gốc, kiểm tra phản hồi thô, và giữ nó dưới sự kiểm soát phiên bản khi có thể. Tệp robots đã lưu, được chuyển hướng hoặc đặc thù môi trường có thể làm cho kết quả sản xuất khác với kho mã.
Giám sát trước và sau các thay đổi. So sánh các yêu cầu GPTBot được yêu cầu theo tác nhân người dùng, đường dẫn, trạng thái, và mạng nguồn. Sử dụng tệp phạm vi đã công bố làm bằng chứng hỗ trợ. Bảo tồn đủ lịch sử để điều tra xem lưu lượng truy cập có thay đổi hay không, nhưng giảm thiểu dữ liệu yêu cầu cá nhân hoặc không cần thiết theo chính sách lưu giữ của trang.
Những điều mà các điều khiển của GPTBot không làm
Chặn GPTBot không tự động chặn OAI-SearchBot. OpenAI nói rằng các cài đặt là độc lập. Một nhà xuất bản muốn có khả năng tìm kiếm nhưng không muốn GPTBot thu thập thông tin có thể bày tỏ những lựa chọn khác nhau đó. Ngược lại, việc cho phép GPTBot không đảm bảo sự xuất hiện, xếp hạng, trích dẫn hoặc lưu lượng truy cập trong sản phẩm của OpenAI.
Tệp robots không mô tả lại các bộ sưu tập trước đó, và nó không phải là một giao diện xóa bỏ. Một quy tắc hiện tại chỉ cho một trình thu thập thông tin tuân thủ cách truy cập các đường dẫn theo chính sách hiện tại. Các câu hỏi về dữ liệu đã thu thập trước đây, hành vi của mô hình, hoặc quy trình xóa bỏ cần có chính sách và lộ trình hỗ trợ của nền tảng liên quan thay vì các giả định được rút ra từ nhật ký máy chủ.
Chuỗi user-agent rất dễ để bắt chước. Việc xác minh nên kết hợp giữa tác nhân đã khai báo, các dải mạng được xuất bản, hành vi yêu cầu, máy chủ và thời gian. Phần riêng biệt của OpenAI Tệp phạm vi OAI-SearchBot cũng cho thấy lý do tại sao các phạm vi nên được ghép nối với danh tính đúng đắn hơn là gộp lại thành một danh sách cho phép không phân biệt.
Quản lý trình thu thập thông tin thay đổi theo thời gian. Tên, phiên bản, phạm vi xuất bản, mục đích sản phẩm và quyền kiểm soát của quản trị viên web có thể được cập nhật. Nguồn chính xác là trang trình thu thập thông tin OpenAI hiện tại. Tài liệu hoạt động nên ghi lại khi nào chính sách được xem xét và ai sở hữu việc xem xét tiếp theo mà không đóng băng các chuỗi ví dụ không ổn định thành văn bản cố định.
Cách kiểm tra lưu lượng GPTBot
Tạo các chiều ghi log riêng cho tác nhân người dùng đã khai báo, nguồn mạng đã xác minh, nguồn gốc, loại đường dẫn, trạng thái phản hồi, byte và thời gian thu thập dữ liệu. Không nhóm tất cả các chuỗi chứa "OpenAI" vào một hàng. Sự phân biệt giữa GPTBot, OAI-SearchBot và ChatGPT-User là câu hỏi chính sách đang được đo lường.
Kiểm tra tệp robots đã triển khai từ bên ngoài đường dẫn xây dựng ứng dụng. Xác nhận máy chủ đúng, trạng thái phản hồi, loại nội dung và thân. Phân tích quy tắc với cùng một logic nhận thức tiêu chuẩn được sử dụng bởi hệ thống phục vụ. Một bình luận dễ đọc cho con người là hữu ích, nhưng chỉ các chỉ thị hợp lệ mới xác định hành vi của trình thu thập thông tin.
Xem lại phạm vi quy tắc so với danh mục nội dung. Đánh dấu các đường dẫn công khai mà không có chủ sở hữu rõ ràng, các đường dẫn cần xác thực vô tình được liệt kê như chính sách thu thập thay vì tài nguyên được bảo vệ, và các tên miền phụ với các giả định thừa kế. Ghi lại các ngoại lệ để quá trình di chuyển trang trong tương lai không vô tình phơi bày hoặc chặn một lớp trang.
Xem nhật ký như là bằng chứng, không phải là một lời hứa về việc sử dụng sau này. Nhật ký có thể cho thấy một yêu cầu đã đến máy chủ dưới một danh tính đã được khai báo và liệu máy chủ có cho phép nó hay không. Chúng không thể chứng minh cách mà một mô hình đã được huấn luyện hoặc liệu một trang nào đó có ảnh hưởng đến một phản hồi hay không. Giữ các phát hiện kỹ thuật tách biệt khỏi các kết luận chính sách hoặc pháp lý.
Kết luận
GPTBot là trình thu thập thông tin đã được OpenAI tài liệu hóa cho nội dung có thể được sử dụng trong việc đào tạo các mô hình nền tảng AI sinh. Các chủ sở hữu trang web quản lý sở thích thu thập thông tin của nó thông qua một nhóm GPTBot trong robots.txt và có thể sử dụng các dải IP đã được OpenAI công bố như bằng chứng yêu cầu bổ sung.
Di chuyển quan trọng trong hoạt động là sự tách biệt. GPTBot, OAI-SearchBot và ChatGPT-User có mục đích được nêu ra khác nhau. Các trang web nên quản lý chúng một cách độc lập, bảo mật nội dung riêng tư với các biện pháp kiểm soát truy cập thực, và xem xét tài liệu chính thức hiện tại trước khi thay đổi chính sách sản xuất.
Sẵn sàng xây dựng một quy trình làm việc dữ liệu web có quản lý?
Sử dụng Scrapeless Universal Scraping API cho việc thu thập web công khai được phép của bạn trong khi duy trì các chính sách crawler riêng biệt, nguồn gốc và kiểm soát quyền truy cập.
Đăng ký hôm nay và nhận $5 trong tiền tín dụng miễn phí — không yêu cầu thẻ tín dụng.
Đòi lại tín dụng $5 của bạn →Câu hỏi thường gặp
GPTBot làm gì?
GPTBot thu thập nội dung web mà OpenAI cho rằng có thể được sử dụng để làm cho các mô hình AI nền tảng tạo ra của nó hữu ích và an toàn hơn.
Có phải việc chặn GPTBot sẽ xóa một trang khỏi tìm kiếm của ChatGPT?
Không, một mình nó không làm như vậy. OpenAI tài liệu hóa OAI-SearchBot như là công cụ kiểm soát khả năng hiển thị tìm kiếm của ChatGPT và tuyên bố rằng cài đặt của nó độc lập với GPTBot.
ChatGPT-User có giống với GPTBot không?
Không. ChatGPT-User liên quan đến một số lần truy cập do người dùng kích hoạt, trong khi GPTBot là một trình thu thập tự động định hướng đào tạo.
Làm thế nào một trang có thể chặn GPTBot?
Một trang có thể công bố một nhóm robots.txt cho tác nhân người dùng GPTBot và không cho phép các đường dẫn liên quan. Nội dung riêng tư cũng nên được bảo vệ bằng cách xác thực.
Có phải chuỗi tác nhân người dùng có thể chứng minh rằng một yêu cầu đến từ OpenAI không?
Không. Văn bản tác nhân người dùng có thể bị sao chép. So sánh nó với các dải IP đã được công bố của OpenAI và bằng chứng mạng cũng như yêu cầu của trang web đó.