什么是PerimeterX?HUMAN Bot Defender和爬虫解释

什么是PerimeterX?

Scrapeless Scraping Browser运行管理的浏览器会话,用于依赖于浏览器执行和导航状态的公共数据工作流。

PerimeterX是一家网络安全公司,以机器人和账户滥用保护而闻名,并于2022年与HUMAN Security合并。在当前的机器人管理讨论中,相关产品是HUMAN Bot Defender。PerimeterX的名称仍然出现在旧文章和集成标识符中,因此了解命名历史有助于您找到正确的文档。

对爬虫开发者来说,有用的问题不仅仅是一个网站“是否使用PerimeterX”。确定您的客户收到了什么,请求的工作流是否被允许,以及公共页面所需的浏览器或应用程序行为。仅仅一个产品名称并不能揭示网站配置的政策。

PerimeterX发生了什么?

PerimeterX和HUMAN Security在2022年宣布的合并中结合在一起。 HUMAN和PerimeterX合并公告 确立了旧名称与当前组织之间的关系。

在调查集成时,搜索当前的HUMAN文档以及历史的PerimeterX标识符。软件包名称、配置标签和操作说明在公司更改其产品展示后可能保留旧术语。这样的命名延续并不能证明集成已过时或每个当前功能都存在于旧产品中。

在事件报告中要具体。“页面返回了一个HUMAN品牌的挑战”是一个观察。“完整的PerimeterX检测堆栈拒绝了我们的TLS指纹”是一个需要证据的更强声明,通常可见的错误页面并不会提供。

HUMAN Bot Defender如何评估请求

HUMAN Bot Defender将客户端观察与检测和执法组件结合在一起。它的 Bot Defender检测模型 描述了传感器、检测器和执法者,并在流量处理时使用每个请求的风险评估。

传感器收集客户端观察,检测器评估活动,执法者在部署的集成中应用结果。这种分离很重要,因为可见的浏览器症状可能在最终政策决定的不同阶段出现。脚本加载问题和故意拒绝不应被报告为相同事件。

对于所有者,使用配置的产品和事件证据找到故障阶段。对于访问者,描述可观察到的内容:页面是否加载,是否出现交互屏幕,以及是否提供了预期内容。不要虚构内部评分或声称解码不透明的安全值。

为什么基于传感器的工作流与简单抓取不同

浏览器可以执行脚本并保持交互页面所需的状态,而基本的HTTP抓取并不能重现整个浏览器生命周期。这种差异可能影响应用程序行为和流量验证。

对于授权的自动化,首先决定目标是否确实需要浏览器。有些公共资源直接返回其数据;其他资源在文档加载后组装内容。根据观察到的页面合同选择运行时,而不是基于每个受保护网站需要相同处理的 blanket assumption。

当需要浏览器时,请保留允许的导航顺序。位置选择或同意交互可以更改可用页面。将所选上下文附加到提取的数据,以便后续分析师理解所观察到的内容。

状态并不意味着无限制的访问。 HTTP cookie机制 在请求之间传递信息,但与该状态相关的意义和特权是特定于应用的。不要重用他人的cookie或将安全cookie视为记录的API凭证。

可见情况可能的解释有用的诊断措施
初始文档加载,所需内容未出现应用程序或其验证流程尚未完成。检查可见文档和所需的公共页面步骤。
出现交互挑战当前请求需要进一步验证。遵循允许的流程,如无法合法完成则停止。
访问被拒绝响应出现政策已拒绝请求。保留请求标识符并与所有者联系。
只有一个路线失败该路线可能有不同的应用或安全要求。将该路线的访问合同与成功的路线进行比较。
旧集成名称出现历史标识符可能仍然存在于当前集成中。通过当前所有者方文档确认已安装的产品。

调查可疑的PerimeterX拦截

可疑的PerimeterX或HUMAN拦截应从返回的表示和允许的工作流程进行调查。首先收集能够区分安全响应与常规应用状态的证据。

  1. 记录请求的公共URL、最终URL、响应状态和页面标题。
  2. 识别任何明确的挑战或拒绝文本,并保留可见的参考标识符。
  3. 确认比较浏览器与收集器具有相同的访问权。
  4. 检查内容是否需要脚本和公共页面导航步骤。
  5. 测量综合工作负载,而不是单独检查一个工作者。
  6. 在政策拒绝处停止,并询问网站所有者已批准的收集路线。

想象一个公共票务信息页面,显示事件细节,但将购买放在单独的流程后。一个只读的收集任务应在公共信息边界处停止。两个页面共享域名的事实并不使得预订或购买操作成为同一允许任务的一部分。

例如,对于一个目录,检查一个空结果是否确实是一个空目录。如果文档包含挑战,记录获取失败。这防止安全响应成为关于产品可用性的错误陈述。

网站所有者在集成变更期间应测试的内容

网站所有者在改变浏览器集成、请求路由或执行政策时应测试合法的应用流程。安全集成必须与网站的实际加载和导航行为共存。

构建一小组代表性批准的旅程:第一次访问公共页面,导航至详细页面,如果需要则更改位置,以及一个批准的监控请求。记录每个请求的预期内容和安全结果。目的是验证预期行为,而不是创建所有客户端应模仿的通用指纹。

当合法集成受到影响时,审查其身份和范围。针对所有共享地址的流量的广泛例外可能包括不相关的用户。更倾向于有明确文档的集成协议和能够被检查和撤销的例外。

在审查中包含可及性和正常浏览器差异。不要假设每个访问者采用相同的指针移动或交互顺序。兼容性事件应根据应用程序支持的使用进行评估,而不是狭窄的关于人类访问如何应当呈现的视角。

Bot保护想要防止的内容

Bot保护针对可能危害应用可用性、账户或商业工作流程的自动化活动。 OWASP自动化威胁分类 区分诸如账户滥用和应用功能误用等目标。

这就是为什么“自动化”和“恶意”不应该可以互换使用。所有者可能欢迎经过验证的搜索爬虫并批准合作伙伴监视,同时拒绝不相关的收集器。目的、权利和请求模式对访问安排都很重要。

在收集之前,记录源、字段、业务目的和保留要求。当没有必要时,保持个人数据远离诊断捕获。如果访问条件变化,暂停受影响的收集,并审查范围,而不是将原始协议视为永久。

无抓取抓取浏览器的用途

无抓取抓取浏览器 在需要管理的浏览器运行时的授权公共页面上很有用。它提供浏览器执行,同时您的应用程序仍然负责收集范围和返回数据的验证。

无抓取抓取浏览器文档 开始,仅选择您工作流程所需的功能。保持相关导航在一致的上下文中,检查生成的页面,并从正常数据路径中拒绝拒绝屏幕。浏览器服务不会修改第三方网站上的HUMAN Bot Defender政策。

关于 HUMAN和PerimeterX公共页面收集 的相关讨论提供了有关客户身份为何具有多个可观察维度的背景。它不应被解读为证据,表明每个维度决定了每个HUMAN安全决策。

比较 无抓取定价 与目标允许的工作负载。对于一个小的公共数据集,操作的清晰可能比最大并行性更为重要。确保收集者的停止条件和证据记录对负责访问的团队来说是可理解的。

结论

PerimeterX是HUMAN当前Bot保护产品背后的历史的一部分。使用当前的产品文档,将观察到的响应与推测的检测逻辑区分开来,并保持自动化在批准的范围内。一个设计良好的收集器验证其接收的页面并记录访问失败,而不会将其转化为错误的商业事实。

保持您的浏览器工作流程和访问范围清晰

收集使用显式导航、输出检查和在拒绝处干净停止的允许公共页面。

立即注册并获得 $5的免费信用无需信用卡.

领取您的$5信用 →

常见问题

PerimeterX仍然是一个独立的公司吗?

PerimeterX在2022年与HUMAN Security合并。当前的Bot保护研究应包括HUMAN Bot Defender文档,同时注意到较旧的名称可能仍留在集成标识符和历史文章中。

PerimeterX Cookie是否揭示了整个检测决策?

一个cookie名称并不揭示完整的检测决策。安全值可能是不透明和特定于应用的。使用当前的产品文档和所有者端事件,而不是将浏览器中观察到的值分配一个未经验证的内部含义。

公共信息是否仍可受Bot规则保护?

公开信息仍可能受网站的流量和自动化政策的影响。在浏览器中的可见性并不赋予无限制的收集权利。确认批准的使用和数量,并在适当的情况下寻求导出或集成协议。

JavaScript 执行是否证明收集将成功?

JavaScript 执行并不能证明收集会成功。它提供了页面可能需要的浏览器行为,但网站仍然控制访问,并且应用程序可能需要额外的权限步骤。在提取数据之前验证结果表示。

参考文献