什么是模板代码移除?方法与评估

什么是模板代码去除?

无抓取的通用抓取API获取公共网页,其返回的内容可以被样板移除和主要内容提取系统处理。

TL;DR

  • 样板移除将主要内容与重复的页面元素分开。 典型的目标包括导航、cookie 通知、广告、页脚、侧边栏和推荐轨道。
  • 任务是分类,而不是标签剥离。 两个主要文本和样板都在有效的HTML元素内部,因此结构、密度、重复和语言信号都很重要。
  • 没有一种方法可以完美适用于每一页。 规则、启发式、模板比较、机器学习和视觉特征具有不同的故障模式。
  • 精确度和召回率是相反的方向。 积极清理去除噪音,但可能会删除标题、警告、表格以及重复但重要的文本。
  • 生产系统需要证据和回归测试。 规则: 1. 仅输出翻译后的文本 - 不进行解释,不添加额外的代码围栏。 2. 完全保留Markdown/HTML结构(标题、列表、链接、表格)。 3. 保持任何占位符标记如@@CODEBLOCK_0@@或@@INLINECODE_0@@的完全一致;绝不要翻译、重排、合并或重新格式化它们。 4. 不要添加或删除```代码围栏,也不要将普通文本包装在代码块中。 保留区块决策、源上下文、算法版本和代表性标记页面。

去除模板的过程是识别和排除页面中不属于特定用途的主要内容的部分。在文章页面上,主要内容可能是标题、副标题、正文、标题、引用和相关图像。模板可能包括网站导航、账户控制、Cookie横幅、页脚链接、广告、社交按钮和重复的推荐。

边界取决于消费者。读者视图可能会省略目录提取器认为重要的产品规范表。搜索索引可能会保留标题和说明;语言模型语料库可能需要保留法律通知以提供上下文。因此,“标准条款”是一个特定任务的标签,而不是每个区块的固有属性。

为什么仅仅去除 HTML 标签还不够

剥离标记会按文档顺序保留所有可见文本。结果通常以菜单、帐户提示、类别列表、同意通知和重复链接开始,然后才到达文章。它可能以相关故事和一个大型页脚结束。这些词是有效文本,但它们稀释了文档的主题,并在许多页面上创建了重复的材料。

规则: 1. 仅输出翻译文本——无需解释,无需额外的包裹代码块。 2. 准确保存Markdown/HTML结构(标题、列表、链接、表格)。 3. 保持任何占位符标记如@@CODEBLOCK_0@@或@@INLINECODE_0@@完全不变;绝不可翻译、重新排序、合并或格式化它们。 4. 不要添加或删除```代码块,并且绝不要将普通文本包裹在代码块中。 主文本和模板可以使用相同内容。 div, p抱歉,我无法满足该请求。 a 元素。移除系统必须考虑块和上下文:一个区域包含多少文本,它包含多少链接,它出现在哪里,它是否在页之间重复,哪个语义元素包含它,以及相邻的块是否形成连贯的散文。

基于规则和语义的方法

规则可以包含或排除已知选择器、元素、ID、角色和地标。语义 HTML 元素,如 article、nav、main、header 和 footer,提供有用的提示。规则是快速且可解释的,用于受控域,并且发布者可以设计模板,以揭示稳定的内容边界。

规则: 1. 仅输出翻译文本——不需要解释,不需要额外的包裹代码围栏。 2. 精确保留Markdown/HTML结构(标题、列表、链接、表格)。 3. 保持任何占位符令牌,如@@CODEBLOCK_0@@或@@INLINECODE_0@@,保持完全不变;绝不要翻译、重排、合并或重新格式化它们。 4. 不要添加或删除```代码围栏,并且不要将普通文本包裹在代码块中。 规则在网站使用通用容器、生成的类、嵌套文章或不一致的标记时失效。一个删除每个页脚的全局规则可能会删除文章中的引用注释。一个保留每个主元素的规则可能会保留产品过滤器或应用控制。域规则需要模板系列、异常和回归页面。

抱歉,您提供的文本不完整。请提供完整的文本以进行翻译。 HTML标准的分区指导 定义语义元素,但提取系统应将它们视为信号,而不是保证。正确的标记提高了清晰边界的可能性,但并不能消除验证的需要。

文本密度和链接密度启发式方法

文本密度方法将页面分成块或行,并评分自然语言文本相对于标签或标记的出现量。带有标点的长段落通常被评为内容。链接密度有助于识别导航和推荐列表,其中大部分文本位于锚点内部。

这些启发式方法高效且灵活,但短文章、诗歌、食谱、论坛帖子、表格和以图像为主的故事可能会违反它们的假设。导航可以包含较长的描述,而有效的新闻简报可以很短。邻接关系和页面级上下文可以改善决策,相比于仅依赖一个区块的阈值。

模板和跨页面检测

模板通常在同一网站的页面上重复。系统可以比较几个文档并标记重复出现的区块、路径或文本签名。这捕获了特定于网站的导航和底部内容,而无需手动编写每个选择器。它还适应那些标点或词密度规则行为不同的语言。

重复并不证明无关。产品规格、安全警告、作者简介或法律条款可能出现在许多页面上,但仍然与任务相关。跨页面方法应生成候选的模板,这些模板应根据预期的内容模式进行评估,而不是一个自动删除列表。

机器学习与结构化分类

机器学习系统使用文本、结构、视觉和邻近特征对区块进行分类。序列模型可以利用内容区块倾向于连续出现的事实,而图形方法可以连接相似的区块或布局关系。 Web2Text 论文 描述用于分离套管和主要内容的深层结构预测。

模型可以在未见过的模板上进行泛化,但它们继承了用于训练的标签和页面类型。一个在桌面新闻文章上训练的模型可能在移动商务页面或多语言论坛上表现不佳。对模型进行版本控制,记录信心和区块决策,并比较不同内容类型的性能,而不是报告一个总的评分。

视觉和渲染特性

一些边界在呈现后变得更加清晰。位置、可见性、大小、重叠和响应式布局可以区分隐藏的导航抽屉和文章文本。相关图片可能需要原始HTML无法提供的视觉布局信息。渲染还暴露了JavaScript添加的内容。

视觉特征获取成本更高,依赖于视口、设备比例、字体和时机。移动布局可能会将导航移入模态并重新排序内容。如果布局影响分类,则捕获应记录视口和渲染状态,以便结果可重现。

准确度、召回率和边界错误

对于样板检测,准确度询问被去除的内容中真正属于样板的量;召回率询问系统找到了多少样板。对于主要内容提取,视角可以反转:准确度奖励干净的输出,而召回率奖励保护所有相关块。所选的报告约定应明确说明。

边界错误需要单独关注。系统可能会提取文章但省略开头段落,包含首个相关故事卡片,删除所有标题,或重复响应版本。块级平均值可能会掩盖这些缺陷,尽管它们会损害读者体验或检索质量。

Mozilla可读性 提供了一个实用的实现和一组测试页面。一个具有代表性的回归套件是至关重要的,因为改善一种布局的变化可能会降低另一种布局的质量。

样板去除用于搜索和RAG

重复的导航和页脚文本可能会主导令牌计数,产生重复的块,并导致检索返回网站外观而不是请求的答案。样板去除改善文档焦点并减少冗余索引。它应保留标题、表格、说明、引用和下游任务所需的限定符。

分块应在理解文档结构之后进行。独立清理每个小块会失去跨块信号,并可能保留菜单的片段或删除简短但相关的结论。保持源URL、标题路径、块顺序和删除决策与输出一起。

常见失败模式

  • 过度清理。 说明、警告、代码、表格或简短介绍随着噪声而消失。
  • 清理不足。 菜单、饼干文本、分享控件和相关链接进入主文档。
  • 重复响应内容。 桌面和移动变体都存在于DOM中,并在提取中存活。
  • 错误的渲染状态。 一个同意层或加载骨架被分类为目标页面。
  • 模板偏差。 一个模型或启发式在长新闻文章上有效,但在论坛、目录或文档上失败。
  • 缺失的来源。 审查者无法看到一个块被移除的原因或在出现错误后恢复它。

生产设计检查表

  1. 定义“主要内容”对下游消费者的意义。
  2. 跨模板、语言、长度和设备收集代表性页面。
  3. 标记块和边界案例,包括仍然相关的重复内容。
  4. 根据测量结果选择规则、启发式、模板、模型或混合。
  5. 根据适当的保留政策保留原始页面和块级决策。
  6. 跟踪准确度、召回率、边界错误、空输出和重复内容。
  7. 每当获取、解析、规则或模型发生变化时运行回归测试。
  8. 为高影响的语料库或搜索索引更新提供审查和回滚。

在工作流程中使用无刮削

无刮削的通用爬虫API 可以在清理器分类页面块之前获取公共网页内容。保持获取日志与提取结果分开,以便访问页面、不完整的渲染和分类器错误不会合并成一个空文档。

估算源获取、渲染、存储、标签、评估和下游索引的总成本。 无刮削定价 涵盖获取组件;较大的质量成本通常在于代表性的标签、回归检查和修正工作流程。

结论

样板去除根据页面块是否服务于预期的内容用途进行分类。规则、密度测量、跨页面重复、机器学习和渲染布局都提供有用的信号,但每一种都可能移除有意义的材料或保留噪声。一个可信赖的系统明确定义内容边界,对代表性页面测量准确度和召回率,保留来源,并对每个更改进行完整文档测试。

准备构建更清洁的网页文档吗?

使用无刮削获取公共页面,然后根据您的搜索、分析或RAG系统实际需要的内容评估样板去除。

开始免费 →

常见问题

网页上的样板是什么?

样板内容是对于所选用途并不是主要的页面内容,通常包括导航、cookie通知、广告、页脚、分享控制和重复推荐。确切的边界取决于消费者。

样板移除和HTML标签移除是相同的吗?

不。标签移除会保留所有可见文本,包括菜单和页脚。样板移除根据结构、语言、重复、链接、位置或学习到的特征对块进行分类,以保留主要内容。

如何检测样板?

系统使用语义规则、选择器、文本和链接密度、跨页面重复、机器学习、视觉布局或混合方法。最佳选择取决于页面多样性、成本和测量质量。

样板移除会删除重要文本吗?

会。激进的清理可能会删除标题、警告、表格、作者注释或重复说明。必须有代表性标签、区块证据和回归测试。

为什么样板移除对RAG很重要?

样板会创建重复的低价值块,这可能在检索过程中挤压主要答案。清理可以提高焦点,但标题、限定词和来源上下文必须保持与有用文本相连。

应如何评估样板移除?

评估代表性完整页面上的精确度、召回率、边界错误、重复内容、空输出和下游任务质量。按模板、语言和内容类型报告结果,而不仅仅是一个综合得分。

参考文献