ソフト404とは?原因、SEOへの影響、修正ガイド

ソフト404とは?

スクレイプレスユニバーサルスクレイピングAPIは、HTTPステータスと表示コンテンツを比較し、ソフト404を検出する必要のあるデータワークフローのためにレンダリングされた公開ページを取得します。

要約

  • ソフト404とは、正確な技術的境界を持つ。 ソフトという言葉は、エラーがHTTPレスポンス内で宣言されるのではなく、コンテンツから推測されることを意味します。「ソフト404」プロトコルコードは存在しません。本当に存在しないページは通常404 Not Foundを返すべきですが、置き換えなしに意図的に削除されたコンテンツは410 Goneを返すことができます。関連する置き換えは、恒久的なリダイレクトを使用できます。
  • カスタムエラーテンプレートが200を返すのは一般的な原因です。 アプリケーションは、親しみやすい欠落ページコンポーネントをレンダリングしますが、HTTPレスポンスステータスを設定しません。ユーザーはエラーを見ますが、クローラーはプロトコルの成功を見ます。
  • クローラーの視点は、安全な次のステップを変更します。 サーバーが実際の404ステータスを返した場合、カスタム404ページはソフト404ではありません。ブランドデザインと役立つナビゲーションは、正しいHTTPセマンティクスと互換性があります。
  • 置き換えが存在しない場合は404または410を返します。 カスタムエラーページを有用に保ちますが、正直なステータスを送信します。
  • データパイプラインでのソフト404の検出は、明示的な分類を必要とします。 ソフトエラーページを検索インデックス、取得コーパス、分析データセットから排除します。クリーンなパイプラインは、ナビゲーションクロムと「見つかりません」のメッセージをソースコンテンツのように埋め込むのではなく、欠如を明示的に報告します。

ソフト404はコンテンツとステータスの不一致です。

ソフト404は、URLが成功ページのように応答しますが、そのレンダリングされたコンテンツがリソースが欠落している、空である、またはその他の理由で利用できないことを示します。最もよく知られているケースは、HTTP 200 OKで返されたスタイル付きの「見つかりません」ページです。サーバーは成功を主張しますが、ページは失敗を伝えます。

検索エンジンは、実際のページとしてエラーテンプレートをインデックスすると結果が汚染されるため、この不一致を検出するためにコンテンツシグナルを使用します。Google Search Consoleは、影響を受けたURLをソフト404として報告し、通常それらを検索から除外します。このラベルは、クローラーの解釈によって生成され、別のHTTPステータスコードによって生成されるものではありません。

ソフト404の検出は、SEOの外でも重要です。データパイプラインは、ナビゲーションシェル、チャレンジページ、空のクライアントレンダリングルート、または空の検索結果を有効なコンテンツとして取り込むことができます。信頼できる取得は、ステータス、最終URL、タイトル、ボディシグナル、および期待されるページ構造を一緒に検証します。

ソフト404の直接的な定義

ソフト404は、応答が成功を示すか、見かけ上成功したページにリダイレクトしながら、レンダリングされたコンテンツが欠落リソースエラーのように振る舞うURLです。 Google Search Central は、ページが存在しないと述べているが200を返すという古典的なケースを説明します。

ソフトという言葉は、エラーがHTTPレスポンス内で宣言されるのではなく、コンテンツから推測されることを意味します。「ソフト404」プロトコルコードは存在しません。本当に存在しないページは通常404 Not Foundを返すべきですが、置き換えなしに意図的に削除されたコンテンツは410 Goneを返すことができます。関連する置き換えは、恒久的なリダイレクトを使用できます。

検索システムがエラーに似たコンテンツを認識する方法

クローラーはURLを取得し、リダイレクトに従い、最終ステータスを記録し、重要なリソースをレンダリングし、表示されるコンテンツを評価します。目立つ欠落ページメッセージ、主要コンテンツなし、または知られているエラーページとほぼ同一のテンプレートでの200レスポンスは、ソフト404として分類される可能性があります。

クライアント側のレンダリングはプロセスを難しくします。最初のHTMLは有効なアプリケーションシェルである可能性がありますが、JavaScriptが後で欠落リソース状態を表示します。スクリプトがクローラーのために失敗した場合、レンダリングされたページも空またはほぼ空である可能性があります。したがって、診断は生の応答、レンダリングされた出力、およびリソースロードの失敗を比較する必要があります。

リダイレクトは同じ結果を生むことがあります。すべての未知のURLをホームページに送信すると成功ページが返されますが、そのページは元の意図を満たさない場合があります。検索システムは、目的地を意味のある置き換えではなく、エラーに似た代替品として扱う場合があります。

次元信号A信号B
欠落しているURL404または410「見つかりません」のコンテンツ付き200
関連する置き換え同等のコンテンツへの301無関係なホームページへのリダイレクト
既存のページ実質的な主要コンテンツ付き200空または壊れたレンダリング付き200
カスタムエラーデザイン役立つページと実際の404役立つページと偽の成功

ソフト404を作成するパターン

ソフト404は通常、CMSのデフォルト、広範なリダイレクトルール、レンダリング失敗、薄い生成ルート、または本文のみを変更するエラーハンドリングから生じます。

カスタムエラーテンプレートが200を返す

アプリケーションは、親しみやすい欠落ページコンポーネントをレンダリングしますが、HTTPレスポンスステータスを設定しません。ユーザーはエラーを見ますが、クローラーはプロトコルの成功を見ます。

不明なURLはホームページにリダイレクトされる

すべての欠落したパスを1つの成功した宛先に送信するキャッチオールルール。ターゲットはリクエストされたリソースと同等ではないため、リダイレクトは欠落ページの状態を解決しない。

空の内部検索結果

生成された検索URLは、意味のある結果コンテンツなしで完全なテンプレートを返すことがある。空のクエリの大規模な組み合わせは、多くのインデックス可能で低価値なページを作り出す。

クライアントレンダリングが失敗する

ブロックされたスクリプト、壊れたバンドル、APIの失敗、または水和エラーは、サーバーが200を返したにもかかわらず、シェルまたは空のメインエリアを残す。

データベースまたはインクルードの失敗がマスクされる

ページハンドラーは、欠落したレコードまたはテンプレートインクルードエラーをキャッチし、成功した応答コードを変更することなく一般的なボディをレンダリングする。

薄い生成ページは不在に似ている

ファセット、タグ、プロフィール、または位置ルートは技術的には存在するかもしれないが、クローラーがそれらをエラーのように解釈するほど固有のメインコンテンツが非常に少ない。

レスポンスとレンダリングされたページを一緒に監査する

ソフト404監査は、キャッシュリソースが読み込まれた後にサインインしたブラウザが表示するものだけではなく、クローラーが受け取るものを再現する必要がある。

  1. 報告されたURLから始める。 URLインスペクションまたは同等のレンダーフェッチを使用して、最終URL、ステータス、スクリーンショット、およびレンダリングされたHTMLをキャッチする。
  2. 生のコンテンツとレンダリングされたコンテンツを比較する。 サーバーがエラーボディを直接送信するか、JavaScriptが成功したシェルを欠落状態に変換するかを判断する。
  3. 重要なリソースをチェックする。 欠落したスクリプト、ブロックされたAPI呼び出し、およびサーバーエラーは、ナビゲーションがまだレンダリングされている間にメインコンテンツを消去できる。
  4. テンプレートの類似性を調査する。 タイトル、見出し、本文のフレーズ、およびレイアウトをサイトの既知の404テンプレートおよびホームページと比較する。
  5. 意図したリソースの状態を分類する。 コンテンツが失われたのか、関連する代替に移動したのか、またはまだ存在するがレンダリングに失敗したのかを決定する。
  6. URLファミリーをテストする。 同じCMSまたはルーティングルールを見つけるために、姉妹製品、検索、タグ、ロケール、およびファセットルートをサンプルし、1つのURLを修正するのではなく、共有する。
  7. リリース後に検証する。 クローラーが変更を確認した後のライブステータス、レンダリングされたコンテンツ、内部リンク、サイトマップメンバーシップ、およびSearch Consoleの状態を確認する。

ソフトエラーの定義は Google検索のソフト404ガイダンス、404の意味は MDNの404リファレンス、そして広範なステータスリファレンスは HTTPセマンティクス プロトコルとコンテンツの両方が検査を必要とする理由を確立する。

リソースの状態に合った修正を選ぶ

修正は、コンテンツが失われたのか、移動したのか、まだ存在する予定なのかによって異なる。

  • 代替が存在しない場合は404または410を返す。 カスタムエラーページを有用に保ちつつ、正直なステータスを送信する。
  • 関連する恒久的な代替には301を使用する。 すべての欠落したパスをホームページに送信するのではなく、古いURLを個別にマッピングする。
  • 有効なページの実質的なコンテンツを復元する。 メインコンテンツが存在するようにブロックされたリソース、データ読み込み、テンプレート、およびサーバーレンダリングを修正する。
  • 空の生成ページを制御する。 無制限の検索およびファセットの組み合わせがインデックス可能な内部リンクされたURL在庫にならないようにする。

テンプレートにソフト404予防を構築する

正しいステータス処理は、すべてのコンテンツタイプが一貫して動作するように共有ルーティングおよびレンダリングコンポーネントに属する。

欠落したレコードの処理でカスタムエラーテンプレートをレンダリングする前にステータスを設定する。サーバーレンダリングされたアプリケーションでは、これはルートまたはフレームワーク応答に属する。クライアントレンダリングシステムでは、アプリケーションシェルが成功を返す前に不在を表現できるサーバーまたはエッジの応答を提供する。

代表的な欠落URLの自動チェックを作成する。最終的なステータス、タイトル、カノニカルターゲット、メインコンテンツの存在、インデックス可能な成功メタデータの欠如を主張する。ソフトエラーが二次テンプレートに隠れていることが多いため、ロケール、ページネーション、製品、プロフィール、およびクエリルートを含める。

サイトマップと内部リンクをクリーンに保つ。削除されたURLでいっぱいのサイトマップは繰り返しクローリングを招き、キャッチオールリダイレクトへの内部リンクはサイト独自のcanonicalグラフが古くなっていることを示す。ソースリファレンスを修復し、宛先レスポンスだけでなく。

ソフト404とリアル404とリダイレクト

正しい結果はリソースが存在するかどうかと、同等の置き換えが利用可能かどうかに依存する。

ケース意味推奨されるレスポンス
ソフト404エラーのようなコンテンツを持つ成功のようなステータスステータス、コンテンツ、またはレンダリングを修正
リアル404リソースが見つからず、レスポンスが404を示す置き換えが存在しない場合は保持
410 Goneリソースが意図的に削除された永続的な削除が明示的な場合に使用
301リダイレクト同等のコンテンツが永続的に移動した関連する置き換えに直接ポイントする

データパイプライン内でのソフト404の検出

その Scrapeless Universal Scraping API はレンダリングされた公開ページのコンテンツを返すことができ、これによりコレクションワークフローがユーザーが実際に見るものを評価できる。レンダリングビューはステータスと最終URLとともにチェックされるべきであり、成功したターゲットページの証拠として扱われるべきではない。

必要な製品タイトル、記事本文、結果の数、または安定したスキーマフィールドなどのホスト固有の期待を使用する。空の主コンテナ、チャレンジインタースティシャル、ログイン回り道、近似複製エラーテンプレートに対する欠如ページフレーズのための一般的な信号を追加する。偽陽性を見直せるように分類証拠を保存します。

ソフトエラーページを検索インデックス、取得コーパス、および分析データセットから除外する。クリーンなパイプラインはナビゲーションクロームや「見つかりません」というメッセージを埋め込むのではなく、欠如を明示的に報告する。

ステータスをページが実際に言っていることに一致させる

ソフト404は特別なプロトコルレスポンスではない。それは成功したトランスポートメタデータが欠如、空、またはエラーのようなレンダリングコンテンツと矛盾することを示すクローラーの診断である。

置き換えがないコンテンツには404または410を返し、同等の移動には直接の永続リダイレクトを使用し、ページが存在すべき時にはレンダリングを修正する。その後、影響を受けたURLファミリー全体でステータスと可視の主コンテンツを確認する。

より観察可能なデータワークフローを構築する準備はできましたか?

データセットにページが入る前に、ステータス、アイデンティティ、ルーティング、およびレンダリングコンテンツのための明示的な検証ルールを使用する。

今すぐサインアップして、 $5の無料クレジットクレジットカードは不要.

あなたの$5クレジットを請求する →

FAQ

カスタム404ページはソフト404を作成しますか?

サーバーが実際の404ステータスを返す場合、カスタム404ページはソフト404を作成しません。問題は、エラーページが200を返すか、無関係な成功ページにリダイレクトすることによって生じる不一致です。

ソフト404はインデックス作成に影響しますか?

検索システムは通常、ソフト404として分類されたページを除外します。なぜなら、成功のようなレスポンスにもかかわらず、コンテンツが欠如しているか非機能的に見えるからです。大規模なソフトエラー在庫もクローリングの注意を無駄にし、真のサイトの欠陥を隠す可能性があります。

すべてのソフト404がホームページにリダイレクトすべきですか?

ソフト404のURLはすべてホームページにリダイレクトすべきではありません。近くの関連する置き換えが存在する場合にのみリダイレクトし、それ以外の場合は有用なカスタムエラーページと共に404または410を返します。

有効なページがソフト404として誤分類される可能性がありますか?

重要なリソースが失敗し、レンダリングされた主コンテンツが空白であるか、ページがあまりにも少ない独自の情報を含む場合、有効なページがソフト404に分類されることがあります。クローラーがレンダリングした出力を検査し、期待されるコンテンツを復元する。

スクリーパーはどのようにソフト404を検出できますか?

スクリーパーはステータス、最終URL、タイトル、主コンテンツの構造、既知のエラーフレーズ、およびサイトのエラーテンプレートとの類似性を比較できます。ホスト固有のコンテンツ期待は、単一のグローバルワードリストよりも信頼性があります。

参考文献