
ゲストライター
この記事はAhrefs公式ブログの日本語訳です。
原文:How to Get Google to Index Your Website
(著者:Joshua Hardwick 原文の最終更新日:April 30, 2019)
この記事を読んでいるということは、おそらく上に書いた言葉は初めて聞く話ではないということでしょう。では、さっそく本題に入りましょう。
この記事では、下記3つの問題のいずれかを解決する方法をご紹介します:
まずは、インデックス化に関する問題を完全に理解しているかどうか、確認しましょう。
Googleは、Webをクロールすることによって新しいWebページを発見し、そのページをインデックスに追加しています。この作業は、Googlebotと呼ばれるWebスパイダーを使用して行われます。
よくわかりませんか? いくつの重要な用語の定義を見ていきましょう。
ここでは、Google検索を対象とした動画で詳しく解説しています:
Googleで何かを検索するとき、あなたはGoogleにインデックスからすべての関連ページを返すように求めています。適合するページが何百万もあるため、Googleのランキングアルゴリズムは、最良で最も関連性のある結果を最初に表示するようにページを並べ替えるために最善を尽くします。
ここで私が強調したい重要なポイントは、インデックスとランキングは別物であるということです。
インデックスは「(上位表示の)レースに参加すること」を意味し、ランキングは「(上位表示するという)勝利」を意味します。
すなわち、レースに参加しなければ、勝つことはできません。
Googleにアクセスし、「site:yourwebsite.com(自社サイトのURL)」と検索します。
※yourwebsite.comには、知りたいドメインを入力してください。
上記の数字は、Googleがインデックスしたあなたのページの大まかな数を示しています。
特定のURLのインデックス状況を確認したい場合は、同じ
「site:yourwebsite.com/web-page-slug」オペレータを使用します。
ページがインデックスされていない場合、結果は表示されません。
なお、Google Search Consoleのユーザーである場合は、Coverageレポートを使用してWebサイトのインデックス状況について、より正確な洞察を得ることができます。
下記のように進めてください:
Google Search Console > インデックス > Coverage
警告付きの有効なページの数を確認してください。
上記赤枠の2つの数字が、ゼロ以外の何かを合計していれば、GoogleはあなたのWebサイトのページのうち、少なくとも一部をインデックスしています。そうでなければ、あなたは深刻な問題を抱えています。なぜなら、Webページのどれもインデックスされていないからです。
注:
また、Search Consoleを使用して特定のページがインデックスされているかどうかを確認することもできます。そのためには、URLをURL検査ツールに貼り付けます。
そのページがインデックスされていれば、「URLはGoogle上にあります」と表示されます。(※下記参照)
ページがインデックスされていない場合、「URLはGoogle上にありません」と表示されます。
WebサイトまたはページがGoogleでインデックスされていないことがわかったら、次の手順を試してみてください:
このプロセスは、新しい投稿やページを公開するときに行うのがお勧めです。Googleへ「Webサイトに新しいページを追加したので、見てください」と効果的に伝えることになります。
しかし、インデックスを申請しても、Googleが古いページをインデックスするのを妨げている深刻な問題を直接解決するわけではありません。そういった問題がある場合、以下のチェックリストに従い、問題の原因を特定し、それを解決する手順に進んでください。
すでに試したことがある人もいるかもしれませんが、それぞれの戦術を簡単に紹介します:
GoogleはあなたのWebサイト全体をインデックスしていない状態ですか? それは、robots.txtファイルのクロールブロックが原因かもしれません。
この問題を確認するには、yourdomain.com(あなたのドメイン)/robots.txtにアクセスしてください。
そして、以下の2つのコードのどちらかを探してください:
User-agent: Googlebot
Disallow: /
User-agent: *
Disallow: /
これらはどちらも、Googlebotがあなたのサイトのどのページもクロールの許可をしていないことを伝えています。この問題を修正するには、これらを削除します。たったそれだけです。
robots.txtの設定が、Googleが特定のウェブページをインデックスしない原因となることもあります。この疑問を解消するためには、Google Search ConsoleのURL検査ツールにURLを入力します。その後、「Coverage」部分をクリックして詳細を確認し、「クロールが許可されていますか?いいえ:robots.txtによってブロックされています」というエラーが表示されるか見てください。
このエラーが出た場合、該当ページがrobots.txtでブロックされていることがわかります。
そのような事態になった場合、あなたのrobots.txtファイルを再確認し、そのページや関連するセクションが「disallow(不許可)」のルールによりブロックされていないか確認してください。
Googleは、あなたがインデックスしないようにお願いしたページをインデックスしません。これは、特定のウェブページを非公開にしたいときにとても便利です。これを行う方法は 2 つあります。
これらのmetaタグのいずれかを<head>セクションに持つページは、Googleにインデックスされません。
<meta name="robots" content="noindex">となります。
<meta name=“googlebot” content=“noindex”>となります。
これはmeta robotsタグで、検索エンジンにそのページをインデックスできるのかできないのかを伝えるものです。
注:
サイト内のnoindexメタタグを持つすべてのページを見つけるには、Ahrefsのサイト監査を使ってクロールを実行してください。インデクサビリティレポートに移動し、「Noindex page」警告を探しましょう。

クリックすると、影響を受けるすべてのページが表示されます。noindexメタタグが存在しないページから削除してください。
検索エンジンのクローラーは、「X-Robots-Tag HTTPレスポンスヘッダ」を遵守します。このヘッダーを設定することで、ページが検索エンジンによってインデックスされないようにすることができます。このヘッダーは、PHPなどのサーバーサイドのプログラミング言語や.htaccessファイル、またはサーバーの設定を調整することで適用することができます。
GoogleのSearch ConsoleのURL検査ツールは、このX-Robots-Tag HTTPレスポンスヘッダーがGoogleのクローラーがページをクロールするのを防いでいるかどうかを確認するのに役立ちます。URLを検査ツールに入力し、その結果で「インデックスが許可されているか」を探します。
もし「No:「X-Robots-Tag」httpヘッダーで「noindex」が検出されました」と表示された場合、それはそのページがX-Robots-Tag HTTPレスポンスヘッダーによりインデックスから除外されていることを意味します。
サイト全体でこの問題を確認したい場合は、Ahrefsのサイト監査でクロールを実行し、ページエクスプローラーの「HTTPヘッダーのロボット情報」フィルターを使用します
インデックスさせたいページがこのヘッダーを返さないようにするよう、開発者に伝えてください。
サイトマップは、あなたのサイトのどのページが重要で、どのページが重要でないかをGoogleに伝えるものです。また、どの頻度で再クロールさせるべきかという指針も与えてくれます。
サイトマップの有無にかかわらず、GoogleはWebサイトのページを見つけることができるはずですが、それでもサイトマップを作成することは良い習慣です。
ページがサイトマップに登録されているかどうかを確認するには、Search ConsoleのURL検査ツールを使用します。「URLがGoogleにない」というエラーや「サイトマップ:N/A」と表示された場合は、サイトマップに登録されていないか、インデックスされていないことになります。
Search Consoleを使用していない場合サイトマップのURL(通常はyourdomain.com(あなたのドメイン)/sitemap.xml)にアクセスし、ページを検索してください。
また、サイトマップにないクロール可能なページやインデックス可能なページをすべて見つけたい場合は、Ahrefsのサイト監査でクロールを実行します。ページエクスプローラーに移動し、これらのフィルターを適用します。
これらのページはサイトマップに含まれているはずなので、追加してください。サイトマップを更新したら、このURLにpingを打って、サイトマップを更新したことをGoogleに知らせましょう。
http://www.google.com/ping?sitemap=http://yourwebsite.com/sitemap_url.xml
最後の部分(http://yourwebsite.com/sitemap_url.xml)をあなたのサイトマップURLに置き換えてください。すると、このように表示されるはずです:
「canonicalタグ」とは、あるウェブページが他の類似ページと比べて最優先されるべきバージョンであることをGoogleに伝えるためのものです。このタグは以下のように表現されます
<link rel="canonical" href="/page.html/">
多くのWebページは、このタグを持たないか、もしくは「自己参照型canonicalタグ」を持っています。この自己参照型canonicalタグは、そのページ自体がGoogleにとって最優先されるべきバージョンであると伝えるものです。つまり、サイトの作成者はそのページがインデックス(Googleの検索結果に表示)されることを望んでいます。
しかし、ページに誤ったcanonicalタグが設定されていると、Googleに対して存在しない、あるいは非優先のバージョンのページが優先すべきであると誤って伝えてしまう可能性があります。その結果、該当のページがGoogleにインデックスされない可能性があります。
ページがcanonicalタグを持っているかどうか、そしてそのタグがどのページを指しているかを確認するには、GoogleのURL検査ツールを使用します。canonicalタグが他のページを指している場合、ツール内で「canonicalタグを持つ代替ページ」の警告が表示されます。
もしこれが必要なもので、ページをインデックスさせたい場合は、canonicalタグを削除してください。
重要
Canonicalタグ自体は悪いものではありません。多くのページがこれを持つ理由があり、それはWebサイトの管理者が意図的に設定したものでしょう。もし、あなたのページにcanonicalタグがあることがわかった場合、そのページが本当にGoogleに推奨するバージョンであるか確認してみてください。そのページが適切で、問題のページをGoogleがインデックスする必要がないのであれば、canonicalタグをそのままにしておくべきです。
全サイトを対象に不適切なcanonicalタグを速やかに探し出すためには、Ahrefsのサイト監査ツールを使用してサイトをクロールします。その後、ページエクスプローラーへと進み、以下の設定を適用します。
このフィルターは、サイトマップ内で自分自身を指さないcanonicalタグを持つページを探し出します。通常、サイトマップに掲載されているページはGoogleにインデックスしてほしいという意図があるはずです。なので、もしこのフィルターが何かしらの結果を返したら、それはさらなる調査が必要なサインです。
孤児ページとは、他のページから内部リンクで参照されていないページ、つまり「みなしごのように孤立したページ」を指します。※ 以下、当記事では「孤立ページ」と表記します。
GoogleはWebサイトをクロールし、新しいコンテンツを探し出しますが、内部リンクがない孤立ページは発見されにくいです。また、Webサイトの訪問者も孤立ページを見つけることは難しいでしょう。
孤立ページの有無を確認するには、Ahrefsのサイト監査を使ってサイトをクロールしましょう。次に、リンクレポートに「Orphan page (has no incoming internal links)」というエラーがないかチェックします。
重要
この手順は次の2つが満たされているときにしか機能しません:
全てのインデックス対象のページがサイトマップに含まれているか不安なら、次のステップを試してみてください:
これらの見つからなかったURLが、孤立ページとなります。
孤立ページを修正するには、2つの方法があります:
nofollowリンクとは、rel="nofollow "タグの付いたリンクのことです。リンク先のURLへのPageRankの転送を防ぎます。また、Googleはnofollowリンクをクロールしません。
以下は、この件に関するGoogleの見解です:
ただし、nofollowを使用せずに他のサイトからリンクされている場合や、サイトマップでGoogleにURLが送信されている場合は、インデックスに表示される可能性があります。
要するに、インデックス可能なページへの内部リンクがすべて守られていることを確認する必要があります。
これを行うには、Ahrefsのサイト監査を使ってサイトをクロールします。「リンク」 レポートで、「Page has nofollow incoming internal links only」エラーのあるインデックス可能なページがないか確認してください:
Googleにページをインデックスさせたい場合は、これらの内部リンクからnofollowタグを削除してください。そうでない場合は、ページを削除するか、noindexにしてください。
Googleは、Webサイトをクロールすることで新しいコンテンツを発見します。もし、あなたが問題のページへの内部リンクを怠っていたら、彼らは見つけることができないかもしれません。
この問題の簡単な解決策は、ページにいくつかの内部リンクを追加することです。これは、Googleがクロールしてインデックスできる他のWebページから行うことができます。しかし、Googleにできるだけ早くインデックスさせたいのであれば、より「強力な」ページの1つを設定するのが理にかなっています。
なぜか?なぜなら、Googleはそのようなページを、重要度の低いページよりも早く再クロールする可能性が高いからです。
重要なページを確認するには、Ahrefsのサイトエクスプローラーにアクセスしてドメインを入力し、Best by linksレポートにアクセスしてください。
これは、Webサイト上のすべてのページをURLレーティング(UR)でソートして表示します。つまり、最も権威のあるページが最初に表示されます。
このリストに目を通し、関連するページを探し、そこから当該ページへの内部リンクを追加します。
そうすると、Googleは次にページを再クロールするときにそのリンクを見て、発見することになります。
Googleが低品質なページをインデックスする可能性は低いです。なぜならユーザーにとって何の価値も持たないからです。2018年のインデックスについて、GoogleのJohn Mueller氏が語った内容は以下の通りです:
We never index all known URLs, that's pretty normal. I'd focus on making the site awesome and inspiring, then things usually work out better.
— John Mueller (official) — #StaplerLife · #Is (@JohnMu) January 3, 2018
彼は、Googleに自分のWebサイトやページをインデックスさせたいなら、"凄い内容で、感動的 "である必要があるとほのめかしています。
インデックスされない原因として、技術的な問題を除外した場合、価値の欠如が原因である可能性があります。そのため、まっさらなな目でページを見直し、自問自答してみてください。
このページは本当に価値があるのでしょうか? 検索結果からこのページをクリックした場合、ユーザーはこのページに価値を見出すでしょうか?
もし答えがNOであれば、コンテンツを改善する必要があります。
Ahrefsのサイト監査と URLプロファイラーを使えば、インデックスされていない低品質なページの可能性をもっと見つけることができます。そのためには、Ahrefsのサイト監査のPage Explorerに行き、以下の設定をします。
これは、インデックス可能で、現在オーガニックトラフィックを得ていない「薄っぺらい」ページを返します。つまり、インデックスされていない可能性が高いのです。
レポートをエクスポートし、すべてのURLをURLプロファイラーに貼り付け、Googleインデックスチェックを実行します。
重要
多くのページ(つまり100ページ以上)に対してこれを行う場合は、プロキシを使用することが推奨されます。そうしないと、あなたのIPがGoogleに禁止される危険性があります。もしそれができないのであれば、別の選択肢として、"無料一括Googleインデックスチェッカー "をGoogleで検索してみてはいかがでしょうか。このようなツールはいくつかありますが、そのほとんどは一回につき25ページ未満に制限されています。
インデックスされていないページがあれば、品質に問題がないか確認します。必要に応じて改善し、Google Search Consoleで再インデックス化をリクエストします。
また、重複するコンテンツの問題を解決することを目指すべきです。Googleは、重複したページやそれに近いページをインデックスすることはまずありません。「サイト監査」の「重複コンテンツ」レポートを使って、このような問題がないかどうかをチェックしましょう。
低品質なページが多すぎることは、クロールバジェット(予算)を浪費するだけです。
以下は、この件に関するGoogleの見解です:
付加価値の低いページにサーバーリソースを浪費することは、実際に価値のあるページからクロール活動を奪うことになり、サイト内の優れたコンテンツの発見が大幅に遅れる可能性があります。
例えば、先生が小論文を採点していて、そのうちの1つがあなたの小論文だと考えてみてください。もし、先生が10枚のエッセイを採点していたら、あなたのエッセイにはすぐに取り掛かるでしょう。100枚あれば、もう少し時間がかかるでしょう。何千通もあれば、仕事量が多すぎて、あなたのエッセイの採点に手が回らないかもしれません。
Googleは、"クロールバジェットは、ほとんどのパブリッシャーが心配する必要はない "とし、"サイトのURL数が数千未満であれば、ほとんどの場合、効率的にクロールされる "としています。
それでも、Webサイトから低品質なページを削除することは、決して悪いことではありません。クロールバジェットにプラスの効果をもたらすだけなのです。
コンテンツ監査テンプレートを使用して、削除可能な低品質で無関係なページを見つけることができます。
被リンクは、GoogleにそのWebページが重要であることを伝えるものです。結局のところ、誰かがリンクしているのであれば、それは何らかの価値があるに違いありません。このようなページは、Googleがインデックスしたいと考えるページです。
完全な透明性を保つために、Googleは被リンクのあるWebページだけをインデックスしているわけではありません。被リンクのないページもたくさん(数十億)インデックスされています。しかし、Googleは質の高いリンクを持つページをより重要視するため、リンクのないページよりも速くクロールし、再クロールする可能性があります。これが、より速いインデックスにつながるのです。
Ahrefsブログでは、高品質のバックリンクを構築するためのリソースをたくさん紹介しています。
以下のガイドをご覧ください。
WebサイトやページがGoogleにインデックスされることは、ランキングやトラフィックとイコールではありません。この2つは別物です。
インデックスは、GoogleがあなたのWebサイトを「認識していること」を意味します。しかし、関連性のある価値あるクエリに対して順位付けを行うことを意味するものではありません。
そこで、特定のクエリで上位に表示されるようにWebページを最適化する技術であるSEOの出番です。
要するに、SEOには以下が含まれます。
SEOを始めるための動画をご紹介します:
GoogleがWebサイトやWebページをインデックスしていない理由として考えられるのは、以下の2つだけです。
その両方の問題が存在することは十分にあり得ます。しかし、技術的な問題の方がはるかに一般的だと言えるでしょう。技術的な問題は、インデックス可能な低品質コンテンツ(ファセットナビゲーションの問題など)の自動生成につながることもあります。
この記事で解説したチェックリストを実行すれば、十中八九、インデックス化の問題は解決するはずです。
ただ、「インデックス」≠「ランキング」であることを忘れないでください。価値のある検索クエリで上位に表示され、オーガニックなトラフィックの流れを常に引き寄せたいのであれば、SEOは依然として不可欠です。

Joshua Hardwick
Ahrefs のコンテンツ責任者(わかりやすく言うと、私たちが公開するすべてのブログ記事が素晴らしいことを保証する責任者です)。

Ahrefs 日本マーケティング統括。 国外 SaaS 企業における日本市場向けのマーケティングとローカリゼーションで 10 年以上の経験を積み、現在は Ahrefs の日本マーケティングを統括。ユーザーの皆さんと共に、Ahrefs を日本で盛り上げることを目標に、日々全力で取り組んでいます。