II-A3 クロール・インデックス・引用の流れを追う
AIがWebページを見つけてから回答に引用するまでの一連の流れ
このレッスンの狙い:「クロールされる→引用される」までの流れを段階ごとに説明できる
最終更新: 2026-07-23
この記事の要点
- 「クロールされる→引用される」までの流れを段階ごとに説明できる
- AIにもクローラーがいる
- クロールされた内容が「意味」として読み取られる
II-A2でAI検索の大まかなアーキテクチャを確認したところで、今回はその中の「情報を集める」部分にズームインし、クロールから引用までの一連の流れをもう一段細かく追いかけます。1本のページが公開されてからAIの回答に顔を出すまでには、実はいくつもの関門が隠れています。ここを段階ごとに、自分の言葉で説明できる状態を今回のゴールに置きます。
AIにもクローラーがいる
従来の検索エンジンと同じように、AI検索サービスの多くも自社専用のクローラー(bot)を使ってWebを巡回しています。たとえば次のように、robots.txtでクローラーごとにアクセスの可否を指定できます。
User-agent: GPTBot
Disallow: /members/
User-agent: *
Allow: /どのクローラーにどこまで見せるかは、サイト側が意図して決められるという点が、まず押さえておきたいポイントです。どんな名前のAIクローラーがあり、エンジンごとにどう違うのかはII-A8で一覧を整理するので、ここでは「AI各社が専用のクローラーを持っている」という事実だけ押さえておいてください。判断基準の詳しい考え方は編III-Aで扱います。
クロールされた内容が「意味」として読み取られる
クロールしただけでは、AIはまだページの内容を検索に使える形にできていません。ページのテキストは細かい単位(チャンク)に分割され、それぞれが「意味の近さ」を数値で表すエンベディングというベクトルに変換されます。この処理があるおかげで、AIはキーワードの完全一致だけでなく、言い換えや類義語も含めて「意味」で検索できるようになります(出典: Microsoft Tech Community, 2026年7月確認)。この変換処理の技術的な中身は編II-Bで詳しく扱うので、ここでは「クロールされた文章は、細かく区切られたうえで意味のベクトルに変換されている」という大枠だけ理解しておけば十分です。
質問のたびに「候補」が選ばれ、絞り込まれる
ユーザーが質問すると、その質問文もベクトルに変換され、意味が近いチャンクが検索エンジン内部からまず幅広く集められます。その後、より精密なモデルでもう一段候補を採点し直すリランキングという工程を経て、本当に関連性が高いものへと絞り込まれます(出典: Medium, 2026年7月確認)。「広く速く集める」段階と「精密に絞り込む」段階の2段構えになっている、とイメージしておくとよいでしょう。
選ばれた候補が「引用」として回答に組み込まれる
絞り込まれた候補の内容をもとに、LLMが回答文を生成し、根拠となった情報源を引用として添えます。ここで大事なのは、クロールされ、インデックスされたページがすべて引用されるわけではないという点です。関連性や構造の分かりやすさ、信頼できる情報源かどうかといったシグナルによって、実際に引用されるかどうかがふるいにかけられます。逆にいえば、そもそもクロールすらされていないページは、この先どれだけ内容が良くても引用の土俵に上がることさえできません。どんな内容が引用されやすいのかという具体的な条件は、編IV-Aでじっくり扱います。
実践ステップ
- 自社サイトのrobots.txtファイルを開き、AIクローラー向けの記載があるかどうかを確認する
- 記載がない場合は「特に何も指定していない=基本的には許可されている」状態だと理解する
- 自社の主要記事を1本選び、見出し(H2・H3)が1つのテーマごとに整理されているかを確認する
- ChatGPT検索で自社の主要キーワードを検索し、引用されるページとされないページを見比べる
- 「クロール→意味への変換→候補の絞り込み→引用」という4段階のうち、自社サイトがどこで弱そうかを1つメモする
まとめ
AIが答えを生成するまでの裏側では、クロール→意味への変換→候補の絞り込み→引用という4段階の流れが動いています。クロールやインデックスはあくまで入り口であり、そこから実際に引用されるかどうかは別のふるいが働くという点が、このレッスンで一番押さえておきたい要点です。こうした裏側の変化は、ユーザーの検索行動そのものにも表れ始めています。その一つが、II-A4で扱うゼロクリックという現象です。
このレッスンはテキストとスライドで学べます。スライドは上のビューアからご覧ください。
確認テスト
選択肢をクリックすると、その場で正誤と解説が表示されます。
Q1. クロールやインデックスされたページは、すべてAIの回答に引用される。
クロール・インデックスは入り口に過ぎず、関連性や信頼性などのシグナルによって実際に引用されるかがふるいにかけられます。
Q2. 本文が説明する、AIが答えを生成するまでの4段階の流れとして正しいものはどれか。
AIが答えを生成するまでの裏側では、クロール→意味への変換→候補の絞り込み→引用という4段階の流れが動いています。
Q3. 質問時に「広く速く集める」段階のあとで、より精密なモデルで候補をもう一段採点し直す工程の名称はどれか。
幅広く集めた候補は、より精密なモデルでもう一段採点し直すリランキングという工程を経て絞り込まれます。
このレッスンのFAQ
Q. robots.txtでAIクローラーごとにアクセス可否を指定できますか?
はい、できます。User-agent単位でDisallowやAllowを指定することで、どのクローラーにどこまで見せるかをサイト側が意図して決められます。
Q. クロールされた文章は、そのまま検索に使われるのですか?
いいえ。クロールされたテキストは細かい単位(チャンク)に分割され、それぞれが意味の近さを表すベクトル(エンベディング)に変換されて初めて、意味での検索に使える状態になります。
Q. 引用されるかどうかを決めるふるいには何が関わりますか?
関連性や構造の分かりやすさ、信頼できる情報源かどうかといったシグナルによって、実際に引用されるかがふるいにかけられます。そもそもクロールされていないページは、この土俵にすら上がれません。