
LLM は、ブランドと「ジム」や「ノイズキャンセリング」のような概念との関係を学習します。こうした意味的な関連付けが、ブランドが言及されるかどうか、そしてどのように言及されるかに直接影響するのです。トレーニングの規模は想像しにくいほど膨大です。主要モデルのトレーニングデータは数兆トークン(おおよそ単語の断片)単位で測定されます。コストを見ればその規模感がわかります。GPT-4 のトレーニングには推定 7,800 万ドル がかかり、Google の Gemini Ultra は約 1 億 9,100 万ドル かかっています。 AI トレーニングデータセットの世界市場は 2025 年に 32 億ドル に達し、2033 年までに 163 億ドルに成長すると予測されています。年平均成長率 22.6% という数字は、データが AI 開発の中核にいかに位置づけられているかを物語っています。 ここで理解すべき決定的に重要なポイントがあります。トレーニングが終了した瞬間、モデルの知識は凍結されます。新しい出来事を学習することはできません。昨日の出来事も、先月の出来事も、トレーニングデータのカットオフ日以降に起きたことも、モデルは一切知りません。 一部のプロバイダーは定期的に新しいデータでモデルをファインチューニングしていますが、それでも離散的なプロセスです。継続的にニュースを読んでいるというよりは、ソフトウェアアップデートをリリースするようなものです。 もう一つの主要な障害モードはハルシネーション(幻覚)です。信頼できるトレーニングデータがない場合、モデルはそれらしく聞こえるもので空白を埋めます、架空の引用、捏造された統計、自信に満ちた的外れな回答などです(実際に、Ahrefs は架空ブランドで AI を騙す実験を実施ました)。 架空のペーパーウェイト会社を設定し、そのブランドについて事実ではないストーリーを意図的に 3 つ作成し、それらをオンライン上で広めた実験で、AI がこれらの偽情報を事実のように使用していたのです。

グラウンディングは「グラウンドトゥルース(ground truth)」に由来し、統計学、そしてもともとは地図学に根ざしています。文字通り「外に出て、自分の地図が現実と一致しているか検証する」という意味でした。ChatGPT や Gemini のような AI 検索エンジンは、このグラウンディングプロセスに Google や Bing のような従来型の検索インデックスを利用しています。だからこそ、優れた SEO を行い、従来型の検索で上位にランクインすることは、AI での可視性向上にもつながります。AI が検索するクエリに対して検索インデックスで上位に表示されるほど、回答に取得・引用される可能性が高まるのです。





Ahrefs をもっと活用 👉
▶︎ Ahrefs 公式ブログ --- 本社発信の記事 ▶︎ Ahrefs Canny --- 開発チームへ意見を送る ▶︎ X 公式アカウント--- 最新情報をリアルタイムで ▶︎ YouTube 公式チャンネル--- 動画コンテンツをチェック ▶︎ Ahrefs note --- 日本チーム発信の記事

ライアン・ローは Ahrefs のコンテンツマーケティングディレクターです。ライアンにはライター、コンテンツ戦略家、チームリーダー、マーケティングディレクター、VP、CMO(最高マーケティング責任者)、エージェンシー設立者として 13 年の経験があります。彼は Google、Zapier、GoDaddy、Clearbit、Algolia など、多くの企業のコンテンツマーケティングと SEO 改善を支援してきました。彼は小説家でもあり、2 種類のコンテンツマーケティングコースの考案者でもあります。