Falcon Information — ホームに戻る

ChatGPT での検索における引用元:調査方法と限界

ChatGPT で検索した回答には、出典となるリンクが記載されているため、「ChatGPT はどのように情報を引用しているのか」という質問はよく寄せられます。その真実の答えは、OpenAI が公式なランキングアルゴリズムを公開していないため、そのようなアルゴリズムを「把握している」と主張する情報は推測に過ぎないということです。本稿では、公式ドキュメントで確認できる仕組み、および実際に使用している観察方法(制限事項を含む)をまとめます。

この記事のセクション

  • ·公式で確認できる仕組み
  • ·引用はどのように行うか
  • ·固定クエリ集の利用方法
  • ·方法の制約
  • ·コンテンツの活用方法
  • ·トラフィックをどのように測定するか

公式文書で確認できる3種類の爬虫類

OpenAIは、異なる用途を持つ3種類のユーザーエージェントを公開しています。運営側は、これらを個別に制御できます。; OAI-SearchBot:ウェブサイトをChatGPTの検索結果に表示させるためのインデックス作成に使用します。; ChatGPT-User:ユーザーが対話中にウェブページの読み取りを要求する際に使用されます。; GPTBot:モデルの学習に使用するデータの収集に使用されます。 これらのエージェントは、robots.txtで個別に制御できます。GPTBotをブロックしても、ChatGPTの検索結果からウェブサイトが表示されなくなるわけではありません。検索結果に表示させたいウェブサイトは、少なくともOAI-SearchBotへのアクセスを許可する必要があります。

OpenAI が提供する 3 つのユーザーエージェントの用途に関する区分
User agent用途ChatGPT で引用元を検索したい場合
OAI-SearchBot検索インデックスの作成と、関連リンクの表示必ず実行
ChatGPT-Userユーザーがページを読み取ることを要求した場合、その要求を即座に処理する。推奨は、この件を保留することです。
GPTBotモデルの学習に必要なデータ収集利用コンテンツの利用許諾ポリシーに基づいて、ご自身で決定してください。

引用とはどのように発生するのか? 引用できるものと、できないものを区別するには

確認できること:ChatGPT の検索機能は、質問に対して検索を行い、複数の情報源から回答を生成し、回答の傍に情報源へのリンクを付与します。確認できないこと:情報源の順序、A を選択する理由、コンテンツの特徴の重要度などについては、OpenAI が公表していません。市場に出回っている「ChatGPT 引用因子に関する研究」は、多くの場合、第三者によるサンプル分析の結果に基づいた推測であり、参考にすることはできますが、結論を引用する際には、それが推測であることを明記し、プラットフォームの規則として記述することは避けるべきです。当方の立場:検証可能な情報を基盤として、観察に基づいて判断することが重要です。

私たちの調査方法:固定調査

具体的な手順は、固定された問題リストを作成し、ChatGPTを定期的にテストし、その結果を記録することです。重要なポイントは以下の通りです。; 問題は「顧客が意思決定の際に実際に質問する内容」(例:サービスの比較、費用に関する問い合わせ)に絞る。ブランド名だけを測るのではなく、顧客の疑問やニーズを反映させる。; 毎回新しい対話を開始し、文脈の影響を避ける。; 各問題について、日付、ブランド名が言及されているかどうか、どのウェブサイトやページが引用されているかを記録する。; 同じ問題リストを毎月繰り返しテストし、傾向の変化を把握する。単発の結果ではなく、長期的な変化を分析する。 この方法は、シンプルな表と一定の実行体制だけで実現できるため、コストが低い。

この方法には、まずいくつかの制限があることを明確にする必要があります。

固定クエリ集には明確な制限があり、報告書には「AIの回答にはランダム性があるため、同じ質問を2回尋ねても異なる情報が得られる可能性がある。回答はアカウント、地域、モデルバージョンによって影響を受けるため、あなたが得られた結果は、すべてのユーザーが見るものと一致しない。また、モデルや製品のバージョン変更により、基準全体が再評価される可能性がある。したがって、このクエリ集は「当社のブランドがこの問題における相対的な傾向」しか回答できないため、市場シェアや露出量を推論することはできない。単一のスクリーンショットで「ChatGPTによって推奨されている」と主張する報告は、慎重に評価する必要がある。」

コンテンツをどのように活用できるか?

公開なアルゴリズムを追求するよりも、検証可能な基盤を構築する方が重要です。この取り組みは、従来の検索エンジンや、あらゆるAIプラットフォームにも役立ちます。具体的には、以下の点が重要です。; OAI-SearchBot がウェブページを正しく取得できるか(robots.txt や WAF を確認する)。; 重要な情報は HTML 形式で、インタラクティブな要素に隠されていない。; 回答を先に記述する形式で、まず質問に答えてから詳細を説明する。; 客観的な証拠と、実名のアノテーション。検証可能な情報のみが、他の情報と組み合わせて参照される価値を持つ。; ブランド名と企業情報を、ウェブ全体で一貫させることで、誤解を防ぐ。

引用された後、トラフィックをどのように測定するか?

OpenAI の公式ドキュメントでは、ChatGPT の検索時に自動的に `utm_source=chatgpt.com` が付加されるため、GA4 でキャンペーンソースとセッションソースを組み合わせて ChatGPT のグループを作成し、コンバージョンページ、事例、CTA、問い合わせなどを追跡できます。ただし、すべての ChatGPT の露出が追跡できるわけではありません。クリックがない場合や、アプリの起動、プライバシー制限、リダイレクト、パラメータの削除などによって、参照元または直接アクセスとして分類される可能性があります。レポート作成時には、UTM とリファラーの両方を同時に確認し、単なるセッション数の数だけでなく、継続的な問い合わせの状況を考慮して価値を判断することが重要です。

参考文献

よくある質問

GPTBotをブロックした後、そのコンテンツがChatGPTに表示されなくなるのでしょうか?
それは違います。GPTBotは、学習データの収集を管理します。一方、OAI-SearchBotは、OAI-Searchを利用して引用情報を検索します。GPTBotとOAI-SearchBotを併用することで、理論上はChatGPTでの引用検索も可能です。また、過去の学習データや、サードパーティによる再利用コンテンツは、現在のrobots.txtによる制御の対象外です。
ChatGPT の検索は、Bing のインデックスと関連しているのでしょうか?
OpenAI とマイクロソフトは協力関係にあり、ChatGPT の検索履歴の一部は Bing の技術を利用していますが、OpenAI は独自のインデックス(OAI-SearchBot)も構築しています。ただし、その詳細な仕様は公式なドキュメントには記載されていません。 実用的なアプローチとしては、Bing Webmaster Tools を利用して情報を送信することが考えられますが、「Bing での SEO を行う」ことが、ChatGPT へのアクセスを保証するものではありません。
データの収集頻度をどのくらいの頻度で再測定するのが適切でしょうか?
私たちの評価は、毎月1回、四半期ごとのレビューと組み合わせる形で実施します。頻度が多すぎると、AIの回答のランダムな変動によって、実際の変化が隠れてしまいます。また、評価の間隔が長すぎると、モデルのバージョンアップによる変化を捉えられなくなります。重要なのは、毎回評価する際の条件(質問、表現、新しい対話)を統一することです。

関連するご要望はありますか?

お問い合わせ