Falcon Information — ホームに戻る

LLMs.txtとは?形式、実践、および効果評価

「llms.txt」は、2024年にコミュニティによって提案されたファイル形式であり、簡潔なMarkdown形式でAIシステムがウェブサイトの構造や重要な情報を迅速に理解できるようにすることを目的としています。当サイトではこの形式を採用していますが、まず重要な点をお伝えします。Googleは「llms.txt」の使用を表明していません。これは、AIシステムに情報を提供するための「チケット」ではありません。この記事では、この形式を使用する方法と、期待できる範囲について説明します。

この記事のセクション

  • ·起源と位置づけ
  • ·形式規定
  • ·本サイトの運用方法
  • ·効果に関する正直な評価
  • ·配置すべき場所と、配置すべきでない場所
  • ·部署後の確認

LLM.txt はどこから来たものなのか? どのような目的で使用されているのか?

「llms.txt」は、Answer.AI のジェレミー・ハワード氏が2024年9月に提案したもので、その目的は非常に現実的です。それは、ウェブサイトがナビゲーション、広告、スクリプトで埋め尽くされ、文脈の長さが限られた言語モデルにとって使いにくい状況を改善するためです。代わりに、ウェブサイトの内容、重要なページをまとめたクリーンなMarkdown形式の概要を提供することで、より使いやすくするというものです。ただし、この提案はコミュニティによるものであり、検索エンジンやAIプラットフォームの公式な標準ではありません。この点に注意し、この提案にどれだけの時間と労力を費やすかを判断する必要があります。

形式はどのようなものですか?

この形式は、ウェブサイトのルートディレクトリに置かれた Markdown ファイルとして、意図的にシンプルに構成されています。構成は以下の通りです。; H1 タグにはウェブサイトの名前を記述; blockquote タグには、ウェブサイトの概要を記述; H2 タグを使って、リンクリストを分割し、各リンクに説明文を付与 また、オプションとして、llms-full.txt というファイルがあり、ウェブページの完全なコンテンツを直接記述できます。このファイルは、長いドキュメントを読み込むシステム向けに設計されています。どちらのファイルも、特別なヘッダーは不要で、純粋なテキスト形式で記述する必要があります。

  • H1:ウェブサイトまたはプロジェクト名(必須)
  • 引用:ウェブサイトにおける一節の要約
  • H2 セクション:カテゴリごとの関連リスト。各項目には説明文を付記
  • llms-full.txt(オプション):全文の展開版

本サイトにおける実践:動的な生成、手書きは不要

Next.js App Router の Route Handler を使用して、`/llms.txt` と `/llms-full.txt` を提供しています。これらのファイルは、手書きで作成された静的なファイルではなく、ウェブサイトと同じデータ層(TypeScript で記述されたサービス、事例、価格に関するファイル)から動的に生成され、ビルド時に `force-static` を使用して出力されます。この設計により、手書きファイルで発生する可能性のある「内容のずれ」の問題を解決します。価格やサービスが変更された場合、`llms.txt` は次回ビルド時に自動的に同期され、ウェブサイトと `llms.txt` で異なる情報が表示されるという状況を回避できます。これにより、AI システムへの古い情報が提供されるという問題を、`llms.txt` が存在しない場合よりも悪くする可能性があります。

効果の実態に基づいた評価:Googleは不要

これは、多くの教育機関が伝えない部分です。Googleの公式ドキュメントには、AI機能に特別な技術的な要件はないことが明記されており、検索チームのメンバーもLLMの使用を公表していません。他のAIプラットフォームがこれらのファイルを読み取るかどうか、それが引用に影響を与えるかどうかについては、現時点では公式な約束はありません。私たちが自身のサーバーのログを調査したところ、一部のAIがこれらのファイルをスクレイピングしていることが確認されましたが、「スクレイピング」と「引用への影響」は異なるものであり、後者は検証できません。したがって、結論として、llms.txtは非常に低コストな補助的な手段であり、GEOの核心業務ではありません。真の核心は、インデックス可能なコンテンツと、オリジナルの証拠です。

どのような部署に就くべきか?判断の基準

推奨する理由: 非常に低コスト(1つのファイルのみ); 既知のリスクがない; 将来、プラットフォームが正式に採用した場合に備えて準備できる 推奨しない理由: 誰かから「顧問料を請求する」または「AI 導入必須」という形で売りつけられる場合; これはプラットフォームの公式な立場と矛盾し、ベンダーの信頼性を判断するための指標として利用できる。 弊社は顧客に対して、この手法は「実施する」と伝えていますが、技術SEO、コンテンツの裏付け、そして測定といった、より優先度の高い手法の後に検討する、という優先順位であることを伝えています。

部署後、どのように確認するのか?

3つの確認事項: 1.`curl`やブラウザを使って`/llms.txt`を直接開き、レスポンスが200であり、内容が最新であるかを確認する。 2.コンテンツフィルタリングとsitemapの一致を確認する。`noindex`で指定されたページは、`/llms.txt`には存在しないようにする。そうしないと、意図しない情報をAIに提供することになる。 3.定期的にサーバーのログを確認し、実際にどのようなページがクロールされているかを記録する。これは、「誰かがアクセスしているか」を判断するための唯一の直接的な情報源となる。

参考文献

よくある質問

LLMs.txt と sitemap.xml の違いは何ですか?
sitemap.xml は、検索エンジンが公式に推奨する標準であり、クロールボットがインデックスできるすべてのURLをリストアップします。一方、llms.txt は、コミュニティからの提案であり、人間が読みやすいMarkdown形式でウェブサイトの重要なポイントを記述しています。sitemap.xml は明確な公式な用途を持ちますが、llms.txt は現時点ではプラットフォームによる利用が約束されていません。両者は互いに代替するものではありません。
必ず「llms-full.txt」が必要ですか?
必ずしもそうではありません。llms-full.txtは、容量を調整できるウェブサイトに適した、完全なコンテンツ版です。一方、ページ数が非常に多いウェブサイトでは、全文を展開すると内容が分散し、重要なポイントが埋もれてしまう可能性があります。当サイトでは、llms.txtには構造化されたリスト、llms-full.txtにはサービスや事例に関する完全な文章を掲載しています。
「llms.txt」が存在しないことが、AIの引用に影響を与える可能性がありますか?
現時点で、各プラットフォームの公開文書を確認すると、Googleは明示的に使用していません。他のプラットフォームも、それを必須条件として挙げていません。重要なのは、コンテンツが検索エンジンによって収集可能であるか、信頼できる情報源であるかどうかです。これらを評価基準として捉え、必須条件とはせずに、あくまでプラス要素として捉えるべきです。

関連するご要望はありますか?

お問い合わせ