AutoPodAutoPod

最大限のインクルージョンのためのライセンスとロボット:AIクローラーを歓迎する方法

6 分で読めます
音声記事
最大限のインクルージョンのためのライセンスとロボット:AIクローラーを歓迎する方法
0:000:00
最大限のインクルージョンのためのライセンスとロボット:AIクローラーを歓迎する方法

最大限のインクルージョンのためのライセンスとロボット:人工知能クローラーを歓迎する方法

2026年8月25日更新

ウェブサイトが読者にリーチする方法は複数あります。ページはGoogle検索で見つけられたり、ChatGPTによって要約されたり、Perplexityによって引用されたり、Claude検索で使われたり、Appleサービスを通じて表示されたり、公開ウェブアーカイブによって収集されたりする可能性があります。

これらのシステムは、すべて同じクローラーを使用しているわけではなく、同じルールに従っているわけでもありません。GPTBotをブロックするウェブサイトでも、OAI-SearchBotを許可していれば、ChatGPT検索に表示されることがあります。Applebotを許可するウェブサイトは、Applebot-Extendedが人工知能モデルのトレーニングに使用されるのをブロックしながらも、Apple Searchで可視性を維持できます。GoogleのGoogle-Extendedは、通常のクローラーとは全く異なり、robots.txtの制御トークンです。

したがって、最善のポリシーは単に「人工知能を許可する」または「人工知能をブロックする」ことではありません。以下の目的に対して個別の許可を作成することです。

  1. 検索と発見
  2. ユーザー要求による取得
  3. モデル開発とトレーニング
  4. 公開データセット
  5. 機密性の高い、プライベートな、または制限された素材

この記事では、最新のクローラーインベントリ、robots.txtの例、メタタグのガイダンス、インターネットプロトコルアドレス検証方法、クリエイティブ・コモンズライセンスに関するアドバイス、法的定型文、およびリスク-ベネフィットマトリックスを提供します。

すべてのパブリッシャーが理解すべき4つの制御

1. robots.txtによるクロール要求の制御

robots.txtファイルは、準拠する自動クライアントに対して、どのページをリクエストできるかを伝えます。クローラーのトラフィックを管理し、パブリッシャーの優先順位を表明するのに役立ちます。

しかし、robots.txtはアクセス制御システムではありません。Robots Exclusion Protocolは、そのルールがアクセス認証ではないと述べています。Googleも、ブロックされたアドレスでも、他のページがリンクしていれば検索結果に表示される可能性があると警告しています。機密情報にはパスワード、認証、またはサーバーサイドのアクセス制御を使用してください。(rfc-editor.org)

2. メタタグによるインデックス作成とスニペットの制御

RobotsメタタグとX-Robots-Tag応答ヘッダーは、ページがインデックスされるかどうか、または検索エンジンがスニペットを表示できるかどうかを制御できます。

これらの制御は通常、クローラーがページをフェッチすることを許可された後にのみ可視になります。robots.txtが先にページをブロックした場合、クローラーはメタタグを認識できない可能性があります。(developers.google.com)

3. ネットワーク制御によるクローラーの検証

ユーザーエージェント名は簡単にコピーできます。攻撃者はGPTBotGooglebot、またはPerplexityBotを名乗るリクエストを送信することができます。

より強力なアプローチは以下を組み合わせます。

  • 主張されたユーザーエージェント
  • 公開されているインターネットプロトコルアドレス範囲
  • 逆引きドメインネームシステム(DNS)検証
  • 正引きドメインネームシステム(DNS)検証
  • レート制限とリクエスト監視

4. ライセンスによる再利用権の付与

Robots.txtはクローラーに何をすべきかを伝えます。ライセンスは、著作権の許可が必要な場合に、個人または組織がその素材を法的にどのように使用できるかを定めます。

これらは異なるツールです。許可するライセンスは法的不確実性を減らすことができますが、クローラーがページを訪問すること、モデルがそれを使用すること、またはアシスタントがそれを引用することを保証するものではありません。

重要なクローラーのインベントリ

以下のインベントリは、2026年8月25日に入手可能なプロバイダーのドキュメントと照合して確認されました。ユーザーエージェント名、目的、およびインターネットプロトコルアドレス範囲は変更される可能性があるため、本番システムではプロバイダーの最新ドキュメントとリアルタイムのアドレスフィードを使用する必要があります。

プロバイダークローラーまたはrobots.txtトークン主な目的重要な制御
OpenAIOAI-SearchBotChatGPT検索のためにページを見つけ、分析しますChatGPT検索結果にページが表示される可能性を高めるために許可します。
OpenAIGPTBotOpenAIの生成型人工知能モデルのトレーニングに使用される可能性のあるページを収集します検索とは別に許可または不許可を設定します。
OpenAIChatGPT-UserユーザーがChatGPTまたはカスタムGPTにアクセスを要求した後、ページをフェッチします自動ウェブクローラーではなく、ユーザーによってトリガーされるため、robots.txtルールは適用されない場合があります。
OpenAIOAI-AdsBotChatGPT広告の目的地として提出されたウェブページをチェックします主に広告主に関係します。収集されたコンテンツは生成型人工知能基盤モデルのトレーニングには使用されません。
GoogleGooglebot主なGoogle検索クローラー通常のGoogle検索のクロールを制御します。
GoogleGooglebot-ImageGooglebot-VideoGooglebot-News画像、動画、Googleニュースこれらは個別のrobots.txtトークンを持ち、独立して制御できます。
GoogleGoogleOther研究開発を含む様々な製品チームのための汎用Googleクロール特定のGoogle製品を表すものではありません。
GoogleGoogle-ExtendedGoogleがクロールしたコンテンツがGeminiモデルのトレーニングや特定のグラウンディングシステムに使用されるかどうかを制御します個別のリクエストユーザーエージェントではなく、robots.txt制御トークンです。通常のGoogle検索への組み込みには影響しません。
AnthropicClaudeBotClaudeモデル開発に貢献する可能性のある公開ウェブコンテンツを収集します将来の素材をAnthropicのトレーニングデータセットから除外するように通知するために不許可にします。
AnthropicClaude-SearchBotClaude検索結果の品質を向上させますClaude検索での可視性のために許可します。
AnthropicClaude-UserユーザーがClaudeにリクエストした応答としてページをフェッチします自動クロールとは別です。
PerplexityPerplexityBotPerplexity検索結果のためにページをインデックスしますPerplexityによると、このクローラーは人工知能基盤モデルのトレーニング用コンテンツ収集には使用されません。
PerplexityPerplexity-Userユーザーがリクエストした後、ページをフェッチしますPerplexityのドキュメントによると、このフェッチャーはユーザーによってリクエストが開始されたため、通常robots.txtを無視します。
AppleApplebotApple Search、Spotlight、Siri、Safari、その他のAppleエクスペリエンスをサポートしますAppleでの発見のために許可します。
AppleApplebot-ExtendedApplebotがクロールしたコンテンツがApple基盤モデルのトレーニングに使用されるかどうかを制御しますページ自体をクロールしません。これはデータ使用制御です。
Common CrawlCCBotCommon Crawlのオープンウェブアーカイブのために公開ウェブデータを収集しますアシスタントではありませんが、そのデータセットは研究者や人工知能開発者に使用されます。
MicrosoftBingbot主なBing検索クローラーBingでの発見と検索可視性のために許可します。
MicrosoftMicrosoftPreviewBingVideoPreviewMicrosoft製品のページと動画プレビューこれらはBingbotとは別に制御できます。
AmazonAmzn-SearchBotAmazon検索とコンテンツ発見Amazonは生成型人工知能モデルトレーニング用のコンテンツをクロールしないと述べています。
AmazonAmzn-UserAlexaリクエストを含むユーザーアクションに応じて最新情報をフェッチしますユーザーによってトリガーされ、自動検索クロールとは別です。

OpenAIは、検索、トレーニング、広告、およびユーザーがトリガーするクローラーを個別の制御として文書化しています。そのドキュメントでは、ChatGPT検索のためにOAI-SearchBotを許可し、トレーニングの好みに応じてGPTBotを個別に利用することを具体的に推奨しています。(developers.openai.com)

Googleも同様に、GooglebotGoogleOtherGoogle-Extendedを分離しています。Google-Extendedは独自のHTTPリクエストユーザーエージェントを持たず、これをブロックしてもGoogle検索からページが削除されることはありません。(developers.google.com)

Anthropicは、ClaudeBot、Claude-SearchBot、Claude-Userの個別の役割を文書化しています。Anthropicはまた、そのボットがrobots.txtに従い、非標準のCrawl-delayディレクティブをサポートしていると述べています。(support.anthropic.com)

Perplexityは、自動検索クロールとユーザー要求によるフェッチを区別しています。その現在のドキュメントによると、PerplexityBotはrobots.txtを尊重しますが、Perplexity-Userはユーザーのリクエストに応答するため、通常は尊重しません。(docs.perplexity.ai)

Appleの最新ドキュメントも、検索とトレーニングの同様の区別を設けています。Applebotは発見をサポートし、Applebot-ExtendedはパブリッシャーがApple検索からページを削除することなくトレーニングの使用を制御できるようにします。(support.apple.com)

推奨されるrobots.txt設定

robots.txtは各ホストのルートに配置します。例:

text https://www.example.org/robots.txt

ルールは、ファイルが提供される特定のホスト、プロトコル、およびポートに適用されます。別のサブドメインには独自のファイルが必要となる場合があります。(developers.google.com)

設定1:最大限のインクルージョン

準拠するクローラーによって公開された編集コンテンツが見つけられ、要約され、引用され、インデックスされ、収集される場合にこれを使用します。

text

Public pages are available to compliant crawlers.

User-agent: * Allow: /

Keep private, transactional, and administrative paths out.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

これは、OpenAI、Google、Anthropic、Perplexity、Apple、Common Crawl、Microsoft、Amazonを含む指定されたクローラーを許可します。ただし、別の特定のルールでブロックされている場合を除きます。

この設定の下にUser-agent: * Disallow: /のような包括的なルールを配置しないでください。後続の、またはより具体的なグループが、クローラーがファイルを解釈する方法を変更する可能性があります。

設定2:検索は許可するが、モデル開発クローラーはブロックする

これは、引用や検索トラフィックを望むものの、モデル開発のための収集を許可する意図がないパブリッシャーにとって、しばしば最良の妥協策となります。

text

Block OpenAI model-development crawling.

User-agent: GPTBot Disallow: /

Block Anthropic model-development crawling.

User-agent: ClaudeBot Disallow: /

Block Google model-training and related grounding use.

User-agent: Google-Extended Disallow: /

Block Apple foundation-model training use.

User-agent: Applebot-Extended Disallow: /

Optional: block Common Crawl dataset collection.

User-agent: CCBot

Disallow: /

Allow ordinary search and retrieval crawling, except for sensitive paths.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

この設定では、OAI-SearchBotClaude-SearchBotPerplexityBotGooglebotApplebotがワイルドカードグループの対象となります。また、検索とトレーニングの許可を分離します。

Appleの場合、Applebotを許可しつつApplebot-Extendedをブロックすることで、Appleサービスを通じた発見は維持されます。Googleの場合、Google-Extendedをブロックしても、通常のGoogle検索はブロックされません。(developers.google.com)

設定3:選択した検索クローラーを明示的に許可する

既存のrobots.txtファイルがすべてのクローラーをブロックしている場合、歓迎したい検索クローラー用に個別のグループを追加します。

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

Keep all other crawlers out.

User-agent: * Disallow: /

特定のグループを使用する場合、各グループ内で機密パスのルールを繰り返します。一部のクローラーは、ワイルドカードグループと組み合わせるのではなく、最も具体的な一致グループを使用します。Bingはこの動作を直接文書化しており、Googleはクローラー固有のグループに関する個別のガイダンスを提供しています。(bing.com)

robots.txtの重要な制限事項

  • クローラーはrobots.txtを無視することができます。
  • 悪意のあるクローラーは、信頼できるクローラーを装うことができます。
  • ブロックされたページでも、そのタイトルやウェブアドレスによって知られる可能性があります。
  • Robots.txtは、パスワード、プライベートファイル、顧客記録、または機密のアプリケーションプログラミングインターフェースを保護しません。
  • Crawl-delayディレクティブはRobots Exclusion Protocolのコアの一部ではなく、すべてのクローラーでサポートされているわけではありません。AnthropicとBingはサポートを文書化していますが、AppleはApplebotがクロール遅延に従わないと述べています。(rfc-editor.org)

メタタグとHTTPヘッダー

公開ページの例

公開記事の場合、明確なタイトル、著者、正規のウェブアドレス、公開日、および更新日を使用します。

html

max-snippetディレクティブは主にGoogle向けに文書化されています。すべての人工知能クローラーがすべてのメタディレクティブをサポートしていると仮定しないでください。

プライベートまたは機密ページの例

html

これは、検索結果に表示されるべきではないページに使用します。クローラーがディレクティブを認識できる十分な期間、ページはクロール可能な状態を保つ必要があります。ページを本当にプライベートに保つ必要がある場合は、代わりに認証またはパスワード保護を使用してください。(developers.google.com)

検索スニペットから機密性の高いセクションのみを非表示にする

Googleは、HTMLページの特定のセクションに対してdata-nosnippetをサポートしています。

html

This paragraph may be shown in a search result.

Personal telephone numbers, private email addresses, or internal notes go here.

これは連絡先の詳細、内部メモ、またはユーザー生成情報に役立ちます。すべての人工知能システムに対する普遍的な指示ではありません。(developers.google.com)

ファイルにX-Robots-Tagヘッダーを使用する

メタタグはポータブルドキュメントファイル、画像、または動画ファイル内に配置できません。代わりにHTTP応答ヘッダーを使用します。

text X-Robots-Tag: noindex, nosnippet

検索可能ではあるが、スニペットや人工知能の回答にテキストを提供すべきではないページには、以下を使用します。

text X-Robots-Tag: nosnippet

GoogleはHTML以外のリソースに対してX-Robots-Tagを文書化しており、AppleもApplebotに対してこれをサポートしています。(developers.google.com)

Apple固有の制御

Appleは以下をサポートしています。

html

Appleによると、nosnippetは、Appleモデルが出力を生成する際に、ページが追加のコンテキストや現在のコンテンツとして使用されるのを防ぎます。ページは引き続きApple Search、Spotlight、Siri、Safariを通じて発見可能である可能性があります。(support.apple.com)

ペイウォールのあるページの場合、Appleは以下の構造化データもサポートしています。

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Appleによると、そのようなページは検索結果の対象となる可能性がありますが、人工知能の回答のための追加のコンテキストとしては使用されません。(support.apple.com)

クローラーのインターネットプロトコルアドレスを検証する方法

ユーザーエージェントの一致だけでは不十分な理由

このようなルールは脆弱です。

text if User-Agent contains "GPTBot": allow

誰でもそのテキストを送信できます。より良いルールは次のとおりです。

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

X-Forwarded-Forヘッダーは、組織が制御するプロキシまたはコンテンツデリバリーネットワークからのものでない限り、信頼しないでください。

プロバイダーの検証方法

プロバイダー推奨される検証方法
OpenAIOAI-SearchBot、GPTBot、OAI-AdsBotに関するOpenAIクローラーのドキュメントで公開されているライブのインターネットプロトコルアドレスフィードを使用します。固定範囲をファイアウォールにコピーするのではなく、自動的に更新します。
GoogleGoogleが公開しているクローラー範囲を使用するか、逆引きおよび正引きドメインネームシステム(DNS)チェックを実行します。本物のGoogleクローラーは、承認されたGoogleホスト名に解決され、元のIPアドレスに逆解決されるはずです。
Anthropic現在公開されているクローラーアドレスフィードを二次的なネットワークチェックとして使用します。Anthropicの主要なオプトアウト方法は引き続きrobots.txtです。
Perplexityユーザーエージェントと現在のPerplexityBotまたはPerplexity-Userアドレスフィードを組み合わせます。Perplexityは、Webアプリケーションファイアウォール(WAF)ルールで両方の条件を組み合わせることを具体的に推奨しています。
Appleapplebot.apple.com下の逆引きドメインネームシステム(DNS)検証を使用し、その後正引きルックアップを実行します。AppleはJSONフィードで現在のアドレス範囲も公開しています。
Common Crawlcrawl.commoncrawl.org下の逆引きドメインネームシステム(DNS)検証と現在のCCBotアドレスフィードを使用します。Common Crawlは、一部のIPv6トラフィックでは逆引き検証がまだ利用できないことに注意しています。
Microsoft公式のVerify BingbotツールまたはMicrosoftが文書化した逆引きおよび正引きルックアップ方法を使用します。
AmazonAmazonが公開しているクローラーアドレスリストを使用し、適切なAmazonユーザーエージェントと照合します。

Google、Apple、Common Crawl、OpenAI、Anthropic、Perplexityはすべて、プロバイダー固有の方法またはアドレスフィードを公開しています。これらのリストは変更される可能性があるため、手動でコピーした永続的なリストよりも、定期的な更新プロセスの方が安全です。(developers.google.com)

シンプルなファイアウォールの設計は次のようになるかもしれません。

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

クラウドプロバイダー全体に広範な許可ルールを適用しないでください。正当なクローラーがクラウドインフラストラクチャを使用する可能性はありますが、そのクラウドプロバイダーからのほとんどのトラフィックが必ずしもクローラーであるとは限りません。

オープンライセンスがインクルージョンに与える影響

CC BY 4.0を平易な言葉で説明する

クリエイティブ・コモンズ 表示 4.0 国際ライセンス(一般にCC BY 4.0と呼ばれる)は、以下のことを許可します。

  • 作品をコピーし、再配布する
  • それを改変、翻訳、リミックスし、基盤として利用する
  • 商業的に利用する

主な条件は次のとおりです。

  • 適切なクレジットを表示する
  • ライセンスへのリンクを貼る
  • 変更が加えられたかどうかを示す
  • 元の作成者が再利用を推奨していると示唆しない
  • ライセンスで許可されている使用を妨げる法的または技術的制限を追加しない

クリエイティブ・コモンズはまた、このライセンスがプライバシー権、肖像権、著作者人格権、商標権、特許権、または第三者の素材をカバーしない可能性があると警告しています。(creativecommons.org)

ライセンス自体はクローラーへの招待ではない

ページに「CC BY 4.0」と記載しても、組織がそれをクロールすることを保証するものではありません。クローラーは以下の理由でブロックされる可能性があります。

  • robots.txt
  • コンテンツデリバリーネットワーク
  • Webアプリケーションファイアウォール
  • レート制限
  • JavaScriptチャレンジ
  • ログインウォール
  • サーバー応答の不良
  • アクセスできないサイトマップ

逆に、クローラーを許可しても、その後のあらゆる使用に必要なすべての著作権許可が自動的に付与されるわけではありません。robots.txtとライセンスは連携して設計されるべきです。

CC BYがより広範なインクルージョンをサポートできる理由

明確な許容的ライセンスは、データチーム、検索システム、アシスタントオペレーターにとってパブリッシャーのポリシーを理解しやすくする可能性があります。これにより、著作権の許可が必要な場合のコピー、改変、商業利用、翻訳、再配布に関する不確実性を減らすことができます。

しかし、クリエイティブ・コモンズは、人工知能のトレーニングは法的に複雑であると説明しています。制限的なライセンスは、常にトレーニングを防ぐ効果的な方法とは限りません。なぜなら、一部のトレーニング使用は著作権の例外または制限によって許可される可能性があるためです。クリエイティブ・コモンズはまた、ライセンス条件を機械学習やモデル出力に適用することが難しい場合があるとも指摘しています。(creativecommons.org)

実用的な教訓は次のとおりです。

真に広範な合法的再利用を望む場合にCC BYを使用してください。制限的なクリエイティブ・コモンズライセンスを、人工知能トレーニングの確実なオプトアウトとして使用しないでください。

帰属表示は情報源の明確さを向上させる

クリエイティブ・コモンズはTASLメソッドを推奨しています。

  • タイトル (Title)
  • 著者 (Author)
  • 情報源 (Source)
  • ライセンス (License)

例:

「最大限のインクルージョンのためのライセンスとロボット」、Example Publishing、https://www.example.org/articles/ai-crawlers、クリエイティブ・コモンズ 表示 4.0 国際ライセンスの下で提供。変更点:クローラーインベントリを更新。

明確な帰属表示は、すべてのアシスタントにページを引用することを強制するものではありません。しかし、システムがページのタイトル、著者、情報源、およびライセンス情報を抽出する際には、正しい引用が容易になります。(wiki.creativecommons.org)

構造化された記事情報を追加する

可視情報と構造化データを一緒に使用します。

html

Googleは、明確な著者情報、著者ページ、公開日、更新日、および安定した正規ページを推奨しています。これらのシグナルは、検索システムが誰が素材を作成し、どのバージョンが信頼できるかを理解するのに役立ちます。ただし、ランキング、インクルージョン、または引用を保証するものではありません。(developers.google.com)

オープンで引用しやすいサイトのための法的定型文

以下はサンプル言語であり、法的助言ではありません。管轄区域、所有構造、プライバシー義務、および第三者のコンテンツに合わせて顧問弁護士に調整してもらってください。

CC BY 4.0 ライセンス声明

text

コンテンツライセンス

別途記載がない限り、このページの元のテキストおよび元の編集素材は、クリエイティブ・コモンズ 表示 4.0 国際ライセンスの下で提供されます。

https://creativecommons.org/licenses/by/4.0/

この許可は、ライセンス条項が遵守されることを条件として、複製、再配布、翻案、翻訳、商業利用、機械可読処理、検索インデックス作成、取得、要約、および人工知能システムでの使用を許可します。

推奨される帰属表示:

「[ページタイトル]」、[著者または組織]、[正規ページアドレス]、[日付]公開または更新、クリエイティブ・コモンズ 表示 4.0 国際ライセンスの下で提供。変更点:[変更点を記述、または「なし」と記述]。

合理的に可能な限り、著者、発行者、情報源、ライセンス、および変更情報を保持してください。この推奨される帰属表示ガイドは、クリエイティブ・コモンズライセンスに制限を追加するものではなく、ライセンステキストに取って代わるものでもありません。

「人工知能システムを含む」というフレーズは、パブリッシャーの意図を明確にします。これは、パブリッシャーが他者が作成した素材の権利を所有しているかのように見せかけるために使用すべきではありません。

ブランド、プライバシー、および第三者の権利に関する通知

text

ブランド、プライバシー、および第三者の権利

上記のライセンスは、ライセンスされていると特定された元の素材のみをカバーします。以下の使用を許可するものではありません。

  • 商標、サービスマーク、ロゴ、またはトレードドレス
  • 人の名前、画像、または肖像
  • プライベート、機密、アカウント、健康、財務、またはセキュリティ情報
  • 別途ライセンスされていると特定されない限り、ユーザー投稿
  • 写真、イラスト、地図、動画、音楽、引用、またはその他の第三者の素材
  • 「すべての権利を留保」と特定されたコンテンツ、または別のライセンスの対象となるコンテンツ

Example Publishingの名称、ロゴ、およびマークの使用は、スポンサーシップ、承認、パートナーシップ、または推奨を示唆するものであってはなりません。元のページにリンクし、引用、言い換え、要約、および生成された素材を明確に区別してください。

この文言は重要です。なぜなら、クリエイティブ・コモンズライセンスは、ページに関連するあらゆる種類の法的権利を自動的に付与するわけではないからです。(creativecommons.org)

検索およびアシスタントによる引用ガイダンス

text

検索およびアシスタントによる引用ガイダンス

当サイトのライセンスされた素材に対する、準拠する検索インデックス作成、ユーザー要求による取得、引用、および要約を歓迎します。

このサイトを引用する際は、ページタイトル、著者または発行者、正規ページアドレス、公開日または更新日、および情報源への直接リンクを使用してください。使用された情報源の中でこの情報源を一つの入力として特定し、生成された分析と引用された素材を区別し、Example Publishingが生成された回答、製品、人物、またはサービスを推奨していると述べたり示唆したりしないでください。

このガイダンスは、正確性と帰属表示を向上させることを目的としています。適用されるコンテンツライセンスを超える権利を付与するものではなく、商標、個人情報、機密情報、または第三者の素材をライセンスするものではありません。

検索での可視性を望むが、広範なトレーニングライセンスを付与したくない場合

text

検索アクセスと著作権

当社の公開ページは、robots.txtファイルで特定された準拠する検索および取得クローラーによってアクセスされることがあります。この許可は、発見、検索結果、ユーザー要求による取得、および引用をサポートすることを目的としています。

別途ライセンスが表示されている場合を除き、元のコンテンツはすべての権利を留保します。公開ページへのアクセスは、適用法によって提供される権利を超えて、モデル開発、トレーニング、再配布、商業的再利用、または派生作品の作成のための別のライセンスを付与するものではありません。

この素材に言及する際は、正規のページアドレスと発行者を引用してください。このサイト上のいかなるものも、商標、ロゴ、個人情報、機密情報、または第三者のコンテンツを使用する許可を与えるものではありません。

同じ素材に対してCC BY声明と全権利留保声明を一緒に配置しないでください。どのコンテンツにどのライセンスが適用されるかを明確に特定してください。

オープンライセンスのリスク-ベネフィットマトリックス

著作権法と人工知能トレーニングのルールは国によって異なり、まだ未解決です。米国著作権局はこれらの問題を検討し続けている一方、クリエイティブ・コモンズは人工知能トレーニングを事実固有で法的に複雑であると説明しています。(copyright.gov)

アプローチインクルージョン可能性主なメリット主なリスク最適な利用シーン
CC BY 4.0非常に高い著作権の許可が必要な場合の広範な複製、翻案、商業利用、翻訳、インデックス作成、モデル関連の再利用商業的競合他社がコンテンツを再利用または翻案する可能性あり。帰属表示が不完全な場合あり。ライセンスではプライバシー、商標、第三者の権利を制御できない最も広範な合法的な再利用と強力な情報源帰属表示を望むパブリッシャー
CC BY-SA 4.0高いが、より複雑オープンな共有サイクルを奨励し、改変物も互換性のある条件で提供することを要求継承(ShareAlike)ルールをデータセット、モデルトレーニング、公開出力に適用するのが難しい場合あり。不確実性のために一部の組織が素材を避ける可能性ありダウンストリームの改変物もオープンに保ちたいオープン教育プロジェクトや公共利益プロジェクト
CC BY-NC 4.0中または低主に商業的利益または金銭的報酬を目的とした使用を制限「非営利」の解釈が難しい場合あり。商業的な検索、モデル、アシスタントの使用を除外する可能性あり。トレーニングのオプトアウトを保証するものではない非営利、教育、またはコミュニティでの使用を目的とした素材
CC BY-ND 4.0改変を制限しつつ共有を許可翻訳、変換、および一部のアシスタントの使用事例は法的に不確実になる可能性あり。要約やリミックスを行うシステムにとっては魅力的ではない公式通知や変更してはならない作品
CC0 またはパブリックドメイン献呈非常に高い再利用を簡素化し、法的に有効な場合、ほとんどの著作権条件を削除帰属表示の義務なし。ブランド表現に対する制御が弱い。プライバシー、商標、肖像権は別途維持される事実、データセット、参照資料、または無制限の再利用を目的とした作品
全権利留保とオープン検索クロール検索では高いが、トレーニングでは低い広範な再利用ライセンスを付与することなく、検索と引用の可視性を維持できるモデル開発者にとって法的不確実性が増す。トレーニングデータセットや商業的再利用システムへの組み込みが減少する可能性あり発見と引用を望むが、より広範なライセンスは別途交渉したいパブリッシャー

多くの組織にとって最もバランスの取れた戦略は次のとおりです。

  • オリジナルの公開された編集テキストにはCC BY 4.0を使用する
  • 第三者の素材には個別のラベルを付ける
  • 個人情報や機密情報を公開しない
  • 検索および取得クローラーを許可する
  • 組織がその使用を真に受け入れる場合にのみ、モデル開発クローラーを許可する
  • 明確な帰属表示と正規リンクを使用する
  • 個別のブランド通知を通じて商標を保護する

実用的な実装チェックリスト

コンテンツとライセンス

  • 各ページ、画像、グラフ、動画、および引用の所有者を特定します。
  • 組織が権利を管理する素材のみをライセンスします。
  • 第三者の素材は別途マークします。
  • 可視のライセンス声明を追加します。
  • タイトル、著者、情報源、およびライセンスを使用して、推奨される引用方法を提供します。
  • ロゴ、商標、個人データ、および機密情報は、ライセンスの範囲外に保ちます。

Robots.txt

  • すべてのホストのルートに公開robots.txtファイルを作成します。
  • 検索クローラーとトレーニングクローラーを個別に許可します。
  • 管理、アカウント、チェックアウト、プライベート、および内部アプリケーションパスをブロックします。
  • セキュリティのためにrobots.txtに依存しないでください。
  • 主要なウェブサイト展開のたびにファイルをテストします。

メタタグ

  • 正規リンクを使用します。
  • 著者、公開日、および更新日を追加します。
  • 検索に表示されるべきではないページにはnoindexを使用します。
  • サポートされている場合は、機密性の高い抜粋に対してnosnippetまたはdata-nosnippetを使用します。
  • ポータブルドキュメントファイル、画像、その他のHTML以外のリソースにはX-Robots-Tagを使用します。
  • クローラーがメタタグを読み取る前にページをフェッチできる必要があることを覚えておいてください。

ネットワークセキュリティ

  • ユーザーエージェント文字列、送信元アドレス、応答コード、およびリクエストパスをログに記録します。
  • 公式のアドレスフィードまたはドメインネームシステム(DNS)方法を使用して、信頼できるクローラーを検証します。
  • アドレスフィードを自動的に更新します。
  • ユーザーエージェントと送信元アドレスのチェックを組み合わせます。
  • 検証されたクローラーに無制限のアクセスを与えるのではなく、レート制限を適用します。
  • 信頼できるクローラーを主張するが検証に失敗するリクエストには、チャレンジまたはブロックを行います。

測定

以下を追跡します。

  • 人工知能検索サービスからの訪問数
  • 元のページへの参照元
  • 引用頻度
  • クローラーごとのサーバー負荷
  • 403404、または429を返すリクエスト
  • 意図しないパスへのクローラーアクセス
  • 記事公開後に現在の記事が見つけられているか

結論

最大限のインクルージョンには、単一の包括的な許可ではなく、選択的な開放性が必要です。

robots.txtを使用して、検索、ユーザー取得、トレーニング、および公開データセットのクロールを分離します。メタタグとHTTPヘッダーを使用してインデックス作成とスニペットを管理します。プライベートなものには認証を使用します。ユーザーエージェント名だけを信頼するのではなく、クローラーのインターネットプロトコルアドレスを検証します。

CC BY 4.0のような許容的ライセンスは、真に広範な再利用を望む場合にそれを容易にします。タイトル、著者、情報源、ライセンス、正規ページ、更新日といった明確な帰属表示情報は、検索システムやアシスタントが正しい情報源を特定し、引用するのを容易にすることができます。

したがって、最も強力なパブリッシングポリシーは次のとおりです。

**発見されたい公開コンテンツを開放し、再利用されたい素材には明確にライセンスを付与し、所有していない素材にはマークを付け、サーバーレベルでプライベート情報を保護し、すべてのクローラーに個別の、レビュー可能な許可を与えること。

関連記事

このコンテンツが気に入りましたか?

最新のコンテンツマーケティングのインサイトと成長ガイドを受け取るには、ニュースレターを購読してください。

この記事は情報提供のみを目的としています。コンテンツや戦略は、特定のニーズによって異なる場合があります。
最大限のインクルージョンのためのライセンスとロボット:AIクローラーを歓迎する方法 | AutoPod