许可和机器人最大包容性:如何欢迎人工智能爬虫
更新于2026年8月25日
现在,网站有不止一种方式来接触受众。一个页面可能通过Google搜索被找到,通过ChatGPT被总结,通过Perplexity被引用,用于Claude搜索,通过Apple服务显示,或被公共网络档案库收集。
这些系统并非都使用相同的爬虫或遵循相同的规则。一个屏蔽了GPTBot的网站,如果允许OAI-SearchBot,仍可能出现在ChatGPT搜索中。一个允许Applebot的网站可以在Apple搜索中保持可见,同时阻止Applebot-Extended用于人工智能模型训练。Google的Google-Extended根本不是一个普通的爬虫;它是一个robots.txt控制令牌。
因此,最好的策略不是简单地“允许人工智能”或“阻止人工智能”。它应该是为以下各项创建单独的权限:
- 搜索与发现
- 用户请求检索
- 模型开发与训练
- 公共数据集
- 敏感、私人或受限材料
本文提供了一份当前的爬虫清单、robots.txt示例、元标签指南、IP地址验证方法、知识共享许可协议建议、法律样板条款以及风险效益矩阵。
每个发布者都应了解的四种控制
1. robots.txt控制请求的爬取
A robots.txt文件告诉合规的自动化客户端它们可以请求哪些页面。它对于管理爬虫流量和表达发布者的偏好很有用。
然而,robots.txt不是一个访问控制系统。《机器人排除协议》声明其规则并非访问授权。Google也警告说,如果其他页面链接到某个被屏蔽的地址,它仍然可能出现在搜索结果中。对于机密信息,请使用密码、身份验证或服务器端访问控制。(rfc-editor.org)
2. 元标签控制索引和摘要
机器人元标签和X-Robots-Tag响应头可以控制页面是否被索引,以及搜索引擎是否可以显示摘要。
这些控制通常只有在爬虫被允许抓取页面后才能可见。如果robots.txt首先屏蔽了页面,爬虫可能永远看不到元标签。(developers.google.com)
3. 网络控制验证爬虫身份
用户代理名称很容易被复制。攻击者可以发送一个声称是GPTBot、Googlebot或PerplexityBot的请求。
更强有力的方法结合了:
- 声称的用户代理
- 已发布的IP地址范围
- 反向域名系统(DNS)验证
- 正向域名系统(DNS)验证
- 速率限制和请求监控
4. 许可协议授予重用权利
Robots.txt说明了要求爬虫做什么。许可协议说明了在需要版权许可的情况下,个人或组织可以合法地使用材料做什么。
这些是不同的工具。一个宽松的许可协议可以减少法律不确定性,但它不能保证爬虫会访问页面,模型会使用它,或者助手会引用它。
重要爬虫清单
以下清单根据2026年8月25日可用的提供商文档进行了核对。用户代理名称、目的和IP地址范围可能会发生变化,因此生产系统应使用提供商的最新文档和实时地址馈送。
| 提供商 | 爬虫或robots.txt令牌 | 主要目的 | 重要控制 |
|---|---|---|---|
| OpenAI | OAI-SearchBot | 为ChatGPT搜索查找和分析页面 | 允许它以提高页面出现在ChatGPT搜索结果中的机会。 |
| OpenAI | GPTBot | 收集可能用于训练OpenAI生成式人工智能模型的页面 | 与搜索分开允许或不允许。 |
| OpenAI | ChatGPT-User | 用户要求ChatGPT或自定义GPT访问页面后获取页面 | 它是用户触发的,而不是自动网络爬虫,因此robots.txt规则可能不适用。 |
| OpenAI | OAI-AdsBot | 检查作为ChatGPT广告目的地提交的网页 | 主要与广告商相关。收集的内容不用于训练生成式人工智能基础模型。 |
Googlebot | 主要的Google搜索爬虫 | 控制常规Google搜索爬取。 | |
Googlebot-Image、Googlebot-Video、Googlebot-News | 图片、视频和Google新闻 | 这些具有单独的robots.txt令牌,可以独立控制。 | |
GoogleOther | 针对包括研发在内的各种产品团队的通用Google爬取 | 它不代表某一个具体的Google产品。 | |
Google-Extended | 控制Google抓取的内容是否可用于Gemini模型训练和某些基础系统 | 它是一个robots.txt控制令牌,而不是一个单独的请求用户代理。它不影响普通的Google搜索收录。 | |
| Anthropic | ClaudeBot | 收集可能用于Claude模型开发的公共网页内容 | 禁用它以表明未来的材料应从Anthropic训练数据集中排除。 |
| Anthropic | Claude-SearchBot | 提高Claude搜索结果质量 | 允许它以在Claude搜索中可见。 |
| Anthropic | Claude-User | 响应用户对Claude的请求获取页面 | 与自动爬取分开。 |
| Perplexity | PerplexityBot | 为Perplexity搜索结果索引页面 | Perplexity表示此爬虫不用于收集人工智能基础模型训练内容。 |
| Perplexity | Perplexity-User | 用户请求页面后获取页面 | Perplexity的文档称此抓取器通常忽略robots.txt,因为它响应的是用户请求。 |
| Apple | Applebot | 支持Apple搜索、Spotlight、Siri、Safari和其他Apple体验 | 允许它以在Apple服务中被发现。 |
| Apple | Applebot-Extended | 控制Applebot抓取的内容是否可用于训练Apple基础模型 | 它本身不抓取页面。它是一个数据使用控制。 |
| Common Crawl | CCBot | 为Common Crawl的开放网络档案库收集公共网络数据 | 它不是一个助手,但其数据集可供研究人员和人工智能开发者使用。 |
| Microsoft | Bingbot | 主要的Bing搜索爬虫 | 允许它以在Bing中被发现和搜索可见。 |
| Microsoft | MicrosoftPreview、BingVideoPreview | 适用于Microsoft产品的页面和视频预览 | 这些可以与Bingbot分开控制。 |
| Amazon | Amzn-SearchBot | Amazon搜索和内容发现 | Amazon表示它不为生成式人工智能模型训练抓取内容。 |
| Amazon | Amzn-User | 响应用户操作(包括Alexa请求)获取当前信息 | 由用户触发,与自动搜索爬取分开。 |
OpenAI将其搜索、训练、广告和用户触发的爬虫记录为单独的控制。其文档特别建议允许OAI-SearchBot用于ChatGPT搜索,同时将GPTBot单独用于训练偏好。(developers.openai.com)
Google也类似地将Googlebot、GoogleOther和Google-Extended分开。Google-Extended没有自己的HTTP请求用户代理,阻止它不会将页面从Google搜索中移除。(developers.google.com)
Anthropic文档记录了ClaudeBot、Claude-SearchBot和Claude-User的独立角色。Anthropic还声明其机器人遵循robots.txt并支持非标准的Crawl-delay指令。(support.anthropic.com)
Perplexity区分了自动搜索爬取和用户请求获取。其最新文档称,PerplexityBot尊重robots.txt,而Perplexity-User通常不尊重,因为它响应的是用户请求。(docs.perplexity.ai)
Apple的最新文档也做了相同的搜索与训练区分:Applebot支持发现,而Applebot-Extended允许发布者控制训练使用,而不会将页面从Apple搜索中移除。(support.apple.com)
推荐的robots.txt配置
将robots.txt放置在每个主机的根目录下,例如:
text https://www.example.org/robots.txt
规则适用于文件提供所在的特定主机、协议和端口。单独的子域可能需要自己的文件。(developers.google.com)
配置1:最大包容性
当公共编辑内容可能被合规爬虫发现、总结、引用、索引和收集时使用此配置。
text
公共页面可供合规爬虫访问。
User-agent: * Allow: /
将私人、交易和管理路径排除在外。
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
这允许具名爬虫,包括OpenAI、Google、Anthropic、Perplexity、Apple、Common Crawl、Microsoft和Amazon,除非有其他特定规则阻止它们。
请勿在此配置下方放置如User-agent: * Disallow: /的通用规则。后续或更具体的组可能会改变爬虫对文件的解释方式。
配置2:允许搜索但阻止模型开发爬虫
对于希望获得引用和搜索流量,但又不希望允许进行模型开发收集的发布者来说,这通常是最佳折衷方案。
text
阻止OpenAI模型开发爬取。
User-agent: GPTBot Disallow: /
阻止Anthropic模型开发爬取。
User-agent: ClaudeBot Disallow: /
阻止Google模型训练和相关基础系统使用。
User-agent: Google-Extended Disallow: /
阻止Apple基础模型训练使用。
User-agent: Applebot-Extended Disallow: /
可选:阻止Common Crawl数据集收集。
User-agent: CCBot
Disallow: /
允许普通的搜索和检索爬取,敏感路径除外。
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
此配置将OAI-SearchBot、Claude-SearchBot、PerplexityBot、Googlebot和Applebot保留在通配符组的覆盖下。它也使搜索和训练权限保持独立。
对于Apple,在允许Applebot的同时阻止Applebot-Extended可以保留通过Apple服务的发现。对于Google,阻止Google-Extended不会阻止普通的Google搜索。(developers.google.com)
配置3:明确允许选定的搜索爬虫
如果现有的robots.txt文件阻止了所有爬虫,请为您希望欢迎的搜索爬虫添加单独的组。
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
阻止所有其他爬虫。
User-agent: * Disallow: /
使用特定组时,请在每个组内重复敏感路径规则。有些爬虫使用最具体的匹配组,而不是将其与通配符组结合。Bing直接记录了这种行为,Google提供了关于特定爬虫组的单独指南。(bing.com)
robots.txt的重要局限性
- 爬虫可以忽略robots.txt。
- 恶意爬虫可以伪装成受信任的爬虫。
- 被阻止的页面仍可能因其标题或网址而被知晓。
- Robots.txt不保护密码、私人文件、客户记录或机密应用程序编程接口。
Crawl-delay指令不属于《机器人排除协议》的核心部分,并非所有爬虫都支持。Anthropic和Bing文档支持此指令,而Apple表示Applebot不遵循爬取延迟。(rfc-editor.org)
元标签和HTTP头
公共页面示例
对于公共文章,请使用清晰的标题、作者、规范网址、发布日期和修改日期。
html
max-snippet指令主要针对Google进行了说明。不要假设每个人工智能爬虫都支持所有元指令。
私人或敏感页面示例
html
对于不应出现在搜索结果中的页面使用此标签。页面必须保持可抓取足够长的时间,以便爬虫看到此指令。如果页面必须真正保持私密,请改用身份验证或密码保护。(developers.google.com)
仅从搜索摘要中隐藏敏感部分
Google支持针对HTML页面特定部分的data-nosnippet:
html
此段落可能显示在搜索结果中。
这对于联系方式、内部备注或用户生成的信息很有用。它并非适用于所有人人工智能系统的通用指令。(developers.google.com)
对文件使用X-Robots-Tag头
元标签不能放置在便携文档文件、图片或视频文件内。请改用HTTP响应头:
text X-Robots-Tag: noindex, nosnippet
对于应保持可搜索但不应为摘要或人工智能答案提供文本的页面,请使用:
text X-Robots-Tag: nosnippet
Google记录了X-Robots-Tag用于非HTML资源,Apple也支持Applebot使用它。(developers.google.com)
Apple特定控制
Apple支持:
html
Apple表示nosnippet可防止页面在Apple模型生成输出时用作额外上下文和当前内容。页面仍可能通过Apple搜索、Spotlight、Siri和Safari保持可发现性。(support.apple.com)
对于付费墙页面,Apple还支持使用以下结构化数据:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple表示此类页面仍可能符合搜索结果的条件,但不会用作人工智能答案的额外上下文。(support.apple.com)
如何验证爬虫IP地址
为什么仅匹配用户代理是不够的
像这样的规则很脆弱:
text if User-Agent contains "GPTBot": allow
任何人都可以发送该文本。更好的规则是:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
除非X-Forwarded-For头来自您的组织控制的代理或内容分发网络,否则不要信任它。
提供商验证方法
| 提供商 | 推荐验证方法 |
|---|---|
| OpenAI | 使用OpenAI爬虫文档中发布的OAI-SearchBot、GPTBot和OAI-AdsBot的实时IP地址馈送。自动刷新它们,而不是将固定范围复制到防火墙中。 |
| 使用Google发布的爬虫范围或执行反向和正向域名系统检查。真正的Google爬虫应解析到经批准的Google主机名并解析回原始地址。 | |
| Anthropic | 使用当前发布的爬虫地址馈送作为辅助网络检查。Anthropic的主要选择退出方法仍是robots.txt。 |
| Perplexity | 将用户代理与当前的PerplexityBot或Perplexity-User地址馈送结合使用。Perplexity特别建议在Web应用防火墙规则中结合这两个条件。 |
| Apple | 使用applebot.apple.com下的反向域名系统验证,然后执行正向查找。Apple还在JSON馈送中发布当前地址范围。 |
| Common Crawl | 使用crawl.commoncrawl.org下的反向域名系统验证和当前的CCBot地址馈送。Common Crawl指出,某些IPv6流量尚未提供反向验证。 |
| Microsoft | 使用官方的Verify Bingbot工具或Microsoft文档中记录的反向和正向查找方法。 |
| Amazon | 使用Amazon发布的爬虫地址列表,并将其与适当的Amazon用户代理匹配。 |
Google、Apple、Common Crawl、OpenAI、Anthropic和Perplexity都发布了特定于提供商的方法或地址馈送。这些列表可能会更改,因此计划的更新过程比手动复制的永久列表更安全。(developers.google.com)
一个简单的防火墙设计可能如下所示:
text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match
rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers
不要将广泛的允许规则应用于整个云提供商。合法的爬虫可能使用云基础设施,但来自该云提供商的大部分流量不一定是爬虫。
开放许可如何影响包容性
CC BY 4.0 白话解释
知识共享署名4.0国际许可协议,通常称为CC BY 4.0,允许人们:
- 复制和再分发作品
- 改编、翻译、混编和在此基础上创作
- 用于商业目的
主要条件是:
- 给予适当的署名
- 链接到许可协议
- 注明是否进行了更改
- 不得暗示原作者认可此重用
- 不得添加阻止许可协议允许使用的法律或技术限制
知识共享还警告说,该许可协议可能不涵盖隐私权、肖像权、精神权利、商标权、专利权或第三方材料。(creativecommons.org)
许可协议本身并非爬虫邀请
在页面上放置“CC BY 4.0”并不能保证组织会爬取它。爬虫仍可能被以下因素阻止:
- robots.txt
- 内容分发网络
- Web应用防火墙
- 速率限制
- JavaScript挑战
- 登录墙
- 糟糕的服务器响应
- 不可访问的站点地图
反之,允许爬虫访问并不自动授予后续所有使用所需的全部版权许可。robots.txt和许可协议应协同设计。
为什么CC BY能支持更广泛的包容性
清晰的开放许可协议可以使发布者的政策更容易被数据团队、搜索系统和助手操作员理解。当复制、改编、商业使用、翻译和再分发等活动需要版权许可时,它可以减少不确定性。
然而,知识共享解释说,人工智能训练在法律上是复杂的。限制性许可协议并非总是阻止训练的有效方式,因为某些训练使用可能被版权例外或限制所允许。知识共享还指出,许可条件可能难以应用于机器训练和模型输出。(creativecommons.org)
实际教训是:
当您真心希望广泛合法重用时,请使用CC BY。不要将限制性知识共享许可协议用作保证的人工智能训练选择退出方式。
署名可提高来源清晰度
知识共享推荐TASL方法:
- 标题 (Title)
- 作者 (Author)
- 来源 (Source)
- 许可 (License)
例如:
“许可和机器人最大包容性,”示例出版,https://www.example.org/articles/ai-crawlers,依据知识共享署名4.0国际许可协议授权。更改说明:更新了爬虫清单。
清晰的署名并不能强制每个助手引用页面。但当系统提取页面的标题、作者、来源和许可信息时,它确实使正确引用变得更容易。(wiki.creativecommons.org)
添加结构化文章信息
同时使用可见信息和结构化数据:
html
Google推荐清晰的作者信息、作者页面、发布日期、修改日期和稳定的规范页面。这些信号可以帮助搜索系统理解谁创建了材料以及哪个版本是权威的。它们不能保证排名、收录或引用。(developers.google.com)
开放、友引网站的法律样板条款
以下是示例语言,而非法律建议。请律师根据您的司法管辖区、所有权结构、隐私义务和第三方内容进行调整。
CC BY 4.0 许可声明
text
内容许可
除非另有说明,本页面上的原创文本和原创编辑材料均根据知识共享署名4.0国际许可协议授权:
https://creativecommons.org/licenses/by/4.0/
此许可允许在遵守许可条款的前提下进行复制、再分发、改编、翻译、商业使用、机器可读处理、搜索索引、检索、总结以及在人工智能系统中使用。
首选署名方式:
“[页面标题]”,由[作者或组织]提供,[规范页面地址],发布或更新于[日期],依据知识共享署名4.0国际许可协议授权。更改说明:[描述更改,或说明“无”]。
请在合理可能的情况下,保留作者、发布者、来源、许可和修改信息。此首选署名指南不为知识共享许可协议添加额外限制,也不取代许可协议文本。
“包括人工智能系统”这一短语阐明了发布者的意图。它不应用于假装发布者拥有他人创建材料的权利。
品牌、隐私和第三方权利声明
text
品牌、隐私和第三方权利
上述许可仅涵盖被标识为已获许可的原创材料。它不授予使用以下内容的许可:
- 商标、服务标志、徽标或商业外观
- 人物姓名、图像或肖像
- 私人、机密、账户、健康、财务或安全信息
- 用户提交的内容,除非它们被单独标识为已获许可
- 照片、插图、地图、视频、音乐、引文或其他第三方材料
- 标识为“保留所有权利”或受单独许可协议约束的内容
使用示例出版的名称、徽标和标志不得暗示赞助、批准、合作或认可。请链接到原始页面,并清楚区分引文、意译、摘要和生成材料。
此语言很重要,因为知识共享许可协议不会自动授予与页面相关的每种法律权利。(creativecommons.org)
搜索和助手引用指南
text
搜索和助手引用指南
我们欢迎对本网站上的许可材料进行合规的搜索索引、用户请求检索、引用和总结。
引用本网站时,请使用页面标题、作者或发布者、规范页面地址、发布或更新日期,以及指向来源的直接链接。请将来源标识为所用来源之一,将生成的分析与引用材料区分开来,并且不要声明或暗示示例出版认可生成的答案、产品、人物或服务。
本指南旨在提高准确性和署名。它不授予超出适用内容许可的权利,也不许可商标、个人信息、机密信息或第三方材料。
如果您希望搜索可见性,但不希望授予广泛的训练许可
text
搜索访问和版权
我们的公共页面可由robots.txt文件中标识的合规搜索和检索爬虫访问。此许可旨在支持发现、搜索结果、用户请求检索和引用。
除非另有单独许可,否则原创内容保留所有权利。访问公共页面并不授予超出适用法律规定的权利范围的模型开发、训练、再分发、商业重用或创建衍生作品的单独许可。
引用此材料时,请注明规范页面地址和发布者。本网站上的任何内容均不授予使用商标、徽标、个人信息、机密信息或第三方内容的许可。
不要在相同的材料上同时放置CC BY声明和保留所有权利声明。清晰地标识哪种许可协议适用于哪些内容。
开放许可的风险效益矩阵
版权法和人工智能训练规则因国家/地区而异,且仍未确定。美国版权局继续研究这些问题,而知识共享将人工智能训练描述为具体事实且法律复杂。(copyright.gov)
| 方法 | 包容潜力 | 主要优点 | 主要风险 | 最佳适用场景 |
|---|---|---|---|---|
| CC BY 4.0 | 非常高 | 需要版权许可时,允许广泛复制、改编、商业使用、翻译、索引和与模型相关的重用 | 商业竞争对手可能重用或改编内容;署名可能不完善;许可无法控制隐私、商标或第三方权利 | 希望获得最广泛合法重用和强有力来源署名的发布者 |
| CC BY-SA 4.0 | 高,但更复杂 | 鼓励开放共享循环,并要求改编作品在兼容条款下保持开放 | 知识共享署名-相同方式共享规则难以应用于数据集、模型训练和公共输出;一些组织可能因不确定性而避免使用该材料 | 希望下游改编作品保持开放的开放教育和公共利益项目 |
| CC BY-NC 4.0 | 中或低 | 主要限制以商业利益或金钱报酬为目的的使用 | “非商业性”可能难以解释;可能排除商业搜索、模型和助手使用;它不能保证选择退出训练 | 旨在用于非营利、教育或社区用途的材料 |
| CC BY-ND 4.0 | 中 | 允许共享同时限制改编 | 翻译、转换和某些助手使用案例可能变得法律不确定;对于总结或混编系统吸引力较低 | 必须保持不变的官方通知或作品 |
| CC0或公共领域奉献 | 非常高 | 在法律有效的情况下简化重用并移除大多数版权条件 | 无需强制署名;对品牌展示控制薄弱;隐私、商标和肖像权仍独立 | 事实、数据集、参考材料或旨在无限制重用的作品 |
| 保留所有权利加上开放搜索爬取 | 搜索方面高,训练方面低 | 可以在不授予广泛重用许可的情况下保留搜索和引用可见性 | 模型开发者面临更多法律不确定性;可能减少在训练数据集和商业重用系统中的包容性 | 希望获得发现和引用,但更倾向于单独协商更广泛许可的发布者 |
许多组织最平衡的策略是:
- 对原创公共编辑文本使用CC BY 4.0
- 为第三方材料单独标记
- 不公开个人或机密信息
- 允许搜索和检索爬虫
- 仅当组织真正接受该用途时才允许模型开发爬虫
- 使用清晰的署名和规范链接
- 通过单独的品牌声明保护商标
实用实施清单
内容和许可
- 确定每个页面、图片、图表、视频和引用的所有者。
- 仅许可您的组织拥有权利的材料。
- 单独标记第三方材料。
- 添加可见的许可声明。
- 使用标题、作者、来源和许可提供首选引用方式。
- 将徽标、商标、个人数据和机密信息排除在许可范围之外。
Robots.txt
- 在每个主机的根目录下创建一个公共robots.txt文件。
- 将搜索爬虫与训练爬虫分开允许。
- 阻止管理、账户、结账、私人和内部应用程序路径。
- 不要依赖robots.txt进行安全防护。
- 每次重大网站部署后测试文件。
元标签
- 使用规范链接。
- 添加作者、发布日期和修改日期。
- 对不应出现在搜索中的页面使用
noindex。 - 在支持的情况下,对敏感摘录使用
nosnippet或data-nosnippet。 - 对便携文档文件、图片和其他非HTML资源使用
X-Robots-Tag。 - 记住,爬虫必须能够抓取页面才能读取其元标签。
网络安全
- 记录用户代理字符串、源地址、响应代码和请求路径。
- 使用官方地址馈送或域名系统方法验证受信任的爬虫。
- 自动刷新地址馈送。
- 结合用户代理和源地址检查。
- 对已验证的爬虫进行速率限制,而不是给予无限制的访问。
- 挑战或阻止声称是受信任爬虫但未通过验证的请求。
衡量
追踪:
- 来自人工智能搜索服务的访问量
- 对原始页面的引用量
- 引用频率
- 按爬虫分类的服务器负载
- 返回
403、404或429的请求 - 爬虫对非预期路径的访问
- 当前文章发布后是否被找到
结论
最大程度的包容性需要选择性开放,而不是单一的全面许可。
使用robots.txt分离搜索、用户检索、训练和公共数据集爬取。使用元标签和HTTP头管理索引和摘要。对任何私人信息使用身份验证。验证爬虫IP地址,而不是仅仅信任用户代理名称。
当您真心希望广泛重用时,像CC BY 4.0这样的开放许可可以使其变得更容易。清晰的署名信息——标题、作者、来源、许可、规范页面和更新日期——也可以使搜索系统和助手更容易识别和引用正确的来源。
因此,最强大的发布政策是:
**开放您希望被发现的公共内容,明确许可您希望被重用的材料,标记您不拥有的材料,在服务器层面保护私人信息,并为每个爬虫提供单独、可审查的权限。
Auto