Licenciamento e Robôs para Inclusão Máxima: Como Dar Boas-Vindas a Crawlers de Inteligência Artificial
Atualizado em 25 de agosto de 2026
Sites agora têm mais de uma maneira de alcançar um público. Uma página pode ser encontrada através da Pesquisa Google, resumida pelo ChatGPT, citada pela Perplexity, usada na pesquisa Claude, exibida através de serviços Apple ou coletada por um arquivo web público.
Esses sistemas nem todos usam o mesmo crawler ou seguem as mesmas regras. Um site que bloqueia o GPTBot ainda pode aparecer na pesquisa do ChatGPT se permitir o OAI-SearchBot. Um site que permite o Applebot pode permanecer visível na Apple Search enquanto bloqueia o Applebot-Extended do treinamento de modelos de inteligência artificial. O Google-Extended do Google não é um crawler normal; é um token de controle do robots.txt.
A melhor política, portanto, não é simplesmente “permitir inteligência artificial” ou “bloquear inteligência artificial”. É criar permissões separadas para:
- Pesquisa e descoberta
- Recuperação solicitada pelo usuário
- Desenvolvimento e treinamento de modelos
- Conjuntos de dados públicos
- Material sensível, privado ou restrito
Este artigo fornece um inventário atual de crawlers, exemplos de robots.txt, orientação de meta tags, métodos de verificação de endereço de Protocolo de Internet, conselhos de licenciamento Creative Commons, texto jurídico padrão e uma matriz de risco-benefício.
Os Quatro Controles Que Todo Editor Deve Compreender
1. robots.txt controla o rastreamento solicitado
Um arquivo robots.txt informa aos clientes automatizados compatíveis quais páginas eles podem solicitar. É útil para gerenciar o tráfego do crawler e expressar as preferências de um editor.
No entanto, robots.txt não é um sistema de controle de acesso. O Protocolo de Exclusão de Robôs afirma que suas regras não são autorização de acesso. O Google também adverte que um endereço bloqueado ainda pode aparecer nos resultados da pesquisa se outras páginas o vincularem. Use senhas, autenticação ou controles de acesso do lado do servidor para informações confidenciais. (rfc-editor.org)
2. Meta tags controlam a indexação e os snippets
Meta tags de robôs e o cabeçalho de resposta X-Robots-Tag podem controlar se uma página é indexada ou se um mecanismo de busca pode exibir um snippet.
Esses controles são normalmente visíveis apenas depois que um crawler foi autorizado a buscar a página. Se o robots.txt bloquear a página primeiro, o crawler pode nunca ver a meta tag. (developers.google.com)
3. Controles de rede verificam o crawler
Um nome de user-agent é fácil de copiar. Um atacante pode enviar uma solicitação alegando ser GPTBot, Googlebot ou PerplexityBot.
Uma abordagem mais forte combina:
- O user-agent alegado
- Um intervalo de endereços de Protocolo de Internet publicado
- Verificação de Sistema de Nomes de Domínio Reverso
- Verificação de Sistema de Nomes de Domínio Direto
- Limites de taxa e monitoramento de solicitações
4. Uma licença concede direitos de reutilização
O Robots.txt diz o que um crawler é solicitado a fazer. Uma licença diz o que pessoas ou organizações podem fazer legalmente com o material quando a permissão de direitos autorais é necessária.
Estas são ferramentas diferentes. Uma licença permissiva pode reduzir a incerteza legal, mas não garante que um crawler visitará a página, que um modelo a usará ou que um assistente a citará.
Inventário de Crawlers Importantes
O inventário a seguir foi verificado em relação à documentação do provedor disponível em 25 de agosto de 2026. Nomes de user-agent, propósitos e intervalos de endereços de Protocolo de Internet podem mudar, portanto, os sistemas de produção devem usar a documentação atual do provedor e feeds de endereços em tempo real.
| Provedor | Crawler ou token robots.txt | Finalidade principal | Controle importante |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Encontra e analisa páginas para a pesquisa ChatGPT | Permita-o para melhorar a chance de as páginas aparecerem nos resultados da pesquisa ChatGPT. |
| OpenAI | GPTBot | Coleta páginas que podem ser usadas para treinar os modelos generativos de inteligência artificial da OpenAI | Permita ou negue separadamente da pesquisa. |
| OpenAI | ChatGPT-User | Busca páginas depois que um usuário pede ao ChatGPT ou a um GPT personalizado para acessá-las | É acionado pelo usuário, e não um web crawler automático, então as regras do robots.txt podem não se aplicar. |
| OpenAI | OAI-AdsBot | Verifica páginas da web enviadas como destinos de publicidade do ChatGPT | Relevante principalmente para anunciantes. O conteúdo coletado não é usado para treinar modelos de fundação de inteligência artificial generativa. |
Googlebot | Principal crawler da Pesquisa Google | Controla o rastreamento ordinário da Pesquisa Google. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Imagens, vídeos e Google Notícias | Estes têm tokens robots.txt separados e podem ser controlados independentemente. | |
GoogleOther | Rastreamento Google de propósito geral para várias equipes de produto, incluindo pesquisa e desenvolvimento | Não representa um produto Google específico. | |
Google-Extended | Controla se o conteúdo rastreado pelo Google pode ser usado para treinamento de modelos Gemini e certos sistemas de fundamentação | É um token de controle robots.txt, não um user-agent de solicitação separado. Não afeta a inclusão ordinária na Pesquisa Google. | |
| Anthropic | ClaudeBot | Coleta conteúdo web público que pode contribuir para o desenvolvimento do modelo Claude | Negue-o para sinalizar que material futuro deve ser excluído dos conjuntos de dados de treinamento da Anthropic. |
| Anthropic | Claude-SearchBot | Melhora a qualidade dos resultados da pesquisa Claude | Permita-o para visibilidade na pesquisa Claude. |
| Anthropic | Claude-User | Busca páginas em resposta à solicitação de um usuário para Claude | Separado do rastreamento automático. |
| Perplexity | PerplexityBot | Indexa páginas para resultados da pesquisa Perplexity | Perplexity diz que este crawler não é usado para coletar conteúdo para treinamento de modelos de fundação de inteligência artificial. |
| Perplexity | Perplexity-User | Busca uma página depois que um usuário a solicita | A documentação da Perplexity diz que este buscador geralmente ignora o robots.txt porque a solicitação foi iniciada por um usuário. |
| Apple | Applebot | Suporta Apple Search, Spotlight, Siri, Safari e outras experiências Apple | Permita-o para descoberta Apple. |
| Apple | Applebot-Extended | Controla se o conteúdo rastreado pelo Applebot pode ser usado para treinar modelos de fundação da Apple | Não rastreia páginas por si mesmo. É um controle de uso de dados. |
| Common Crawl | CCBot | Coleta dados web públicos para o arquivo web aberto do Common Crawl | Não é um assistente, mas seus conjuntos de dados podem ser usados por pesquisadores e desenvolvedores de inteligência artificial. |
| Microsoft | Bingbot | Principal crawler de pesquisa do Bing | Permita-o para descoberta e visibilidade de pesquisa no Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Visualizações de página e vídeo para produtos Microsoft | Estes podem ser controlados separadamente do Bingbot. |
| Amazon | Amzn-SearchBot | Pesquisa e descoberta de conteúdo da Amazon | A Amazon diz que não rastreia conteúdo para treinamento de modelos de inteligência artificial generativa. |
| Amazon | Amzn-User | Busca informações atuais em resposta a ações do usuário, incluindo solicitações da Alexa | Acionado pelo usuário e separado do rastreamento de pesquisa automático. |
A OpenAI documenta seus crawlers de pesquisa, treinamento, publicidade e acionados pelo usuário como controles separados. Sua documentação recomenda especificamente permitir o OAI-SearchBot para a pesquisa ChatGPT enquanto usa o GPTBot separadamente para preferências de treinamento. (developers.openai.com)
O Google também separa Googlebot, GoogleOther e Google-Extended. O Google-Extended não tem seu próprio user-agent de solicitação HTTP, e bloqueá-lo não remove uma página da Pesquisa Google. (developers.google.com)
A Anthropic documenta papéis separados para ClaudeBot, Claude-SearchBot e Claude-User. A Anthropic também afirma que seus bots seguem o robots.txt e suportam a diretiva não padrão Crawl-delay. (support.anthropic.com)
A Perplexity distingue entre o rastreamento de pesquisa automático e a busca solicitada pelo usuário. Sua documentação atual diz que o PerplexityBot respeita o robots.txt, enquanto o Perplexity-User geralmente não o faz porque responde a uma solicitação do usuário. (docs.perplexity.ai)
A documentação atual da Apple faz a mesma distinção entre pesquisa e treinamento: o Applebot suporta a descoberta, enquanto o Applebot-Extended permite que os editores controlem o uso para treinamento sem remover as páginas da Apple Search. (support.apple.com)
Configurações de robots.txt Recomendadas
Coloque robots.txt na raiz de cada host, como:
text https://www.example.org/robots.txt
As regras se aplicam ao host, protocolo e porta específicos onde o arquivo é servido. Um subdomínio separado pode precisar de seu próprio arquivo. (developers.google.com)
Configuração 1: Inclusão máxima
Use isso quando o conteúdo editorial público puder ser encontrado, resumido, citado, indexado e coletado por crawlers compatíveis.
text
As páginas públicas estão disponíveis para crawlers compatíveis.
User-agent: * Allow: /
Mantenha caminhos privados, transacionais e administrativos fora.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Isso permite crawlers nomeados, incluindo OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft e Amazon, a menos que outra regra específica os bloqueie.
Não coloque uma regra abrangente como User-agent: * Disallow: / abaixo desta configuração. Um grupo posterior ou mais específico pode mudar a forma como um crawler interpreta o arquivo.
Configuração 2: Permitir pesquisa, mas bloquear crawlers de desenvolvimento de modelos
Este é frequentemente o melhor compromisso para editores que desejam citações e tráfego de pesquisa, mas não desejam sinalizar permissão para coleta de desenvolvimento de modelos.
text
Bloquear rastreamento de desenvolvimento de modelos da OpenAI.
User-agent: GPTBot Disallow: /
Bloquear rastreamento de desenvolvimento de modelos da Anthropic.
User-agent: ClaudeBot Disallow: /
Bloquear treinamento de modelos do Google e uso de fundamentação relacionado.
User-agent: Google-Extended Disallow: /
Bloquear uso de treinamento de modelos de fundação da Apple.
User-agent: Applebot-Extended Disallow: /
Opcional: bloquear coleta de conjunto de dados do Common Crawl.
User-agent: CCBot
Disallow: /
Permitir rastreamento ordinário de pesquisa e recuperação, exceto para caminhos sensíveis.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Esta configuração deixa OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot e Applebot cobertos pelo grupo curinga. Também mantém as permissões de pesquisa e treinamento separadas.
Para a Apple, bloquear o Applebot-Extended enquanto permite o Applebot preserva a descoberta através dos serviços da Apple. Para o Google, bloquear o Google-Extended não bloqueia a Pesquisa Google comum. (developers.google.com)
Configuração 3: Permitir explicitamente crawlers de pesquisa selecionados
Se um arquivo robots.txt existente bloquear todos os crawlers, adicione grupos separados para os crawlers de pesquisa que você deseja receber.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Mantenha todos os outros crawlers fora.
User-agent: * Disallow: /
Ao usar grupos específicos, repita as regras de caminho sensível dentro de cada grupo. Alguns crawlers usam o grupo de correspondência mais específico em vez de combiná-lo com o grupo curinga. O Bing documenta esse comportamento diretamente, e o Google fornece orientação separada sobre grupos específicos de crawlers. (bing.com)
Limitações importantes do robots.txt
- Um crawler pode ignorar o robots.txt.
- Um crawler malicioso pode fingir ser um crawler confiável.
- Uma página bloqueada ainda pode ser conhecida por seu título ou endereço web.
- O Robots.txt não protege senhas, arquivos privados, registros de clientes ou interfaces de programação de aplicativos confidenciais.
- Uma diretiva
Crawl-delaynão faz parte do Protocolo de Exclusão de Robôs central e não é suportada por todos os crawlers. A Anthropic e o Bing documentam suporte, enquanto a Apple diz que o Applebot não segue o crawl-delay. (rfc-editor.org)
Meta Tags e Cabeçalhos HTTP
Exemplo de página pública
Para um artigo público, use um título claro, autor, endereço web canônico, data de publicação e data de modificação.
html
A diretiva max-snippet é principalmente documentada para o Google. Não presuma que todo crawler de inteligência artificial suporte todas as diretivas meta.
Exemplo de página privada ou sensível
html
Use isso para páginas que não devem aparecer nos resultados da pesquisa. A página deve permanecer rastreável por tempo suficiente para o crawler ver a diretiva. Se a página deve realmente permanecer privada, use autenticação ou proteção por senha. (developers.google.com)
Ocultar apenas seções sensíveis dos snippets de pesquisa
O Google suporta data-nosnippet para partes específicas de uma página HTML:
html
Este parágrafo pode ser exibido em um resultado de pesquisa.
Isso é útil para detalhes de contato, notas internas ou informações geradas pelo usuário. Não é uma instrução universal para todos os sistemas de inteligência artificial. (developers.google.com)
Use o cabeçalho X-Robots-Tag para arquivos
Meta tags não podem ser colocadas dentro de um arquivo de documento portátil, imagem ou arquivo de vídeo. Use um cabeçalho de resposta HTTP em vez disso:
text X-Robots-Tag: noindex, nosnippet
Para uma página que deve permanecer pesquisável, mas não deve fornecer texto para snippets ou respostas de inteligência artificial, use:
text X-Robots-Tag: nosnippet
O Google documenta X-Robots-Tag para recursos não-HTML, e a Apple também o suporta para o Applebot. (developers.google.com)
Controles específicos da Apple
A Apple suporta:
html
A Apple diz que nosnippet impede que a página seja usada como contexto adicional e conteúdo atual quando os modelos da Apple geram saída. A página ainda pode permanecer descoberta através do Apple Search, Spotlight, Siri e Safari. (support.apple.com)
Para páginas com paywall, a Apple também suporta dados estruturados usando:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
A Apple diz que tais páginas podem permanecer elegíveis para resultados de pesquisa, mas não serão usadas como contexto adicional para respostas de inteligência artificial. (support.apple.com)
Como Verificar Endereços de Protocolo de Internet de Crawlers
Por que a correspondência de user-agent não é suficiente
Uma regra como esta é fraca:
text if User-Agent contains "GPTBot": allow
Qualquer um pode enviar esse texto. Uma regra melhor é:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
Não confie em um cabeçalho X-Forwarded-For a menos que venha de um proxy ou rede de entrega de conteúdo que sua organização controla.
Métodos de verificação do provedor
| Provedor | Método de verificação recomendado |
|---|---|
| OpenAI | Use os feeds de endereços IP ao vivo publicados na documentação do crawler da OpenAI para OAI-SearchBot, GPTBot e OAI-AdsBot. Atualize-os automaticamente em vez de copiar intervalos fixos para um firewall. |
| Use os intervalos de crawler publicados do Google ou execute verificações de Sistema de Nomes de Domínio reverso e direto. Um crawler genuíno do Google deve resolver para um nome de host Google aprovado e resolver de volta para o endereço original. | |
| Anthropic | Use o feed de endereços do crawler publicado atualmente como uma verificação de rede secundária. O método principal de exclusão da Anthropic permanece o robots.txt. |
| Perplexity | Combine o user-agent com o feed de endereços atual do PerplexityBot ou Perplexity-User. A Perplexity recomenda especificamente combinar ambas as condições em uma regra de Web Application Firewall. |
| Apple | Use a verificação de Sistema de Nomes de Domínio reverso sob applebot.apple.com, e então execute uma pesquisa direta. A Apple também publica intervalos de endereços atuais em um feed JSON. |
| Common Crawl | Use a verificação de Sistema de Nomes de Domínio reverso sob crawl.commoncrawl.org e o feed de endereços atual do CCBot. O Common Crawl observa que a verificação reversa ainda não está disponível para algum tráfego IPv6. |
| Microsoft | Use a ferramenta oficial de Verificação do Bingbot ou os métodos de pesquisa reversa e direta documentados da Microsoft. |
| Amazon | Use as listas de endereços de crawler publicadas da Amazon e combine-as com o user-agent Amazon apropriado. |
Google, Apple, Common Crawl, OpenAI, Anthropic e Perplexity publicam métodos específicos de provedores ou feeds de endereços. Essas listas podem mudar, então um processo de atualização agendado é mais seguro do que uma lista permanente copiada manualmente. (developers.google.com)
Um design simples de firewall pode se parecer com isto:
text permitir OAI-SearchBot apenas quando o endereço de origem estiver no intervalo de pesquisa atual da OpenAI permitir GPTBot apenas quando o endereço de origem estiver no intervalo de treinamento atual da OpenAI permitir PerplexityBot apenas quando o endereço de origem estiver no intervalo atual do PerplexityBot permitir Applebot apenas quando a verificação DNS reversa e direta for bem-sucedida permitir CCBot apenas quando o DNS reverso e o intervalo atual do Common Crawl corresponderem
limitar taxa de todos os crawlers verificados bloquear ou desafiar solicitações não verificadas que afirmam ser crawlers confiáveis
Não aplique uma regra ampla de permissão a todo um provedor de nuvem. Um crawler legítimo pode usar a infraestrutura de nuvem, mas a maioria do tráfego desse provedor de nuvem não é necessariamente o crawler.
Como o Licenciamento Aberto Influencia a Inclusão
CC BY 4.0 em linguagem simples
A licença Creative Commons Atribuição 4.0 Internacional, comumente chamada de CC BY 4.0, permite que as pessoas:
- Copiem e redistribuam o trabalho
- Adaptem, traduzam, remixem e construam sobre ele
- Usem-no comercialmente
As principais condições são:
- Dar o crédito apropriado
- Vincular à licença
- Indicar se foram feitas alterações
- Não sugerir que o criador original endossa a reutilização
- Não adicionar restrições legais ou técnicas que impeçam usos permitidos pela licença
Creative Commons também adverte que a licença pode não cobrir direitos de privacidade, direitos de publicidade, direitos morais, direitos de marca, direitos de patente ou material de terceiros. (creativecommons.org)
Uma licença não é um convite de crawler por si só
Colocar "CC BY 4.0" em uma página não garante que uma organização a rastreará. Um crawler ainda pode ser bloqueado por:
- robots.txt
- Uma rede de entrega de conteúdo (CDN)
- Um Web Application Firewall
- Limitação de taxa
- Um desafio JavaScript
- Um paywall
- Uma resposta de servidor ruim
- Um sitemap inacessível
Por outro lado, permitir um crawler não concede automaticamente todas as permissões de direitos autorais necessárias para cada uso posterior. Robots.txt e licenciamento devem ser projetados juntos.
Por que o CC BY pode suportar uma inclusão mais ampla
Uma licença permissiva clara pode tornar a política de um editor mais fácil de entender para equipes de dados, sistemas de pesquisa e operadores de assistentes. Pode reduzir a incerteza sobre cópia, adaptação, uso comercial, tradução e redistribuição quando essas atividades exigem permissão de direitos autorais.
No entanto, a Creative Commons explica que o treinamento de inteligência artificial é legalmente complexo. Uma licença restritiva nem sempre é uma maneira eficaz de prevenir o treinamento, porque alguns usos de treinamento podem ser permitidos por exceções ou limitações de direitos autorais. A Creative Commons também observa que as condições da licença podem ser difíceis de aplicar ao treinamento de máquina e às saídas do modelo. (creativecommons.org)
A lição prática é:
Use CC BY quando você realmente quiser uma reutilização legal ampla. Não use uma licença Creative Commons restritiva como uma garantia de exclusão de treinamento de inteligência artificial.
A atribuição melhora a clareza da fonte
A Creative Commons recomenda o método TASL:
- Título
- Autor
- Fonte
- Licença
Por exemplo:
“Licenciamento e Robôs para Inclusão Máxima”, Example Publishing, https://www.example.org/articles/ai-crawlers, licenciado sob Creative Commons Atribuição 4.0 Internacional. Alterações feitas: inventário de crawlers atualizado.
A atribuição clara não força todo assistente a citar uma página. Ela torna a citação correta mais fácil quando um sistema extrai o título, autor, fonte e informações de licenciamento da página. (wiki.creativecommons.org)
Adicionar informações estruturadas do artigo
Use informações visíveis e dados estruturados juntos:
html
O Google recomenda informações claras do autor, páginas do autor, datas de publicação, datas de modificação e páginas canônicas estáveis. Esses sinais podem ajudar os sistemas de pesquisa a entender quem criou o material e qual versão é autoritativa. Eles não garantem uma classificação, inclusão ou citação. (developers.google.com)
Texto Jurídico Padrão para um Site Aberto e Amigo da Citação
O seguinte é um exemplo de linguagem, não conselho jurídico. Peça ao seu advogado para adaptá-lo à sua jurisdição, estrutura de propriedade, obrigações de privacidade e conteúdo de terceiros.
Declaração de licenciamento CC BY 4.0
text
Licença de conteúdo
Exceto onde indicado de outra forma, o texto original e os materiais editoriais originais nesta página são licenciados sob a licença Creative Commons Atribuição 4.0 Internacional:
https://creativecommons.org/licenses/by/4.0/
Esta permissão permite cópia, redistribuição, adaptação, tradução, uso comercial, processamento legível por máquina, indexação de pesquisa, recuperação, sumarização e uso em sistemas de inteligência artificial, desde que os termos da licença sejam seguidos.
Atribuição preferida:
“[Título da página],” por [autor ou organização], [endereço canônico da página], publicado ou atualizado em [data], licenciado sob Creative Commons Atribuição 4.0 Internacional. Alterações feitas: [descrever alterações, ou declarar ‘nenhuma’].
Por favor, preserve as informações de autor, editor, fonte, licença e modificação sempre que razoavelmente possível. Este guia de atribuição preferida não adiciona restrições à licença Creative Commons e não substitui o texto da licença.
A frase “incluindo sistemas de inteligência artificial” esclarece a intenção do editor. Não deve ser usada para fingir que o editor possui direitos sobre material criado por outra pessoa.
Aviso de direitos de marca, privacidade e terceiros
text
Direitos de marca, privacidade e terceiros
A licença acima cobre apenas os materiais originais identificados como licenciados. Ela não concede permissão para usar:
- Marcas registradas, marcas de serviço, logotipos ou trade dress
- Nomes, imagens ou semelhanças de pessoas
- Informações privadas, confidenciais, de conta, saúde, financeiras ou de segurança
- Envios de usuários, a menos que sejam identificados separadamente como licenciados
- Fotografias, ilustrações, mapas, vídeo, música, citações ou outros materiais de terceiros
- Conteúdo identificado como “todos os direitos reservados” ou sujeito a uma licença separada
O uso do nome, logotipos e marcas da Example Publishing não deve sugerir patrocínio, aprovação, parceria ou endosso. Por favor, vincule à página original e distinga claramente citação, paráfrase, resumo e material gerado.
Esta linguagem é importante porque as licenças Creative Commons não concedem automaticamente todos os tipos de direitos legais conectados a uma página. (creativecommons.org)
Orientação de citação de pesquisa e assistente
text
Orientação de citação de pesquisa e assistente
Damos as boas-vindas à indexação de pesquisa compatível, recuperação solicitada pelo usuário, citação e sumarização do material licenciado neste site.
Ao citar este site, por favor, use o título da página, autor ou editor, endereço canônico da página, data de publicação ou atualização, e um link direto para a fonte. Por favor, identifique a fonte como uma entrada entre quaisquer fontes usadas, distinga a análise gerada do material citado, e não declare ou implique que a Example Publishing endossa uma resposta gerada, produto, pessoa ou serviço.
Esta orientação destina-se a melhorar a precisão e a atribuição. Ela não concede direitos além da licença de conteúdo aplicável e não licencia marcas registradas, informações pessoais, informações confidenciais ou material de terceiros.
Se você deseja visibilidade de pesquisa, mas não quer conceder uma licença de treinamento ampla
text
Acesso à pesquisa e direitos autorais
Nossas páginas públicas podem ser acessadas por crawlers de pesquisa e recuperação compatíveis identificados em nosso arquivo robots.txt. Esta permissão destina-se a apoiar a descoberta, resultados de pesquisa, recuperação solicitada pelo usuário e citação.
Exceto onde uma licença separada é exibida, o conteúdo original permanece com todos os direitos reservados. O acesso a uma página pública não concede uma licença separada para desenvolvimento de modelos, treinamento, redistribuição, reutilização comercial ou criação de obras derivadas além dos direitos fornecidos pela lei aplicável.
Por favor, cite o endereço canônico da página e o editor ao se referir a este material. Nada neste site concede permissão para usar marcas registradas, logotipos, informações pessoais, informações confidenciais ou conteúdo de terceiros.
Não coloque a declaração CC BY e a declaração de todos os direitos reservados sobre o mesmo material. Identifique claramente qual licença se aplica a qual conteúdo.
Matriz de Risco-Benefício para Licenciamento Aberto
As leis de direitos autorais e as regras de treinamento de inteligência artificial diferem por país e permanecem incertas. O Escritório de Direitos Autorais dos Estados Unidos continua a examinar essas questões, enquanto a Creative Commons descreve o treinamento de inteligência artificial como algo específico e legalmente complexo. (copyright.gov)
| Abordagem | Potencial de inclusão | Principais benefícios | Principais riscos | Melhor adequação |
|---|---|---|---|---|
| CC BY 4.0 | Muito alto | Cópia ampla, adaptação, uso comercial, tradução, indexação e reutilização relacionada a modelos quando a permissão de direitos autorais é necessária | Concorrentes comerciais podem reutilizar ou adaptar o conteúdo; a atribuição pode ser imperfeita; a licença não pode controlar privacidade, marca ou direitos de terceiros | Editores que desejam a mais ampla reutilização legal e forte atribuição de fonte |
| CC BY-SA 4.0 | Alto, mas mais complexo | Incentiva um ciclo de compartilhamento aberto e exige que as adaptações permaneçam sob termos compatíveis | As regras ShareAlike podem ser difíceis de aplicar a conjuntos de dados, treinamento de modelos e saídas públicas; algumas organizações podem evitar o material devido à incerteza | Projetos educacionais abertos e de interesse público que desejam que as adaptações a jusante permaneçam abertas |
| CC BY-NC 4.0 | Médio ou baixo | Limita usos principalmente destinados a vantagem comercial ou compensação monetária | “Não comercial” pode ser difícil de interpretar; pode excluir pesquisa comercial, modelo e usos de assistentes; não é uma garantia de exclusão de treinamento | Material destinado a uso sem fins lucrativos, educacional ou comunitário |
| CC BY-ND 4.0 | Médio | Permite o compartilhamento enquanto limita as adaptações | Tradução, transformação e alguns casos de uso de assistentes podem se tornar legalmente incertos; menos atraente para sistemas que resumem ou remixam | Avisos oficiais ou trabalhos que devem permanecer inalterados |
| CC0 ou dedicação de domínio público | Muito alto | Simplifica a reutilização e remove a maioria das condições de direitos autorais onde legalmente eficaz | Nenhuma atribuição exigida; controle fraco sobre a apresentação da marca; privacidade, marca e direitos de publicidade permanecem separados | Fatos, conjuntos de dados, material de referência ou obras destinadas a reutilização irrestrita |
| Todos os direitos reservados mais rastreamento de pesquisa aberto | Alto para pesquisa, menor para treinamento | Pode preservar a visibilidade de pesquisa e citação sem conceder uma licença de reutilização ampla | Mais incerteza legal para desenvolvedores de modelos; pode reduzir a inclusão em conjuntos de dados de treinamento e sistemas de reutilização comercial | Editores que desejam descoberta e citações, mas preferem negociar licenças mais amplas separadamente |
A estratégia mais equilibrada para muitas organizações é:
- CC BY 4.0 para texto editorial público original
- Rótulos separados para material de terceiros
- Nenhuma informação pessoal ou confidencial pública
- Permitir crawlers de pesquisa e recuperação
- Permitir crawlers de desenvolvimento de modelos apenas se a organização realmente aceitar esse uso
- Usar atribuição clara e links canônicos
- Proteger marcas registradas através de um aviso de marca separado
Uma Lista de Verificação de Implementação Prática
Conteúdo e licenciamento
- Identifique quem possui cada página, imagem, gráfico, vídeo e citação.
- Licencie apenas o material para o qual sua organização controla os direitos.
- Marque separadamente o material de terceiros.
- Adicione uma declaração de licença visível.
- Forneça uma citação preferencial usando título, autor, fonte e licença.
- Mantenha logotipos, marcas registradas, dados pessoais e informações confidenciais fora do escopo licenciado.
Robots.txt
- Crie um arquivo robots.txt público na raiz de cada host.
- Permita crawlers de pesquisa separadamente dos crawlers de treinamento.
- Bloqueie caminhos administrativos, de conta, de checkout, privados e de aplicativos internos.
- Não confie no robots.txt para segurança.
- Teste o arquivo após cada grande implantação de site.
Meta tags
- Use links canônicos.
- Adicione autor, data de publicação e data de modificação.
- Use
noindexpara páginas que não devem aparecer na pesquisa. - Use
nosnippetoudata-nosnippetpara trechos sensíveis onde suportado. - Use
X-Robots-Tagpara arquivos de documento portátil, imagens e outros recursos não-HTML. - Lembre-se de que um crawler deve ser capaz de buscar uma página antes de poder ler suas meta tags.
Segurança de rede
- Registre strings de user-agent, endereços de origem, códigos de resposta e caminhos de solicitação.
- Verifique crawlers confiáveis usando feeds de endereços oficiais ou métodos de Sistema de Nomes de Domínio.
- Atualize os feeds de endereços automaticamente.
- Combine verificações de user-agent e endereço de origem.
- Limite a taxa de crawlers verificados em vez de dar-lhes acesso irrestrito.
- Desafie ou bloqueie solicitações que afirmam ser crawlers confiáveis, mas falham na verificação.
Medição
Rastrear:
- Visitas de serviços de pesquisa de inteligência artificial
- Referências à página original
- Frequência de citação
- Carga do servidor por crawler
- Solicitações retornando
403,404ou429 - Acesso do crawler a caminhos não intencionais
- Se os artigos atuais estão sendo encontrados após a publicação
Conclusão
A inclusão máxima requer abertura seletiva, não uma única permissão geral.
Use robots.txt para separar o rastreamento de pesquisa, recuperação do usuário, treinamento e conjuntos de dados públicos. Use meta tags e cabeçalhos HTTP para gerenciar a indexação e os snippets. Use autenticação para qualquer coisa privada. Verifique os endereços de Protocolo de Internet do crawler em vez de confiar apenas nos nomes de user-agent.
Uma licença permissiva como a CC BY 4.0 pode facilitar a reutilização ampla quando você realmente a deseja. Informações claras de atribuição — título, autor, fonte, licença, página canônica e data de atualização — também podem facilitar para sistemas de pesquisa e assistentes identificar e citar a fonte correta.
A política de publicação mais forte é, portanto:
**Abra o conteúdo público que você deseja que seja descoberto, licencie claramente o material que você deseja reutilizar, marque o material que você não possui, proteja informações privadas no nível do servidor e dê a cada crawler uma permissão separada e revisável.
Auto