Licencias y Robots para la Máxima Inclusión: Cómo Dar la Bienvenida a los Rastreadores de Inteligencia Artificial
Actualizado el 25 de agosto de 2026
Los sitios web ahora tienen más de una forma de llegar a una audiencia. Una página puede ser encontrada a través de la Búsqueda de Google, resumida por ChatGPT, citada por Perplexity, utilizada en la búsqueda de Claude, mostrada a través de los servicios de Apple, o recopilada por un archivo web público.
No todos estos sistemas utilizan el mismo rastreador ni siguen las mismas reglas. Un sitio web que bloquea GPTBot aún puede aparecer en la búsqueda de ChatGPT si permite OAI-SearchBot. Un sitio web que permite Applebot puede seguir siendo visible en la Búsqueda de Apple mientras bloquea Applebot-Extended para el entrenamiento de modelos de inteligencia artificial. Google-Extended de Google no es un rastreador normal en absoluto; es un token de control de robots.txt.
Por lo tanto, la mejor política no es simplemente "permitir la inteligencia artificial" o "bloquear la inteligencia artificial". Consiste en crear permisos separados para:
- Búsqueda y descubrimiento
- Recuperación solicitada por el usuario
- Desarrollo y entrenamiento de modelos
- Conjuntos de datos públicos
- Material sensible, privado o restringido
Este artículo proporciona un inventario actual de rastreadores, ejemplos de robots.txt, guía de metaetiquetas, métodos de verificación de direcciones de Protocolo de Internet, consejos sobre licencias Creative Commons, lenguaje legal estándar y una matriz de riesgos y beneficios.
Los Cuatro Controles que Todo Editor Debe Entender
1. robots.txt controla el rastreo solicitado
Un archivo robots.txt indica a los clientes automatizados conformes qué páginas pueden solicitar. Es útil para gestionar el tráfico de rastreadores y expresar las preferencias de un editor.
Sin embargo, robots.txt no es un sistema de control de acceso. El Protocolo de Exclusión de Robots establece que sus reglas no son una autorización de acceso. Google también advierte que una dirección bloqueada aún puede aparecer en los resultados de búsqueda si otras páginas la enlazan. Utilice contraseñas, autenticación o controles de acceso del lado del servidor para información confidencial. (rfc-editor.org)
2. Las metaetiquetas controlan la indexación y los fragmentos
Las metaetiquetas de robots y el encabezado de respuesta X-Robots-Tag pueden controlar si una página se indexa o si un motor de búsqueda puede mostrar un fragmento.
Estos controles normalmente solo son visibles después de que se le ha permitido a un rastreador recuperar la página. Si robots.txt bloquea la página primero, es posible que el rastreador nunca vea la metaetiqueta. (developers.google.com)
3. Los controles de red verifican el rastreador
Un nombre de user-agent es fácil de copiar. Un atacante puede enviar una solicitud afirmando ser GPTBot, Googlebot o PerplexityBot.
Un enfoque más robusto combina:
- El user-agent declarado
- Un rango de direcciones de Protocolo de Internet publicado
- Verificación inversa del Sistema de Nombres de Dominio
- Verificación directa del Sistema de Nombres de Dominio
- Límites de velocidad y monitoreo de solicitudes
4. Una licencia otorga derechos de reutilización
Robots.txt indica lo que se le pide a un rastreador que haga. Una licencia indica lo que las personas u organizaciones pueden hacer legalmente con el material cuando se requiere permiso de derechos de autor.
Estas son herramientas diferentes. Una licencia permisiva puede reducir la incertidumbre legal, pero no garantiza que un rastreador visite la página, que un modelo la utilice o que un asistente la cite.
Inventario de Rastreadores Importantes
El siguiente inventario fue verificado con la documentación del proveedor disponible el 25 de agosto de 2026. Los nombres de user-agent, propósitos y rangos de direcciones de Protocolo de Internet pueden cambiar, por lo que los sistemas de producción deben usar la documentación actual del proveedor y los flujos de direcciones en vivo.
| Proveedor | Rastreador o token robots.txt | Propósito principal | Control importante |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Encuentra y analiza páginas para la búsqueda de ChatGPT | Permítalo para mejorar la posibilidad de que las páginas aparezcan en los resultados de búsqueda de ChatGPT. |
| OpenAI | GPTBot | Recopila páginas que pueden usarse para entrenar los modelos de inteligencia artificial generativa de OpenAI | Permitir o no permitir por separado de la búsqueda. |
| OpenAI | ChatGPT-User | Recupera páginas después de que un usuario pide a ChatGPT o a un GPT personalizado que acceda a ellas | Se activa por el usuario en lugar de ser un rastreador web automático, por lo que las reglas de robots.txt podrían no aplicarse. |
| OpenAI | OAI-AdsBot | Verifica páginas web enviadas como destinos publicitarios de ChatGPT | Relevante principalmente para anunciantes. El contenido recopilado no se utiliza para entrenar modelos fundacionales de inteligencia artificial generativa. |
Googlebot | Rastreador principal de la Búsqueda de Google | Controla el rastreo ordinario de la Búsqueda de Google. | |
Googlebot-Image, Googlebot-Video, Googlebot-News | Imágenes, videos y Google Noticias | Estos tienen tokens robots.txt separados y pueden controlarse de forma independiente. | |
GoogleOther | Rastreo de propósito general de Google para varios equipos de producto, incluida la investigación y el desarrollo | No representa un producto específico de Google. | |
Google-Extended | Controla si el contenido rastreado por Google puede utilizarse para el entrenamiento del modelo Gemini y ciertos sistemas de fundamentación | Es un token de control de robots.txt, no un user-agent de solicitud separado. No afecta la inclusión ordinaria en la Búsqueda de Google. | |
| Anthropic | ClaudeBot | Recopila contenido web público que puede contribuir al desarrollo del modelo Claude | Desactívelo para señalar que el material futuro debe excluirse de los conjuntos de datos de entrenamiento de Anthropic. |
| Anthropic | Claude-SearchBot | Mejora la calidad de los resultados de búsqueda de Claude | Permítalo para la visibilidad en la búsqueda de Claude. |
| Anthropic | Claude-User | Recupera páginas en respuesta a una solicitud de un usuario a Claude | Separado del rastreo automático. |
| Perplexity | PerplexityBot | Indexa páginas para los resultados de búsqueda de Perplexity | Perplexity dice que este rastreador no se utiliza para recopilar contenido para el entrenamiento de modelos fundacionales de inteligencia artificial. |
| Perplexity | Perplexity-User | Recupera una página después de que un usuario la solicita | La documentación de Perplexity dice que este capturador generalmente ignora robots.txt porque la solicitud fue iniciada por un usuario. |
| Apple | Applebot | Compatible con la Búsqueda de Apple, Spotlight, Siri, Safari y otras experiencias de Apple | Permítalo para el descubrimiento de Apple. |
| Apple | Applebot-Extended | Controla si el contenido rastreado por Applebot puede usarse para entrenar modelos fundacionales de Apple | No rastrea páginas por sí mismo. Es un control de uso de datos. |
| Common Crawl | CCBot | Recopila datos web públicos para el archivo web abierto de Common Crawl | No es un asistente, pero sus conjuntos de datos pueden ser utilizados por investigadores y desarrolladores de inteligencia artificial. |
| Microsoft | Bingbot | Rastreador principal de la búsqueda de Bing | Permítalo para el descubrimiento y la visibilidad en la búsqueda de Bing. |
| Microsoft | MicrosoftPreview, BingVideoPreview | Previsualizaciones de páginas y videos para productos de Microsoft | Estos pueden controlarse por separado de Bingbot. |
| Amazon | Amzn-SearchBot | Búsqueda y descubrimiento de contenido de Amazon | Amazon dice que no rastrea contenido para el entrenamiento de modelos de inteligencia artificial generativa. |
| Amazon | Amzn-User | Recupera información actual en respuesta a acciones del usuario, incluidas las solicitudes de Alexa | Activado por el usuario y separado del rastreo automático de búsqueda. |
OpenAI documenta sus rastreadores de búsqueda, entrenamiento, publicidad y activados por el usuario como controles separados. Su documentación recomienda específicamente permitir OAI-SearchBot para la búsqueda de ChatGPT mientras se usa GPTBot por separado para las preferencias de entrenamiento. (developers.openai.com)
Google también separa Googlebot, GoogleOther y Google-Extended. Google-Extended no tiene su propio user-agent de solicitud HTTP, y bloquearlo no elimina una página de la Búsqueda de Google. (developers.google.com)
Anthropic documenta roles separados para ClaudeBot, Claude-SearchBot y Claude-User. Anthropic también afirma que sus bots siguen robots.txt y admiten la directiva no estándar Crawl-delay. (support.anthropic.com)
Perplexity distingue entre el rastreo automático de búsqueda y la recuperación solicitada por el usuario. Su documentación actual dice que PerplexityBot respeta robots.txt, mientras que Perplexity-User generalmente no lo hace porque responde a una solicitud del usuario. (docs.perplexity.ai)
La documentación actual de Apple hace la misma distinción entre búsqueda y entrenamiento: Applebot admite el descubrimiento, mientras que Applebot-Extended permite a los editores controlar el uso del entrenamiento sin eliminar páginas de la Búsqueda de Apple. (support.apple.com)
Configuraciones de robots.txt Recomendadas
Coloque robots.txt en la raíz de cada host, como:
text https://www.example.org/robots.txt
Las reglas se aplican al host, protocolo y puerto específicos donde se sirve el archivo. Un subdominio separado puede necesitar su propio archivo. (developers.google.com)
Configuración 1: Inclusión máxima
Utilice esto cuando el contenido editorial público pueda ser encontrado, resumido, citado, indexado y recopilado por rastreadores conformes.
text
Las páginas públicas están disponibles para rastreadores conformes.
User-agent: * Allow: /
Excluir rutas privadas, transaccionales y administrativas.
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Esto permite los rastreadores nombrados, incluyendo OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft y Amazon, a menos que otra regla específica los bloquee.
No coloque una regla general como User-agent: * Disallow: / debajo de esta configuración. Un grupo posterior o más específico puede cambiar cómo un rastreador interpreta el archivo.
Configuración 2: Permitir búsqueda pero bloquear rastreadores de desarrollo de modelos
Este es a menudo el mejor compromiso para los editores que desean citas y tráfico de búsqueda, pero no quieren señalar permiso para la recopilación para el desarrollo de modelos.
text
Bloquear el rastreo de desarrollo de modelos de OpenAI.
User-agent: GPTBot Disallow: /
Bloquear el rastreo de desarrollo de modelos de Anthropic.
User-agent: ClaudeBot Disallow: /
Bloquear el entrenamiento de modelos de Google y el uso relacionado con la fundamentación.
User-agent: Google-Extended Disallow: /
Bloquear el uso de entrenamiento de modelos fundacionales de Apple.
User-agent: Applebot-Extended Disallow: /
Opcional: bloquear la recopilación de conjuntos de datos de Common Crawl.
User-agent: CCBot
Disallow: /
Permitir el rastreo ordinario de búsqueda y recuperación, excepto para rutas sensibles.
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
Esta configuración deja a OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot y Applebot cubiertos por el grupo comodín. También mantiene separados los permisos de búsqueda y entrenamiento.
Para Apple, bloquear Applebot-Extended mientras se permite Applebot preserva el descubrimiento a través de los servicios de Apple. Para Google, bloquear Google-Extended no bloquea la Búsqueda de Google ordinaria. (developers.google.com)
Configuración 3: Permitir explícitamente rastreadores de búsqueda seleccionados
Si un archivo robots.txt existente bloquea todos los rastreadores, agregue grupos separados para los rastreadores de búsqueda que desee recibir.
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
Mantener fuera a todos los demás rastreadores.
User-agent: * Disallow: /
Al usar grupos específicos, repita las reglas de rutas sensibles dentro de cada grupo. Algunos rastreadores usan el grupo de coincidencia más específico en lugar de combinarlo con el grupo comodín. Bing documenta este comportamiento directamente, y Google proporciona una guía separada sobre grupos específicos de rastreadores. (bing.com)
Limitaciones importantes de robots.txt
- Un rastreador puede ignorar robots.txt.
- Un rastreador malicioso puede fingir ser un rastreador de confianza.
- Una página bloqueada aún puede ser conocida por su título o dirección web.
- Robots.txt no protege contraseñas, archivos privados, registros de clientes o interfaces de programación de aplicaciones confidenciales.
- Una directiva
Crawl-delayno forma parte del Protocolo de Exclusión de Robots central y no es compatible con todos los rastreadores. Anthropic y Bing documentan su soporte, mientras que Apple dice que Applebot no sigue elcrawl-delay. (rfc-editor.org)
Metaetiquetas y Encabezados HTTP
Ejemplo de página pública
Para un artículo público, use un título claro, autor, dirección web canónica, fecha de publicación y fecha de modificación.
html
La directiva max-snippet está documentada principalmente para Google. No asuma que todos los rastreadores de inteligencia artificial admiten todas las directivas meta.
Ejemplo de página privada o sensible
html
Use esto para páginas que no deben aparecer en los resultados de búsqueda. La página debe permanecer rastreable el tiempo suficiente para que el rastreador vea la directiva. Si la página debe permanecer verdaderamente privada, use autenticación o protección con contraseña en su lugar. (developers.google.com)
Ocultar solo secciones sensibles de los fragmentos de búsqueda
Google admite data-nosnippet para partes específicas de una página HTML:
html
Este párrafo puede mostrarse en un resultado de búsqueda.
Esto es útil para detalles de contacto, notas internas o información generada por el usuario. No es una instrucción universal para todos los sistemas de inteligencia artificial. (developers.google.com)
Usar el encabezado X-Robots-Tag para archivos
Las metaetiquetas no pueden colocarse dentro de un archivo de documento portátil, una imagen o un archivo de video. Use un encabezado de respuesta HTTP en su lugar:
text X-Robots-Tag: noindex, nosnippet
Para una página que debe seguir siendo buscable pero no debe proporcionar texto para fragmentos o respuestas de inteligencia artificial, use:
text X-Robots-Tag: nosnippet
Google documenta X-Robots-Tag para recursos no HTML, y Apple también lo admite para Applebot. (developers.google.com)
Controles específicos de Apple
Apple es compatible con:
html
Apple dice que nosnippet evita que la página se utilice como contexto adicional y contenido actual cuando los modelos de Apple generan resultados. La página aún puede permanecer descubrible a través de la Búsqueda de Apple, Spotlight, Siri y Safari. (support.apple.com)
Para páginas de pago, Apple también admite datos estructurados utilizando:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple dice que dichas páginas pueden seguir siendo elegibles para los resultados de búsqueda, pero no se utilizarán como contexto adicional para las respuestas de inteligencia artificial. (support.apple.com)
Cómo Verificar las Direcciones de Protocolo de Internet de los Rastreadores
Por qué la coincidencia de user-agent no es suficiente
Una regla como esta es débil:
text if User-Agent contains "GPTBot": allow
Cualquiera puede enviar ese texto. Una regla mejor es:
text si el User-Agent es un rastreador conocido y la dirección de Protocolo de Internet de origen está en el rango oficial del proveedor: permitir o limitar la velocidad de lo contrario: desafiar, limitar la velocidad o bloquear
No confíe en un encabezado X-Forwarded-For a menos que provenga de un proxy o una red de entrega de contenido que su organización controle.
Métodos de verificación del proveedor
| Proveedor | Método de verificación recomendado |
|---|---|
| OpenAI | Utilice los flujos de direcciones de Protocolo de Internet en vivo publicados en la documentación del rastreador de OpenAI para OAI-SearchBot, GPTBot y OAI-AdsBot. Actualícelos automáticamente en lugar de copiar rangos fijos en un cortafuegos. |
| Utilice los rangos de rastreadores publicados por Google o realice verificaciones inversas y directas del Sistema de Nombres de Dominio. Un rastreador genuino de Google debe resolverse a un nombre de host de Google aprobado y resolverse de nuevo a la dirección original. | |
| Anthropic | Utilice el flujo de direcciones de rastreadores publicado actualmente como una verificación de red secundaria. El método principal de exclusión voluntaria de Anthropic sigue siendo robots.txt. |
| Perplexity | Combine el user-agent con el flujo de direcciones actual de PerplexityBot o Perplexity-User. Perplexity recomienda específicamente combinar ambas condiciones en una regla de Cortafuegos de Aplicaciones Web. |
| Apple | Utilice la verificación inversa del Sistema de Nombres de Dominio bajo applebot.apple.com, luego realice una búsqueda directa. Apple también publica los rangos de direcciones actuales en un feed JSON. |
| Common Crawl | Utilice la verificación inversa del Sistema de Nombres de Dominio bajo crawl.commoncrawl.org y el flujo de direcciones actual de CCBot. Common Crawl señala que la verificación inversa aún no está disponible para parte del tráfico IPv6. |
| Microsoft | Utilice la herramienta oficial de Verificación de Bingbot o los métodos documentados de búsqueda inversa y directa de Microsoft. |
| Amazon | Utilice las listas de direcciones de rastreadores publicadas por Amazon y combínelas con el user-agent de Amazon apropiado. |
Google, Apple, Common Crawl, OpenAI, Anthropic y Perplexity publican métodos o flujos de direcciones específicos del proveedor. Estas listas pueden cambiar, por lo que un proceso de actualización programado es más seguro que una lista copiada manualmente de forma permanente. (developers.google.com)
Un diseño de cortafuegos simple podría ser así:
text permitir OAI-SearchBot solo cuando la dirección de origen esté en el rango de búsqueda actual de OpenAI permitir GPTBot solo cuando la dirección de origen esté en el rango de entrenamiento actual de OpenAI permitir PerplexityBot solo cuando la dirección de origen esté en el rango actual de PerplexityBot permitir Applebot solo cuando la verificación DNS inversa y directa sea exitosa permitir CCBot solo cuando la DNS inversa y el rango actual de Common Crawl coincidan
limitar la velocidad de todos los rastreadores verificados bloquear o desafiar las solicitudes no verificadas que afirmen ser rastreadores de confianza
No aplique una regla de permiso amplia a un proveedor de la nube completo. Un rastreador legítimo puede usar infraestructura en la nube, pero la mayor parte del tráfico de ese proveedor de la nube no es necesariamente el rastreador.
Cómo el Licenciamiento Abierto Influye en la Inclusión
CC BY 4.0 en lenguaje sencillo
La licencia Creative Commons Atribución 4.0 Internacional, comúnmente llamada CC BY 4.0, permite a las personas:
- Copiar y redistribuir la obra
- Adaptarla, traducirla, remezclarla y construir sobre ella
- Usarla comercialmente
Las condiciones principales son:
- Dar el crédito apropiado
- Enlazar a la licencia
- Indicar si se realizaron cambios
- No sugerir que el creador original aprueba la reutilización
- No añadir restricciones legales o técnicas que impidan los usos permitidos por la licencia
Creative Commons también advierte que la licencia podría no cubrir derechos de privacidad, derechos de publicidad, derechos morales, derechos de marca, derechos de patente o material de terceros. (creativecommons.org)
Una licencia no es una invitación para un rastreador por sí misma
Poner “CC BY 4.0” en una página no garantiza que una organización la rastree. Un rastreador aún puede ser bloqueado por:
- robots.txt
- Una red de entrega de contenido
- Un Cortafuegos de Aplicaciones Web
- Limitación de velocidad
- Un desafío de JavaScript
- Un muro de inicio de sesión
- Una respuesta de servidor deficiente
- Un mapa del sitio inaccesible
Por el contrario, permitir un rastreador no otorga automáticamente todos los permisos de derechos de autor necesarios para cada uso posterior. Robots.txt y las licencias deben diseñarse conjuntamente.
Por qué CC BY puede apoyar una inclusión más amplia
Una licencia permisiva clara puede facilitar que los equipos de datos, los sistemas de búsqueda y los operadores de asistentes comprendan la política de un editor. Puede reducir la incertidumbre sobre la copia, adaptación, uso comercial, traducción y redistribución cuando esas actividades requieren permiso de derechos de autor.
Sin embargo, Creative Commons explica que el entrenamiento de inteligencia artificial es legalmente complejo. Una licencia restrictiva no siempre es una forma efectiva de prevenir el entrenamiento, porque algunos usos de entrenamiento pueden estar permitidos por excepciones o limitaciones de derechos de autor. Creative Commons también señala que las condiciones de licencia pueden ser difíciles de aplicar al entrenamiento de máquinas y a las salidas de modelos. (creativecommons.org)
La lección práctica es:
Use CC BY cuando realmente desee una reutilización legal amplia. No utilice una licencia Creative Commons restrictiva como una exclusión garantizada del entrenamiento de inteligencia artificial.
La atribución mejora la claridad de la fuente
Creative Commons recomienda el método TASL:
- Título
- Autor
- Fuente
- Licencia
Por ejemplo:
"Licencias y Robots para la Máxima Inclusión", Example Publishing, https://www.example.org/articles/ai-crawlers, bajo licencia Creative Commons Atribución 4.0 Internacional. Cambios realizados: inventario de rastreadores actualizado.
Una atribución clara no obliga a todos los asistentes a citar una página. Sí facilita la citación correcta cuando un sistema extrae el título, autor, fuente e información de licencia de la página. (wiki.creativecommons.org)
Añadir información estructurada del artículo
Utilice información visible y datos estructurados conjuntamente:
html
Google recomienda información clara del autor, páginas del autor, fechas de publicación, fechas de modificación y páginas canónicas estables. Estas señales pueden ayudar a los sistemas de búsqueda a comprender quién creó el material y qué versión es autoritativa. No garantizan una clasificación, inclusión o citación. (developers.google.com)
Lenguaje Legal Estándar para un Sitio Abierto y Amigable con las Citas
El siguiente es un lenguaje de ejemplo, no asesoramiento legal. Pida a un abogado que lo adapte a su jurisdicción, estructura de propiedad, obligaciones de privacidad y contenido de terceros.
Declaración de licencia CC BY 4.0
text
Licencia de contenido
Excepto donde se indique lo contrario, el texto original y los materiales editoriales originales en esta página están bajo la licencia Creative Commons Atribución 4.0 Internacional:
https://creativecommons.org/licenses/by/4.0/
Este permiso permite la copia, redistribución, adaptación, traducción, uso comercial, procesamiento legible por máquina, indexación de búsqueda, recuperación, resumen y uso en sistemas de inteligencia artificial, siempre que se sigan los términos de la licencia.
Atribución preferida:
“[Título de la página],” por [autor u organización], [dirección de página canónica], publicado o actualizado el [fecha], bajo licencia Creative Commons Atribución 4.0 Internacional. Cambios realizados: [describir cambios, o indicar ‘ninguno’].
Por favor, conserve la información del autor, editor, fuente, licencia y modificación siempre que sea razonablemente posible. Esta guía de atribución preferida no añade restricciones a la licencia Creative Commons y no reemplaza el texto de la licencia.
La frase “incluyendo sistemas de inteligencia artificial” aclara la intención del editor. No debe usarse para pretender que el editor posee derechos sobre material creado por otra persona.
Aviso de derechos de marca, privacidad y terceros
text
Derechos de marca, privacidad y terceros
La licencia anterior cubre únicamente los materiales originales identificados como licenciados. No otorga permiso para usar:
- Marcas comerciales, marcas de servicio, logotipos o imagen comercial
- Nombres, imágenes o semejanzas de personas
- Información privada, confidencial, de cuenta, de salud, financiera o de seguridad
- Envíos de usuarios a menos que estén identificados por separado como licenciados
- Fotografías, ilustraciones, mapas, videos, música, citas u otros materiales de terceros
- Contenido identificado como “todos los derechos reservados” o sujeto a una licencia separada
El uso del nombre, logotipos y marcas de Example Publishing no debe sugerir patrocinio, aprobación, asociación o respaldo. Por favor, enlace a la página original y distinga claramente la cita, paráfrasis, resumen y material generado.
Este lenguaje es importante porque las licencias Creative Commons no otorgan automáticamente todos los tipos de derechos legales conectados a una página. (creativecommons.org)
Guía de citas para búsqueda y asistentes
text
Guía de citas para búsqueda y asistentes
Damos la bienvenida a la indexación de búsqueda conforme, la recuperación solicitada por el usuario, la citación y el resumen del material licenciado en este sitio.
Al citar este sitio, utilice el título de la página, el autor o editor, la dirección canónica de la página, la fecha de publicación o actualización y un enlace directo a la fuente. Identifique la fuente como una entrada entre todas las fuentes utilizadas, distinga el análisis generado del material citado, y no declare ni implique que Example Publishing respalda una respuesta generada, producto, persona o servicio.
Esta guía tiene como objetivo mejorar la precisión y la atribución. No otorga derechos más allá de la licencia de contenido aplicable y no licencia marcas comerciales, información personal, información confidencial o material de terceros.
Si desea visibilidad en la búsqueda pero no desea otorgar una licencia de entrenamiento amplia
text
Acceso a la búsqueda y derechos de autor
Nuestras páginas públicas pueden ser accedidas por rastreadores de búsqueda y recuperación conformes identificados en nuestro archivo robots.txt. Este permiso tiene como objetivo apoyar el descubrimiento, los resultados de búsqueda, la recuperación solicitada por el usuario y la citación.
Excepto donde se muestre una licencia separada, el contenido original permanece con todos los derechos reservados. El acceso a una página pública no otorga una licencia separada para el desarrollo de modelos, el entrenamiento, la redistribución, la reutilización comercial o la creación de obras derivadas más allá de los derechos proporcionados por la ley aplicable.
Por favor, cite la dirección canónica de la página y el editor al referirse a este material. Nada en este sitio otorga permiso para usar marcas comerciales, logotipos, información personal, información confidencial o contenido de terceros.
No coloque la declaración CC BY y la declaración de todos los derechos reservados sobre el mismo material. Identifique claramente qué licencia se aplica a qué contenido.
Matriz de Riesgos y Beneficios para el Licenciamiento Abierto
Las leyes de derechos de autor y las reglas de entrenamiento de inteligencia artificial difieren según el país y siguen sin resolverse. La Oficina de Derechos de Autor de los Estados Unidos continúa examinando estas cuestiones, mientras que Creative Commons describe el entrenamiento de inteligencia artificial como un tema fáctico y legalmente complejo. (copyright.gov)
| Enfoque | Potencial de inclusión | Principales beneficios | Principales riesgos | Mejor ajuste |
|---|---|---|---|---|
| CC BY 4.0 | Muy alto | Amplia copia, adaptación, uso comercial, traducción, indexación y reutilización relacionada con modelos cuando se necesita permiso de derechos de autor | Los competidores comerciales pueden reutilizar o adaptar el contenido; la atribución puede ser imperfecta; la licencia no puede controlar la privacidad, la marca registrada o los derechos de terceros | Editores que desean la más amplia reutilización legal y una fuerte atribución de la fuente |
| CC BY-SA 4.0 | Alto, pero más complejo | Fomenta un ciclo de intercambio abierto y requiere que las adaptaciones permanezcan bajo términos compatibles | Las reglas de CompartirIgual pueden ser difíciles de aplicar a conjuntos de datos, entrenamiento de modelos y resultados públicos; algunas organizaciones pueden evitar el material debido a la incertidumbre | Proyectos educativos y de interés público abiertos que desean que las adaptaciones posteriores permanezcan abiertas |
| CC BY-NC 4.0 | Medio o bajo | Limita los usos principalmente destinados a la ventaja comercial o la compensación monetaria | "No comercial" puede ser difícil de interpretar; puede excluir usos comerciales de búsqueda, modelos y asistentes; no es una exclusión garantizada del entrenamiento | Material destinado a uso sin fines de lucro, educativo o comunitario |
| CC BY-ND 4.0 | Medio | Permite compartir limitando las adaptaciones | La traducción, transformación y algunos casos de uso de asistentes pueden volverse legalmente inciertos; menos atractivo para sistemas que resumen o remezclan | Avisos oficiales u obras que deben permanecer inalteradas |
| CC0 o dedicación al dominio público | Muy alto | Simplifica la reutilización y elimina la mayoría de las condiciones de derechos de autor donde sea legalmente efectivo | No se requiere atribución; control débil sobre la presentación de la marca; los derechos de privacidad, marca y publicidad permanecen separados | Hechos, conjuntos de datos, material de referencia u obras destinadas a la reutilización sin restricciones |
| Todos los derechos reservados más rastreo de búsqueda abierto | Alto para búsqueda, bajo para entrenamiento | Puede preservar la visibilidad de búsqueda y citas sin otorgar una licencia de reutilización amplia | Más incertidumbre legal para los desarrolladores de modelos; puede reducir la inclusión en conjuntos de datos de entrenamiento y sistemas de reutilización comercial | Editores que desean descubrimiento y citas, pero prefieren negociar licencias más amplias por separado |
La estrategia más equilibrada para muchas organizaciones es:
- CC BY 4.0 para texto editorial público original
- Etiquetas separadas para material de terceros
- No publicar información personal o confidencial
- Permitir rastreadores de búsqueda y recuperación
- Permitir rastreadores de desarrollo de modelos solo si la organización realmente acepta ese uso
- Usar atribución clara y enlaces canónicos
- Proteger las marcas comerciales mediante un aviso de marca separado
Una Lista de Verificación de Implementación Práctica
Contenido y licenciamiento
- Identifique quién posee cada página, imagen, gráfico, video y cita.
- Licencie solo el material sobre el cual su organización controla los derechos.
- Marque el material de terceros por separado.
- Agregue una declaración de licencia visible.
- Proporcione una cita preferida usando título, autor, fuente y licencia.
- Mantenga los logotipos, marcas comerciales, datos personales e información confidencial fuera del alcance de la licencia.
Robots.txt
- Cree un archivo robots.txt público en la raíz de cada host.
- Permita los rastreadores de búsqueda por separado de los rastreadores de entrenamiento.
- Bloquee las rutas administrativas, de cuenta, de pago, privadas y de aplicaciones internas.
- No dependa de robots.txt para la seguridad.
- Pruebe el archivo después de cada implementación importante del sitio web.
Metaetiquetas
- Use enlaces canónicos.
- Agregue autor, fecha de publicación y fecha de modificación.
- Use
noindexpara páginas que no deben aparecer en la búsqueda. - Use
nosnippetodata-nosnippetpara extractos sensibles donde sea compatible. - Use
X-Robots-Tagpara archivos de documentos portátiles, imágenes y otros recursos no HTML. - Recuerde que un rastreador debe poder recuperar una página antes de que pueda leer sus metaetiquetas.
Seguridad de la red
- Registre las cadenas de user-agent, las direcciones de origen, los códigos de respuesta y las rutas de solicitud.
- Verifique los rastreadores de confianza utilizando feeds de direcciones oficiales o métodos de Sistema de Nombres de Dominio.
- Actualice los feeds de direcciones automáticamente.
- Combine las verificaciones de user-agent y dirección de origen.
- Limite la velocidad de los rastreadores verificados en lugar de darles acceso ilimitado.
- Desafíe o bloquee las solicitudes que afirmen ser rastreadores de confianza pero fallen en la verificación.
Medición
Seguimiento de:
- Visitas de servicios de búsqueda de inteligencia artificial
- Referencias a la página original
- Frecuencia de citación
- Carga del servidor por rastreador
- Solicitudes que devuelven
403,404o429 - Acceso del rastreador a rutas no deseadas
- Si los artículos actuales se encuentran después de la publicación
Conclusión
La máxima inclusión requiere una apertura selectiva, no un único permiso general.
Utilice robots.txt para separar el rastreo de búsqueda, recuperación de usuario, entrenamiento y conjuntos de datos públicos. Utilice metaetiquetas y encabezados HTTP para gestionar la indexación y los fragmentos. Utilice autenticación para cualquier cosa privada. Verifique las direcciones de Protocolo de Internet de los rastreadores en lugar de confiar solo en los nombres de user-agent.
Una licencia permisiva como CC BY 4.0 puede facilitar una reutilización amplia cuando realmente la desee. La información de atribución clara (título, autor, fuente, licencia, página canónica y fecha de actualización) también puede facilitar que los sistemas de búsqueda y los asistentes identifiquen y citen la fuente correcta.
Por lo tanto, la política de publicación más sólida es:
**Abra el contenido público que desea que se descubra, licencie claramente el material que desea reutilizar, marque el material que no posee, proteja la información privada a nivel de servidor y otorgue a cada rastreador un permiso separado y revisable.
Auto