AutoPodAutoPod

최대한의 포괄성을 위한 라이선싱 및 로봇: AI 크롤러를 환영하는 방법

21분 분량
오디오 기사
최대한의 포괄성을 위한 라이선싱 및 로봇: AI 크롤러를 환영하는 방법
0:000:00
최대한의 포괄성을 위한 라이선싱 및 로봇: AI 크롤러를 환영하는 방법

최대한의 포괄성을 위한 라이선싱 및 로봇: 인공지능 크롤러를 환영하는 방법

2026년 8월 25일 업데이트됨

이제 웹사이트는 청중에게 도달하는 한 가지 이상의 방법을 갖게 되었습니다. 페이지는 Google 검색을 통해 발견되거나, ChatGPT에 의해 요약되거나, Perplexity에 의해 인용되거나, Claude 검색에 사용되거나, Apple 서비스를 통해 표시되거나, 공개 웹 아카이브에 의해 수집될 수 있습니다.

이러한 시스템이 모두 동일한 크롤러를 사용하거나 동일한 규칙을 따르는 것은 아닙니다. GPTBot을 차단하는 웹사이트도 OAI-SearchBot을 허용한다면 ChatGPT 검색에 여전히 나타날 수 있습니다. Applebot을 허용하는 웹사이트는 Applebot-Extended가 인공지능 모델 훈련에 사용되는 것을 차단하면서도 Apple 검색에서 계속 표시될 수 있습니다. Google의 Google-Extended는 일반적인 크롤러가 전혀 아닙니다. 이는 robots.txt 제어 토큰입니다.

따라서 최선의 정책은 단순히 “인공지능 허용” 또는 “인공지능 차단”이 아닙니다. 다음 각각에 대해 별도의 권한을 생성하는 것입니다.

  1. 검색 및 발견
  2. 사용자 요청 기반 검색
  3. 모델 개발 및 훈련
  4. 공개 데이터셋
  5. 민감하거나 비공개이거나 제한된 자료

이 글은 최신 크롤러 목록, robots.txt 예시, 메타 태그 지침, 인터넷 프로토콜 주소 확인 방법, Creative Commons 라이선싱 조언, 법률 상용구 및 위험-이점 매트릭스를 제공합니다.

모든 퍼블리셔가 이해해야 할 네 가지 통제 방법

1. robots.txt는 요청된 크롤링을 제어합니다

robots.txt 파일은 규정을 준수하는 자동화 클라이언트에게 어떤 페이지를 요청할 수 있는지 알려줍니다. 이는 크롤러 트래픽을 관리하고 퍼블리셔의 선호 사항을 표현하는 데 유용합니다.

그러나 robots.txt는 접근 제어 시스템이 아닙니다. 로봇 제외 프로토콜은 그 규칙이 접근 권한이 아니라고 명시합니다. Google 또한 차단된 주소가 다른 페이지에서 링크되어 있다면 검색 결과에 여전히 나타날 수 있다고 경고합니다. 기밀 정보에는 비밀번호, 인증 또는 서버 측 접근 제어를 사용하십시오. (rfc-editor.org)

2. 메타 태그는 색인 생성 및 스니펫을 제어합니다

로봇 메타 태그와 X-Robots-Tag 응답 헤더는 페이지의 색인 생성 여부 또는 검색 엔진이 스니펫을 표시할 수 있는지 여부를 제어할 수 있습니다.

이러한 제어는 일반적으로 크롤러가 페이지를 가져올 수 있도록 허용된 후에만 볼 수 있습니다. robots.txt가 페이지를 먼저 차단하면 크롤러는 메타 태그를 보지 못할 수 있습니다. (developers.google.com)

3. 네트워크 제어는 크롤러를 확인합니다

사용자 에이전트 이름은 복사하기 쉽습니다. 공격자는 GPTBot, Googlebot, 또는 PerplexityBot이라고 주장하는 요청을 보낼 수 있습니다.

더 강력한 접근 방식은 다음을 결합합니다.

  • 주장된 사용자 에이전트
  • 공개된 인터넷 프로토콜 주소 범위
  • 역방향 도메인 이름 시스템 확인
  • 정방향 도메인 이름 시스템 확인
  • 속도 제한 및 요청 모니터링

4. 라이선스는 재사용 권한을 부여합니다

Robots.txt는 크롤러에게 무엇을 요청할지 알려줍니다. 라이선스는 저작권 허가가 필요한 경우 개인이나 조직이 자료로 무엇을 합법적으로 할 수 있는지 알려줍니다.

이들은 다른 도구입니다. 관대한 라이선스는 법적 불확실성을 줄일 수 있지만, 크롤러가 페이지를 방문할지, 모델이 페이지를 사용할지, 어시스턴트가 페이지를 인용할지 보장하지는 않습니다.

중요 크롤러 목록

다음 목록은 2026년 8월 25일에 사용 가능한 제공업체 문서를 기준으로 확인되었습니다. 사용자 에이전트 이름, 목적 및 인터넷 프로토콜 주소 범위는 변경될 수 있으므로, 실제 시스템은 제공업체의 현재 문서 및 실시간 주소 피드를 사용해야 합니다.

제공업체크롤러 또는 robots.txt 토큰주요 목적중요 제어
OpenAIOAI-SearchBotChatGPT 검색을 위한 페이지 검색 및 분석페이지가 ChatGPT 검색 결과에 나타날 가능성을 높이려면 허용합니다.
OpenAIGPTBotOpenAI의 생성형 인공지능 모델 훈련에 사용될 수 있는 페이지 수집검색과 별도로 허용하거나 차단합니다.
OpenAIChatGPT-User사용자가 ChatGPT 또는 커스텀 GPT에 접근을 요청한 후 페이지를 가져옵니다자동 웹 크롤러가 아닌 사용자 트리거 방식이므로 robots.txt 규칙이 적용되지 않을 수 있습니다.
OpenAIOAI-AdsBotChatGPT 광고 대상으로 제출된 웹 페이지 확인주로 광고주와 관련됩니다. 수집된 콘텐츠는 생성형 인공지능 기반 모델 훈련에 사용되지 않습니다.
GoogleGooglebot주요 Google 검색 크롤러일반 Google 검색 크롤링을 제어합니다.
GoogleGooglebot-Image, Googlebot-Video, Googlebot-News이미지, 비디오, Google 뉴스이들은 별도의 robots.txt 토큰을 가지며 독립적으로 제어할 수 있습니다.
GoogleGoogleOther연구 개발을 포함한 다양한 제품 팀을 위한 범용 Google 크롤링특정 Google 제품을 나타내지 않습니다.
GoogleGoogle-ExtendedGoogle이 크롤링한 콘텐츠가 Gemini 모델 훈련 및 특정 기반 시스템에 사용될 수 있는지 여부를 제어합니다별도의 요청 사용자 에이전트가 아닌 robots.txt 제어 토큰입니다. 일반 Google 검색 포함에는 영향을 미치지 않습니다.
AnthropicClaudeBotClaude 모델 개발에 기여할 수 있는 공개 웹 콘텐츠 수집향후 자료가 Anthropic 훈련 데이터셋에서 제외되어야 함을 알리기 위해 차단합니다.
AnthropicClaude-SearchBotClaude 검색 결과 품질 개선Claude 검색 가시성을 위해 허용합니다.
AnthropicClaude-User사용자의 Claude 요청에 응답하여 페이지를 가져옵니다자동 크롤링과 별개입니다.
PerplexityPerplexityBotPerplexity 검색 결과를 위한 페이지 색인Perplexity는 이 크롤러가 인공지능 기반 모델 훈련을 위한 콘텐츠 수집에 사용되지 않는다고 말합니다.
PerplexityPerplexity-User사용자가 페이지를 요청한 후 페이지를 가져옵니다Perplexity의 문서에 따르면 이 가져오기 기능은 요청이 사용자로부터 시작되었기 때문에 일반적으로 robots.txt를 무시합니다.
AppleApplebotApple Search, Spotlight, Siri, Safari 및 기타 Apple 경험 지원Apple 검색을 위해 허용합니다.
AppleApplebot-ExtendedApplebot이 크롤링한 콘텐츠가 Apple 기반 모델 훈련에 사용될 수 있는지 여부를 제어합니다페이지 자체를 크롤링하지 않습니다. 데이터 사용 제어입니다.
Common CrawlCCBotCommon Crawl의 공개 웹 아카이브를 위한 공개 웹 데이터 수집어시스턴트는 아니지만, 그 데이터셋은 연구원 및 인공지능 개발자가 사용할 수 있습니다.
MicrosoftBingbot주요 Bing 검색 크롤러Bing 검색 및 검색 가시성을 위해 허용합니다.
MicrosoftMicrosoftPreview, BingVideoPreviewMicrosoft 제품용 페이지 및 비디오 미리보기이들은 Bingbot과 별도로 제어할 수 있습니다.
AmazonAmzn-SearchBotAmazon 검색 및 콘텐츠 발견Amazon은 생성형 인공지능 모델 훈련을 위해 콘텐츠를 크롤링하지 않는다고 말합니다.
AmazonAmzn-UserAlexa 요청을 포함한 사용자 작업에 응답하여 현재 정보를 가져옵니다사용자 트리거 방식이며 자동 검색 크롤링과 별개입니다.

OpenAI는 검색, 훈련, 광고 및 사용자 트리거 크롤러를 별도의 제어 기능으로 문서화합니다. 그 문서는 OAI-SearchBot을 ChatGPT 검색에 허용하고 GPTBot을 훈련 선호도에 별도로 사용할 것을 특별히 권장합니다. (developers.openai.com)

Google도 마찬가지로 Googlebot, GoogleOther, Google-Extended를 분리합니다. Google-Extended는 자체 HTTP 요청 사용자 에이전트가 없으며, 이를 차단해도 페이지가 Google 검색에서 제거되지 않습니다. (developers.google.com)

Anthropic은 ClaudeBot, Claude-SearchBot 및 Claude-User에 대한 별도의 역할을 문서화합니다. Anthropic은 또한 봇이 robots.txt를 따르고 비표준 Crawl-delay 지시문을 지원한다고 명시합니다. (support.anthropic.com)

Perplexity는 자동 검색 크롤링과 사용자 요청 기반 가져오기를 구별합니다. 현재 문서에 따르면 PerplexityBot은 robots.txt를 준수하지만, Perplexity-User는 사용자 요청에 응답하기 때문에 일반적으로 그렇지 않습니다. (docs.perplexity.ai)

Apple의 현재 문서는 검색과 훈련 구분을 동일하게 적용합니다. Applebot은 검색을 지원하는 반면, Applebot-Extended는 퍼블리셔가 Apple 검색에서 페이지를 제거하지 않고도 훈련 사용을 제어할 수 있도록 합니다. (support.apple.com)

권장 robots.txt 구성

robots.txt를 각 호스트의 루트에 배치합니다. 예를 들어:

text https://www.example.org/robots.txt

규칙은 파일이 제공되는 특정 호스트, 프로토콜 및 포트에 적용됩니다. 별도의 하위 도메인에는 자체 파일이 필요할 수 있습니다. (developers.google.com)

구성 1: 최대 포괄성

이것은 공개 편집 콘텐츠가 규정을 준수하는 크롤러에 의해 발견되고, 요약되고, 인용되고, 색인되고, 수집될 수 있을 때 사용합니다.

text

공개 페이지는 규정을 준수하는 크롤러에 사용할 수 있습니다.

User-agent: * Allow: /

비공개, 거래 및 관리 경로를 제외합니다.

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

이것은 OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft, Amazon을 포함한 명명된 크롤러가 다른 특정 규칙에 의해 차단되지 않는 한 허용합니다.

이 구성 아래에 User-agent: * Disallow: /와 같은 포괄적인 규칙을 배치하지 마십시오. 나중에 또는 더 구체적인 그룹이 크롤러가 파일을 해석하는 방식을 변경할 수 있습니다.

구성 2: 검색은 허용하되 모델 개발 크롤러는 차단

이것은 인용 및 검색 트래픽을 원하지만 모델 개발 수집에 대한 허가를 알리고 싶지 않은 퍼블리셔에게 종종 최상의 절충안입니다.

text

OpenAI 모델 개발 크롤링을 차단합니다.

User-agent: GPTBot Disallow: /

Anthropic 모델 개발 크롤링을 차단합니다.

User-agent: ClaudeBot Disallow: /

Google 모델 훈련 및 관련 기반 사용을 차단합니다.

User-agent: Google-Extended Disallow: /

Apple 기반 모델 훈련 사용을 차단합니다.

User-agent: Applebot-Extended Disallow: /

선택 사항: Common Crawl 데이터셋 수집을 차단합니다.

User-agent: CCBot

Disallow: /

민감한 경로를 제외하고 일반 검색 및 검색 크롤링을 허용합니다.

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

이 구성은 OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, Applebot을 와일드카드 그룹에 포함시킵니다. 또한 검색 및 훈련 권한을 분리합니다.

Apple의 경우 Applebot-Extended를 차단하면서 Applebot을 허용하면 Apple 서비스를 통한 검색이 유지됩니다. Google의 경우 Google-Extended를 차단해도 일반 Google 검색이 차단되지 않습니다. (developers.google.com)

구성 3: 특정 검색 크롤러 명시적으로 허용

기존 robots.txt 파일이 모든 크롤러를 차단하는 경우, 환영하고 싶은 검색 크롤러에 대한 별도의 그룹을 추가하십시오.

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

다른 모든 크롤러를 차단합니다.

User-agent: * Disallow: /

특정 그룹을 사용할 때는 민감한 경로 규칙을 각 그룹 내에 반복하십시오. 일부 크롤러는 와일드카드 그룹과 결합하는 대신 가장 구체적으로 일치하는 그룹을 사용합니다. Bing은 이 동작을 직접 문서화하고, Google은 크롤러별 그룹에 대한 별도 지침을 제공합니다. (bing.com)

robots.txt의 중요 제한 사항

  • 크롤러는 robots.txt를 무시할 수 있습니다.
  • 악성 크롤러는 신뢰할 수 있는 크롤러인 척할 수 있습니다.
  • 차단된 페이지는 여전히 제목이나 웹 주소로 알려질 수 있습니다.
  • Robots.txt는 비밀번호, 비공개 파일, 고객 기록 또는 기밀 애플리케이션 프로그래밍 인터페이스를 보호하지 않습니다.
  • Crawl-delay 지시문은 핵심 로봇 제외 프로토콜의 일부가 아니며 모든 크롤러에서 지원되지 않습니다. Anthropic과 Bing은 지원을 문서화하지만, Apple은 Applebot이 crawl-delay를 따르지 않는다고 말합니다. (rfc-editor.org)

메타 태그 및 HTTP 헤더

공개 페이지 예시

공개 기사의 경우, 명확한 제목, 작성자, 표준 웹 주소, 발행일 및 수정일을 사용하십시오.

html

max-snippet 지시문은 주로 Google에 대해 문서화되어 있습니다. 모든 인공지능 크롤러가 모든 메타 지시문을 지원한다고 가정하지 마십시오.

비공개 또는 민감한 페이지 예시

html

이것은 검색 결과에 나타나지 않아야 하는 페이지에 사용하십시오. 크롤러가 지시문을 볼 수 있을 만큼 페이지는 충분히 크롤링 가능해야 합니다. 페이지가 정말로 비공개로 유지되어야 한다면, 대신 인증이나 비밀번호 보호를 사용하십시오. (developers.google.com)

검색 스니펫에서 민감한 섹션만 숨기기

Google은 HTML 페이지의 특정 부분에 대해 data-nosnippet을 지원합니다.

html

이 단락은 검색 결과에 표시될 수 있습니다.

개인 전화번호, 개인 이메일 주소 또는 내부 메모는 여기에 있습니다.

이것은 연락처 정보, 내부 메모 또는 사용자 생성 정보에 유용합니다. 모든 인공지능 시스템에 대한 보편적인 지침은 아닙니다. (developers.google.com)

파일에 X-Robots-Tag 헤더 사용

메타 태그는 휴대용 문서 파일, 이미지 또는 비디오 파일 내에 배치할 수 없습니다. 대신 HTTP 응답 헤더를 사용하십시오.

text X-Robots-Tag: noindex, nosnippet

검색 가능해야 하지만 스니펫이나 인공지능 답변에 텍스트를 제공하지 않아야 하는 페이지의 경우 다음을 사용하십시오.

text X-Robots-Tag: nosnippet

Google은 비 HTML 리소스에 대해 X-Robots-Tag를 문서화하고, Apple도 Applebot에 대해 이를 지원합니다. (developers.google.com)

Apple 특정 제어

Apple은 다음을 지원합니다.

html

Apple은 nosnippet이 Apple 모델이 출력을 생성할 때 페이지가 추가 컨텍스트 및 현재 콘텐츠로 사용되는 것을 방지한다고 말합니다. 페이지는 Apple 검색, Spotlight, Siri 및 Safari를 통해 계속 검색될 수 있습니다. (support.apple.com)

유료 페이지의 경우, Apple은 다음을 사용하여 구조화된 데이터도 지원합니다.

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple은 이러한 페이지가 검색 결과에 계속 포함될 수 있지만 인공지능 답변의 추가 컨텍스트로 사용되지 않을 것이라고 말합니다. (support.apple.com)

크롤러 인터넷 프로토콜 주소를 확인하는 방법

사용자 에이전트 매칭만으로는 충분하지 않은 이유

다음과 같은 규칙은 취약합니다.

text if User-Agent contains "GPTBot": allow

누구나 그 텍스트를 보낼 수 있습니다. 더 나은 규칙은 다음과 같습니다.

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

조직이 제어하는 프록시 또는 콘텐츠 전송 네트워크에서 온 것이 아니라면 X-Forwarded-For 헤더를 신뢰하지 마십시오.

제공업체 확인 방법

제공업체권장 확인 방법
OpenAIOAI-SearchBot, GPTBot, OAI-AdsBot에 대한 OpenAI 크롤러 문서에 게시된 실시간 인터넷 프로토콜 주소 피드를 사용하십시오. 고정된 범위를 방화벽에 복사하는 대신 자동으로 새로 고치십시오.
GoogleGoogle이 게시한 크롤러 범위 또는 역방향 및 정방향 도메인 이름 시스템 확인을 수행하십시오. 실제 Google 크롤러는 승인된 Google 호스트 이름으로 확인되고 원래 주소로 다시 확인되어야 합니다.
Anthropic현재 게시된 크롤러 주소 피드를 보조 네트워크 확인으로 사용하십시오. Anthropic의 주요 옵트아웃 방법은 robots.txt로 남아 있습니다.
Perplexity사용자 에이전트와 현재 PerplexityBot 또는 Perplexity-User 주소 피드를 결합하십시오. Perplexity는 웹 애플리케이션 방화벽 규칙에서 두 조건을 모두 결합할 것을 특별히 권장합니다.
Appleapplebot.apple.com 아래에서 역방향 도메인 이름 시스템 확인을 사용한 다음 정방향 조회를 수행하십시오. Apple은 또한 현재 주소 범위를 JSON 피드로 게시합니다.
Common Crawlcrawl.commoncrawl.org 아래에서 역방향 도메인 이름 시스템 확인과 현재 CCBot 주소 피드를 사용하십시오. Common Crawl은 일부 IPv6 트래픽에 대해 역방향 확인이 아직 제공되지 않는다고 언급합니다.
Microsoft공식 Verify Bingbot 도구 또는 Microsoft의 문서화된 역방향 및 정방향 조회 방법을 사용하십시오.
AmazonAmazon이 게시한 크롤러 주소 목록을 사용하고 적절한 Amazon 사용자 에이전트와 일치시키십시오.

Google, Apple, Common Crawl, OpenAI, Anthropic, Perplexity는 모두 제공업체별 방법 또는 주소 피드를 게시합니다. 이 목록은 변경될 수 있으므로, 영구적인 수동 복사 목록보다 예약된 업데이트 프로세스가 더 안전합니다. (developers.google.com)

간단한 방화벽 설계는 다음과 같을 수 있습니다.

text allow OAI-SearchBot only when source address is in the current OpenAI search range allow GPTBot only when source address is in the current OpenAI training range allow PerplexityBot only when source address is in the current PerplexityBot range allow Applebot only when reverse and forward DNS verification succeeds allow CCBot only when reverse DNS and the current Common Crawl range match

rate-limit all verified crawlers block or challenge unverified requests claiming to be trusted crawlers

전체 클라우드 제공업체에 광범위한 허용 규칙을 적용하지 마십시오. 합법적인 크롤러가 클라우드 인프라를 사용할 수 있지만, 해당 클라우드 제공업체에서 발생하는 대부분의 트래픽이 반드시 크롤러인 것은 아닙니다.

개방형 라이선스가 포괄성에 미치는 영향

쉬운 설명으로 보는 CC BY 4.0

일반적으로 CC BY 4.0이라고 불리는 Creative Commons Attribution 4.0 International 라이선스는 사람들이 다음을 할 수 있도록 허용합니다.

  • 저작물 복사 및 재배포
  • 각색, 번역, 리믹스 및 기반으로 구축
  • 상업적으로 사용

주요 조건은 다음과 같습니다.

  • 적절한 출처 표기
  • 라이선스에 링크
  • 변경 여부 표시
  • 원작자가 재사용을 보증한다고 암시하지 않음
  • 라이선스에 의해 허용되는 사용을 방해하는 법적 또는 기술적 제한을 추가하지 않음

Creative Commons는 또한 라이선스가 개인 정보 보호 권리, 퍼블리시티권, 인격권, 상표권, 특허권 또는 제3자 자료를 포함하지 않을 수 있다고 경고합니다. (creativecommons.org)

라이선스 자체가 크롤러 초대장이 아닙니다

페이지에 “CC BY 4.0”을 표기하는 것이 조직이 페이지를 크롤링할 것이라고 보장하지는 않습니다. 크롤러는 다음으로 인해 여전히 차단될 수 있습니다.

  • robots.txt
  • 콘텐츠 전송 네트워크
  • 웹 애플리케이션 방화벽
  • 속도 제한
  • JavaScript 챌린지
  • 로그인 장벽
  • 불량 서버 응답
  • 접근 불가능한 사이트맵

반대로, 크롤러를 허용하는 것이 모든 후속 사용에 필요한 모든 저작권 허가를 자동으로 부여하는 것은 아닙니다. robots.txt와 라이선싱은 함께 설계되어야 합니다.

CC BY가 더 넓은 포괄성을 지원할 수 있는 이유

명확하고 관대한 라이선스는 퍼블리셔의 정책을 데이터 팀, 검색 시스템 및 어시스턴트 운영자가 이해하기 더 쉽게 만들 수 있습니다. 이는 복사, 각색, 상업적 사용, 번역 및 재배포 활동에 저작권 허가가 필요할 때 불확실성을 줄일 수 있습니다.

그러나 Creative Commons는 인공지능 훈련이 법적으로 복잡하다고 설명합니다. 제한적인 라이선스가 훈련을 방지하는 효과적인 방법이 아닐 수도 있습니다. 왜냐하면 일부 훈련 사용은 저작권 예외 또는 제한에 의해 허용될 수 있기 때문입니다. Creative Commons는 또한 라이선스 조건이 기계 훈련 및 모델 출력에 적용하기 어려울 수 있다고 언급합니다. (creativecommons.org)

실용적인 교훈은 다음과 같습니다:

진정으로 광범위한 합법적 재사용을 원할 때 CC BY를 사용하십시오. 제한적인 Creative Commons 라이선스를 인공지능 훈련 옵트아웃을 보장하는 수단으로 사용하지 마십시오.

출처 표기는 명확성을 높입니다

Creative Commons는 TASL 방법을 권장합니다:

  • 제목(Title)
  • 저자(Author)
  • 출처(Source)
  • 라이선스(License)

예시:

“최대한의 포괄성을 위한 라이선싱 및 로봇,” Example Publishing, https://www.example.org/articles/ai-crawlers, Creative Commons Attribution 4.0 International 라이선스 적용. 변경 사항: 크롤러 목록 업데이트.

명확한 출처 표기가 모든 어시스턴트가 페이지를 인용하도록 강제하지는 않습니다. 그러나 시스템이 페이지의 제목, 저자, 출처 및 라이선스 정보를 추출할 때 올바른 인용을 더 쉽게 만듭니다. (wiki.creativecommons.org)

구조화된 기사 정보 추가

가시적인 정보와 구조화된 데이터를 함께 사용하십시오.

html

Google은 명확한 작성자 정보, 작성자 페이지, 발행일, 수정일 및 안정적인 표준 페이지를 권장합니다. 이러한 신호는 검색 시스템이 누가 자료를 만들었는지, 어떤 버전이 권위 있는지 이해하는 데 도움이 될 수 있습니다. 이는 순위, 포함 또는 인용을 보장하지 않습니다. (developers.google.com)

개방적이고 인용 친화적인 사이트를 위한 법적 상용구

다음은 샘플 문구이며 법률 자문이 아닙니다. 귀하의 관할권, 소유 구조, 개인 정보 보호 의무 및 제3자 콘텐츠에 맞게 변호사와 상담하여 조정하십시오.

CC BY 4.0 라이선스 문구

text

콘텐츠 라이선스

별도로 명시되지 않는 한, 이 페이지의 원본 텍스트 및 원본 편집 자료는 Creative Commons Attribution 4.0 International 라이선스에 따라 라이선스됩니다:

https://creativecommons.org/licenses/by/4.0/

이 허가는 라이선스 약관을 준수하는 한 복사, 재배포, 각색, 번역, 상업적 사용, 기계 판독 처리, 검색 색인 생성, 검색, 요약 및 인공지능 시스템에서의 사용을 허용합니다.

권장 출처 표기:

“[페이지 제목],” [저자 또는 조직] 제공, [표준 페이지 주소], [날짜] 발행 또는 업데이트됨, Creative Commons Attribution 4.0 International 라이선스 적용. 변경 사항: [변경 사항 설명 또는 ‘없음’ 기재].

합리적으로 가능한 한 저자, 퍼블리셔, 출처, 라이선스 및 수정 정보를 보존해 주십시오. 이 권장 출처 표기 가이드는 Creative Commons 라이선스에 제한을 추가하지 않으며 라이선스 텍스트를 대체하지 않습니다.

“인공지능 시스템 포함”이라는 문구는 퍼블리셔의 의도를 명확히 합니다. 이는 퍼블리셔가 다른 사람이 만든 자료에 대한 권리를 소유하는 척하는 데 사용되어서는 안 됩니다.

브랜드, 개인 정보 및 제3자 권리 고지

text

브랜드, 개인 정보 및 제3자 권리

위 라이선스는 라이선스된 것으로 식별된 원본 자료에만 적용됩니다. 다음의 사용을 허가하지 않습니다:

  • 상표, 서비스 마크, 로고 또는 트레이드 드레스
  • 사람의 이름, 이미지 또는 초상권
  • 비공개, 기밀, 계정, 건강, 금융 또는 보안 정보
  • 별도로 라이선스된 것으로 식별되지 않는 사용자 제출물
  • 사진, 삽화, 지도, 비디오, 음악, 인용문 또는 기타 제3자 자료
  • “모든 권리 보유”로 식별되거나 별도 라이선스의 적용을 받는 콘텐츠

Example Publishing의 이름, 로고 및 마크 사용은 후원, 승인, 파트너십 또는 보증을 암시해서는 안 됩니다. 원본 페이지에 링크하고 인용, 의역, 요약 및 생성된 자료를 명확히 구분해 주십시오.

이 문구는 중요합니다. 왜냐하면 Creative Commons 라이선스가 페이지와 관련된 모든 유형의 법적 권리를 자동으로 부여하지 않기 때문입니다. (creativecommons.org)

검색 및 어시스턴트 인용 지침

text

검색 및 어시스턴트 인용 지침

저희는 이 사이트의 라이선스된 자료에 대한 규정을 준수하는 검색 색인 생성, 사용자 요청 기반 검색, 인용 및 요약을 환영합니다.

이 사이트를 인용할 때는 페이지 제목, 저자 또는 퍼블리셔, 표준 페이지 주소, 발행 또는 업데이트 날짜, 그리고 출처에 대한 직접 링크를 사용해 주십시오. 출처를 사용된 여러 입력 중 하나로 식별하고, 생성된 분석을 인용된 자료와 구분하며, Example Publishing이 생성된 답변, 제품, 사람 또는 서비스를 보증한다고 진술하거나 암시하지 마십시오.

이 지침은 정확성과 출처 표기를 개선하기 위한 것입니다. 이는 적용 가능한 콘텐츠 라이선스를 넘어선 권한을 부여하지 않으며, 상표, 개인 정보, 기밀 정보 또는 제3자 자료를 라이선스하지 않습니다.

검색 가시성을 원하지만 광범위한 훈련 라이선스를 부여하고 싶지 않은 경우

text

검색 접근 및 저작권

저희의 공개 페이지는 robots.txt 파일에 식별된 규정을 준수하는 검색 및 검색 크롤러에 의해 접근될 수 있습니다. 이 허가는 검색, 검색 결과, 사용자 요청 기반 검색 및 인용을 지원하기 위한 것입니다.

별도 라이선스가 표시된 경우를 제외하고, 원본 콘텐츠는 모든 권리가 보유됩니다. 공개 페이지에 접근한다고 해서 모델 개발, 훈련, 재배포, 상업적 재사용 또는 적용 가능한 법률이 제공하는 권한을 넘어서는 파생 저작물 생성에 대한 별도의 라이선스를 부여하는 것은 아닙니다.

이 자료를 언급할 때는 표준 페이지 주소와 퍼블리셔를 인용해 주십시오. 이 사이트의 어떠한 내용도 상표, 로고, 개인 정보, 기밀 정보 또는 제3자 콘텐츠 사용을 허가하지 않습니다.

CC BY 문구와 모든 권리 보유 문구를 동일한 자료에 함께 배치하지 마십시오. 어떤 라이선스가 어떤 콘텐츠에 적용되는지 명확히 식별하십시오.

개방형 라이선싱을 위한 위험-이점 매트릭스

저작권법 및 인공지능 훈련 규칙은 국가마다 다르며 아직 확정되지 않았습니다. 미국 저작권청은 이러한 문제를 계속 검토하고 있으며, Creative Commons는 인공지능 훈련을 사실에 기반하고 법적으로 복잡하다고 설명합니다. (copyright.gov)

접근 방식포괄성 잠재력주요 이점주요 위험가장 적합한 경우
CC BY 4.0매우 높음저작권 허가가 필요한 경우 광범위한 복사, 각색, 상업적 사용, 번역, 색인 생성 및 모델 관련 재사용상업적 경쟁자가 콘텐츠를 재사용하거나 각색할 수 있음; 출처 표기가 불완전할 수 있음; 라이선스가 개인 정보 보호, 상표 또는 제3자 권리를 제어할 수 없음가장 광범위한 합법적 재사용과 강력한 출처 표기를 원하는 퍼블리셔
CC BY-SA 4.0높음, 그러나 더 복잡함개방형 공유 주기를 장려하고 각색된 저작물이 호환 가능한 약관을 따르도록 요구ShareAlike 규칙은 데이터셋, 모델 훈련 및 공개 출력에 적용하기 어려울 수 있음; 일부 조직은 불확실성 때문에 자료를 피할 수 있음하위 각색된 저작물이 계속 개방되기를 원하는 개방 교육 및 공익 프로젝트
CC BY-NC 4.0중간 또는 낮음주로 상업적 이점 또는 금전적 보상을 위한 사용을 제한“비상업적”의 해석이 어려울 수 있음; 상업적 검색, 모델 및 어시스턴트 사용을 배제할 수 있음; 훈련 옵트아웃을 보장하지 않음비영리, 교육 또는 커뮤니티 사용을 위한 자료
CC BY-ND 4.0중간각색을 제한하면서 공유를 허용번역, 변형 및 일부 어시스턴트 사용 사례가 법적으로 불확실해질 수 있음; 요약 또는 리믹스하는 시스템에는 덜 매력적공식 고지 또는 변경 없이 유지되어야 하는 저작물
CC0 또는 공개 도메인 헌정매우 높음재사용을 단순화하고 법적으로 유효한 경우 대부분의 저작권 조건을 제거출처 표기가 의무적이지 않음; 브랜드 표시에 대한 통제가 약함; 개인 정보 보호, 상표 및 퍼블리시티권은 별개로 유지됨사실, 데이터셋, 참조 자료 또는 무제한 재사용을 위한 저작물
모든 권리 보유 + 개방형 검색 크롤링검색에는 높음, 훈련에는 낮음광범위한 재사용 라이선스를 부여하지 않고도 검색 및 인용 가시성을 유지할 수 있음모델 개발자를 위한 법적 불확실성 증가; 훈련 데이터셋 및 상업적 재사용 시스템에 포함되는 것을 줄일 수 있음검색 및 인용을 원하지만 더 넓은 라이선스를 별도로 협상하기를 선호하는 퍼블리셔

많은 조직에게 가장 균형 잡힌 전략은 다음과 같습니다.

  • 원본 공개 편집 텍스트에 CC BY 4.0
  • 제3자 자료에 대한 별도 라벨
  • 공개 개인 정보 또는 기밀 정보 없음
  • 검색 및 검색 크롤러 허용
  • 조직이 해당 사용을 진정으로 수락하는 경우에만 모델 개발 크롤러 허용
  • 명확한 출처 표기 및 표준 링크 사용
  • 별도 브랜드 고지를 통해 상표 보호

실용적인 구현 체크리스트

콘텐츠 및 라이선싱

  • 각 페이지, 이미지, 차트, 비디오 및 인용문의 소유자를 식별하십시오.
  • 귀하의 조직이 권리를 제어하는 자료에만 라이선스를 부여하십시오.
  • 제3자 자료를 별도로 표시하십시오.
  • 가시적인 라이선스 문구를 추가하십시오.
  • 제목, 저자, 출처 및 라이선스를 사용하여 권장 인용을 제공하십시오.
  • 로고, 상표, 개인 데이터 및 기밀 정보를 라이선스 범위 밖에 두십시오.

Robots.txt

  • 모든 호스트의 루트에 공개 robots.txt 파일을 생성하십시오.
  • 훈련 크롤러와 별도로 검색 크롤러를 허용하십시오.
  • 관리, 계정, 결제, 비공개 및 내부 애플리케이션 경로를 차단하십시오.
  • 보안을 위해 robots.txt에 의존하지 마십시오.
  • 주요 웹사이트 배포 후 파일을 테스트하십시오.

메타 태그

  • 표준 링크를 사용하십시오.
  • 저자, 발행일 및 수정일을 추가하십시오.
  • 검색에 나타나지 않아야 하는 페이지에는 noindex를 사용하십시오.
  • 지원되는 경우 민감한 발췌 부분에는 nosnippet 또는 data-nosnippet을 사용하십시오.
  • 휴대용 문서 파일, 이미지 및 기타 비 HTML 리소스에는 X-Robots-Tag를 사용하십시오.
  • 크롤러가 메타 태그를 읽기 전에 페이지를 가져올 수 있어야 한다는 점을 기억하십시오.

네트워크 보안

  • 사용자 에이전트 문자열, 출처 주소, 응답 코드 및 요청 경로를 기록하십시오.
  • 공식 주소 피드 또는 도메인 이름 시스템 방법을 사용하여 신뢰할 수 있는 크롤러를 확인하십시오.
  • 주소 피드를 자동으로 새로 고치십시오.
  • 사용자 에이전트 및 출처 주소 확인을 결합하십시오.
  • 확인된 크롤러에 무제한 접근을 허용하는 대신 속도 제한을 적용하십시오.
  • 신뢰할 수 있는 크롤러라고 주장하지만 확인에 실패하는 요청을 차단하거나 챌린지하십시오.

측정

다음 사항을 추적하십시오:

  • 인공지능 검색 서비스로부터의 방문
  • 원본 페이지로의 참조
  • 인용 빈도
  • 크롤러별 서버 부하
  • 403, 404, 429를 반환하는 요청
  • 의도하지 않은 경로로의 크롤러 접근
  • 현재 기사가 발행 후 발견되는지 여부

결론

최대한의 포괄성은 단일한 포괄적 허용이 아닌 선택적 개방성을 필요로 합니다.

Robots.txt를 사용하여 검색, 사용자 검색, 훈련 및 공개 데이터셋 크롤링을 분리하십시오. 메타 태그 및 HTTP 헤더를 사용하여 색인 생성 및 스니펫을 관리하십시오. 비공개 정보에는 인증을 사용하십시오. 사용자 에이전트 이름만 신뢰하지 말고 크롤러 인터넷 프로토콜 주소를 확인하십시오.

CC BY 4.0과 같은 관대한 라이선스는 진정으로 광범위한 재사용을 원할 때 이를 더 쉽게 만들 수 있습니다. 제목, 저자, 출처, 라이선스, 표준 페이지 및 업데이트 날짜와 같은 명확한 출처 표기 정보는 검색 시스템과 어시스턴트가 올바른 출처를 식별하고 인용하는 것을 더 쉽게 만들 수 있습니다.

따라서 가장 강력한 퍼블리싱 정책은 다음과 같습니다.

**발견되기를 원하는 공개 콘텐츠를 개방하고, 재사용되기를 원하는 자료에 명확하게 라이선스를 부여하며, 소유하지 않은 자료를 표시하고, 서버 수준에서 개인 정보를 보호하며, 모든 크롤러에 대해 별도로 검토 가능한 권한을 부여하십시오.

관련 기사

이 콘텐츠가 마음에 드시나요?

최신 콘텐츠 마케팅 인사이트와 성장 가이드를 받으려면 뉴스레터를 구독하세요.

이 기사는 정보 제공 목적으로만 작성되었습니다. 콘텐츠와 전략은 구체적인 필요에 따라 달라질 수 있습니다.
최대한의 포괄성을 위한 라이선싱 및 로봇: AI 크롤러를 환영하는 방법 | AutoPod