AutoPodAutoPod

การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด: วิธีการต้อนรับ AI Crawlers

ใช้เวลาอ่าน 11 นาที
บทความเสียง
การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด: วิธีการต้อนรับ AI Crawlers
0:000:00
การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด: วิธีการต้อนรับ AI Crawlers

การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด: วิธีการต้อนรับ AI Crawlers

อัปเดตเมื่อ 25 สิงหาคม 2569

เว็บไซต์ในปัจจุบันมีวิธีเข้าถึงผู้ชมได้มากกว่าหนึ่งทาง หน้าเว็บอาจถูกค้นพบผ่าน Google Search, สรุปโดย ChatGPT, อ้างอิงโดย Perplexity, ใช้ในการค้นหาของ Claude, แสดงผลผ่านบริการของ Apple, หรือถูกรวบรวมโดยคลังข้อมูลเว็บสาธารณะ

ระบบเหล่านี้ไม่ได้ใช้ Crawler เดียวกันทั้งหมดหรือปฏิบัติตามกฎเดียวกันทั้งหมด เว็บไซต์ที่บล็อก GPTBot อาจยังคงปรากฏในการค้นหาของ ChatGPT หากอนุญาต OAI-SearchBot เว็บไซต์ที่อนุญาต Applebot สามารถยังคงมองเห็นได้ในการค้นหาของ Apple ในขณะที่บล็อก Applebot-Extended จากการฝึกอบรมโมเดลปัญญาประดิษฐ์ Google-Extended ของ Google ไม่ใช่ Crawler ทั่วไปเลย แต่มันคือโทเค็นควบคุม robots.txt

ดังนั้น นโยบายที่ดีที่สุดจึงไม่ใช่แค่ “อนุญาตปัญญาประดิษฐ์” หรือ “บล็อกปัญญาประดิษฐ์” แต่เป็นการสร้างการอนุญาตแยกกันสำหรับ:

  1. การค้นหาและการค้นพบ
  2. การดึงข้อมูลตามคำขอของผู้ใช้
  3. การพัฒนาและการฝึกอบรมโมเดล
  4. ชุดข้อมูลสาธารณะ
  5. เนื้อหาที่ละเอียดอ่อน เป็นส่วนตัว หรือถูกจำกัด

บทความนี้จะนำเสนอรายการ Crawler ในปัจจุบัน ตัวอย่าง robots.txt คำแนะนำเกี่ยวกับ meta tag วิธีการยืนยันที่อยู่ Internet Protocol คำแนะนำเกี่ยวกับการออกใบอนุญาต Creative Commons ข้อความกฎหมายมาตรฐาน และเมทริกซ์ความเสี่ยง-ผลประโยชน์

สี่การควบคุมที่ผู้เผยแพร่ทุกรายควรเข้าใจ

1. robots.txt ควบคุมการคลานที่ร้องขอ

ไฟล์ robots.txt บอกไคลเอนต์อัตโนมัติที่ปฏิบัติตามกฎว่าพวกเขาสามารถร้องขอหน้าใดได้บ้าง มีประโยชน์สำหรับการจัดการปริมาณการเข้าชมของ Crawler และการแสดงความต้องการของผู้เผยแพร่

อย่างไรก็ตาม robots.txt ไม่ใช่ระบบควบคุมการเข้าถึง โปรโตคอลการยกเว้นหุ่นยนต์ระบุว่ากฎของมันไม่ใช่การอนุญาตการเข้าถึง Google ยังเตือนอีกว่าที่อยู่ที่ถูกบล็อกยังคงปรากฏในผลการค้นหาได้หากหน้าอื่น ๆ ลิงก์มายังที่อยู่นั้น ใช้รหัสผ่าน การยืนยันตัวตน หรือการควบคุมการเข้าถึงฝั่งเซิร์ฟเวอร์สำหรับข้อมูลที่เป็นความลับ (rfc-editor.org)

2. Meta tags ควบคุมการจัดทำดัชนีและ Snippets

Robots meta tags และส่วนหัวการตอบกลับ X-Robots-Tag สามารถควบคุมได้ว่าหน้าเว็บจะถูกจัดทำดัชนีหรือไม่ หรือเครื่องมือค้นหาจะแสดง Snippet ได้หรือไม่

การควบคุมเหล่านี้มักจะมองเห็นได้หลังจากที่ Crawler ได้รับอนุญาตให้ดึงข้อมูลหน้าเว็บแล้วเท่านั้น หาก robots.txt บล็อกหน้าเว็บก่อน Crawler อาจไม่เห็น meta tag นั้นเลย (developers.google.com)

3. การควบคุมเครือข่ายยืนยัน Crawler

ชื่อ User-agent นั้นง่ายต่อการคัดลอก ผู้โจมตีสามารถส่งคำขออ้างว่าเป็น GPTBot, Googlebot หรือ PerplexityBot

วิธีการที่แข็งแกร่งกว่าคือการรวมสิ่งเหล่านี้เข้าด้วยกัน:

  • User-agent ที่อ้างสิทธิ์
  • ช่วงที่อยู่ Internet Protocol ที่เผยแพร่
  • การยืนยันระบบชื่อโดเมนแบบย้อนกลับ (Reverse Domain Name System)
  • การยืนยันระบบชื่อโดเมนแบบส่งต่อ (Forward Domain Name System)
  • การจำกัดอัตราและการตรวจสอบคำขอ

4. ใบอนุญาตให้สิทธิ์การนำไปใช้ซ้ำ

Robots.txt บอกสิ่งที่ Crawler ถูกขอให้ทำ ใบอนุญาตบอกสิ่งที่บุคคลหรือองค์กรสามารถทำกับเนื้อหาได้อย่างถูกกฎหมายเมื่อจำเป็นต้องได้รับอนุญาตตามลิขสิทธิ์

สิ่งเหล่านี้เป็นเครื่องมือที่แตกต่างกัน ใบอนุญาตแบบอนุญาตสามารถลดความไม่แน่นอนทางกฎหมายได้ แต่ไม่รับประกันว่า Crawler จะเยี่ยมชมหน้าเว็บนั้น โมเดลจะใช้มัน หรือผู้ช่วยจะอ้างอิงมัน

รายการ Crawler ที่สำคัญ

รายการต่อไปนี้ได้รับการตรวจสอบกับเอกสารประกอบของผู้ให้บริการที่มีอยู่เมื่อวันที่ 25 สิงหาคม 2569 ชื่อ User-agent, วัตถุประสงค์ และช่วงที่อยู่ Internet Protocol สามารถเปลี่ยนแปลงได้ ดังนั้นระบบการผลิตควรใช้เอกสารประกอบปัจจุบันและฟีดที่อยู่สดของผู้ให้บริการ

ผู้ให้บริการCrawler หรือโทเค็น robots.txtวัตถุประสงค์หลักการควบคุมที่สำคัญ
OpenAIOAI-SearchBotค้นหาและวิเคราะห์หน้าเว็บสำหรับการค้นหาของ ChatGPTอนุญาตเพื่อเพิ่มโอกาสที่หน้าเว็บจะปรากฏในผลการค้นหาของ ChatGPT
OpenAIGPTBotรวบรวมหน้าเว็บที่อาจใช้สำหรับการฝึกอบรมโมเดลปัญญาประดิษฐ์เชิงสร้างสรรค์ของ OpenAIอนุญาตหรือไม่อนุญาตแยกจากการค้นหา
OpenAIChatGPT-Userดึงหน้าเว็บหลังจากผู้ใช้ขอให้ ChatGPT หรือ Custom GPT เข้าถึงถูกเรียกใช้โดยผู้ใช้ไม่ใช่ Crawler เว็บอัตโนมัติ ดังนั้นกฎ robots.txt อาจไม่สามารถใช้ได้
OpenAIOAI-AdsBotตรวจสอบหน้าเว็บที่ส่งเป็นปลายทางโฆษณาของ ChatGPTเกี่ยวข้องกับผู้ลงโฆษณาเป็นหลัก เนื้อหาที่รวบรวมไม่ได้ใช้ในการฝึกอบรมโมเดลพื้นฐานปัญญาประดิษฐ์เชิงสร้างสรรค์
GoogleGooglebotCrawler หลักของ Google Searchควบคุมการคลานของ Google Search ทั่วไป
GoogleGooglebot-Image, Googlebot-Video, Googlebot-Newsรูปภาพ วิดีโอ และ Google Newsสิ่งเหล่านี้มีโทเค็น robots.txt แยกกันและสามารถควบคุมได้อย่างอิสระ
GoogleGoogleOtherการคลานของ Google ทั่วไปสำหรับทีมผลิตภัณฑ์ต่างๆ รวมถึงการวิจัยและพัฒนาไม่ได้เป็นตัวแทนของผลิตภัณฑ์ Google ที่เฉพาะเจาะจง
GoogleGoogle-Extendedควบคุมว่าเนื้อหาที่ Google คลานมานั้นสามารถใช้สำหรับการฝึกอบรมโมเดล Gemini และระบบการสร้างข้อมูลบางอย่างหรือไม่เป็นโทเค็นควบคุม robots.txt ไม่ใช่ User-agent ที่ขอแยกต่างหาก ไม่ส่งผลต่อการรวมในการค้นหาของ Google ทั่วไป
AnthropicClaudeBotรวบรวมเนื้อหาเว็บสาธารณะที่อาจนำไปสู่การพัฒนาโมเดล Claudeไม่อนุญาตเพื่อส่งสัญญาณว่าเนื้อหาในอนาคตควรถูกยกเว้นจากชุดข้อมูลการฝึกอบรมของ Anthropic
AnthropicClaude-SearchBotปรับปรุงคุณภาพผลการค้นหาของ Claudeอนุญาตสำหรับการมองเห็นในการค้นหาของ Claude
AnthropicClaude-Userดึงหน้าเว็บเพื่อตอบสนองต่อคำขอของผู้ใช้ไปยัง Claudeแยกจากการคลานอัตโนมัติ
PerplexityPerplexityBotจัดทำดัชนีหน้าเว็บสำหรับผลการค้นหาของ PerplexityPerplexity กล่าวว่า Crawler นี้ไม่ได้ใช้เพื่อรวบรวมเนื้อหาสำหรับการฝึกอบรมโมเดลพื้นฐานปัญญาประดิษฐ์
PerplexityPerplexity-Userดึงหน้าเว็บหลังจากผู้ใช้ร้องขอเอกสารประกอบของ Perplexity ระบุว่า Fetcher นี้โดยทั่วไปจะละเลย robots.txt เนื่องจากคำขอเริ่มต้นโดยผู้ใช้
AppleApplebotรองรับ Apple Search, Spotlight, Siri, Safari และประสบการณ์ Apple อื่นๆอนุญาตสำหรับการค้นพบของ Apple
AppleApplebot-Extendedควบคุมว่าเนื้อหาที่ Applebot คลานมานั้นสามารถใช้ในการฝึกอบรมโมเดลพื้นฐานของ Apple ได้หรือไม่ไม่ได้คลานหน้าเว็บด้วยตัวเอง เป็นการควบคุมการใช้ข้อมูล
Common CrawlCCBotรวบรวมข้อมูลเว็บสาธารณะสำหรับคลังข้อมูลเว็บแบบเปิดของ Common Crawlไม่ใช่ผู้ช่วย แต่ชุดข้อมูลของมันสามารถใช้โดยนักวิจัยและนักพัฒนาปัญญาประดิษฐ์
MicrosoftBingbotCrawler หลักของการค้นหา Bingอนุญาตสำหรับการค้นพบและการมองเห็นในการค้นหาของ Bing
MicrosoftMicrosoftPreview, BingVideoPreviewตัวอย่างหน้าเว็บและวิดีโอสำหรับผลิตภัณฑ์ Microsoftสิ่งเหล่านี้สามารถควบคุมแยกจาก Bingbot ได้
AmazonAmzn-SearchBotการค้นหาและการค้นพบเนื้อหาของ AmazonAmazon กล่าวว่าไม่ได้คลานเนื้อหาสำหรับการฝึกอบรมโมเดลปัญญาประดิษฐ์เชิงสร้างสรรค์
AmazonAmzn-Userดึงข้อมูลปัจจุบันเพื่อตอบสนองต่อการกระทำของผู้ใช้ รวมถึงคำขอจาก Alexaถูกเรียกใช้โดยผู้ใช้และแยกจากการคลานค้นหาอัตโนมัติ

OpenAI จัดทำเอกสาร Crawler สำหรับการค้นหา การฝึกอบรม การโฆษณา และที่เรียกใช้โดยผู้ใช้เป็นตัวควบคุมที่แยกต่างหาก เอกสารประกอบของ OpenAI แนะนำโดยเฉพาะให้ OAI-SearchBot สำหรับการค้นหาของ ChatGPT ในขณะที่ใช้ GPTBot แยกกันสำหรับการตั้งค่าการฝึกอบรม (developers.openai.com)

Google ก็แยก Googlebot, GoogleOther และ Google-Extended เช่นกัน Google-Extended ไม่มี User-agent สำหรับคำขอ HTTP ของตัวเอง และการบล็อกมันก็ไม่ได้ทำให้หน้าเว็บหายไปจากการค้นหาของ Google (developers.google.com)

Anthropic จัดทำเอกสารบทบาทที่แยกจากกันสำหรับ ClaudeBot, Claude-SearchBot และ Claude-User นอกจากนี้ Anthropic ยังระบุว่าบอตของตนปฏิบัติตาม robots.txt และรองรับคำสั่ง Crawl-delay ที่ไม่ได้เป็นมาตรฐาน (support.anthropic.com)

Perplexity แยกความแตกต่างระหว่างการคลานค้นหาอัตโนมัติและการดึงข้อมูลตามคำขอของผู้ใช้ เอกสารประกอบปัจจุบันระบุว่า PerplexityBot เคารพ robots.txt ในขณะที่ Perplexity-User โดยทั่วไปจะไม่ทำเช่นนั้นเนื่องจากเป็นการตอบสนองต่อคำขอของผู้ใช้ (docs.perplexity.ai)

เอกสารประกอบปัจจุบันของ Apple มีความแตกต่างระหว่างการค้นหาและการฝึกอบรมเช่นเดียวกัน: Applebot รองรับการค้นพบ ในขณะที่ Applebot-Extended ช่วยให้ผู้เผยแพร่สามารถควบคุมการใช้งานสำหรับการฝึกอบรมได้โดยไม่ต้องลบหน้าเว็บออกจากการค้นหาของ Apple (support.apple.com)

การกำหนดค่า robots.txt ที่แนะนำ

วาง robots.txt ไว้ที่รากของแต่ละโฮสต์ เช่น:

text https://www.example.org/robots.txt

กฎจะใช้กับโฮสต์ โปรโตคอล และพอร์ตเฉพาะที่ไฟล์ถูกให้บริการ โดเมนย่อยแยกต่างหากอาจต้องมีไฟล์ของตัวเอง (developers.google.com)

การกำหนดค่า 1: การรวมสูงสุด

ใช้สิ่งนี้เมื่อเนื้อหาบรรณาธิการสาธารณะอาจถูกค้นพบ สรุป อ้างอิง จัดทำดัชนี และรวบรวมโดย Crawler ที่ปฏิบัติตามกฎ

text

หน้าสาธารณะสามารถเข้าถึงได้โดย Crawler ที่ปฏิบัติตามกฎ

User-agent: * Allow: /

ป้องกันเส้นทางส่วนตัว ธุรกรรม และการบริหารจัดการ

Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

สิ่งนี้อนุญาตให้ Crawler ที่ระบุชื่อ เช่น OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft และ Amazon เข้าถึงได้ เว้นแต่จะมีกฎเฉพาะอื่นบล็อกไว้

อย่าตั้งกฎครอบคลุม เช่น User-agent: * Disallow: / ไว้ใต้การกำหนดค่านี้ กลุ่มที่อยู่ด้านล่างหรือเฉพาะเจาะจงกว่าอาจเปลี่ยนวิธีการที่ Crawler ตีความไฟล์

การกำหนดค่า 2: อนุญาตการค้นหาแต่บล็อก Crawler สำหรับการพัฒนาโมเดล

นี่เป็นทางออกที่เหมาะสมที่สุดสำหรับผู้เผยแพร่ที่ต้องการการอ้างอิงและการเข้าชมจากการค้นหา แต่ไม่ต้องการส่งสัญญาณการอนุญาตสำหรับการรวบรวมเพื่อพัฒนาโมเดล

text

บล็อกการคลานเพื่อพัฒนาโมเดลของ OpenAI

User-agent: GPTBot Disallow: /

บล็อกการคลานเพื่อพัฒนาโมเดลของ Anthropic

User-agent: ClaudeBot Disallow: /

บล็อกการฝึกอบรมโมเดลของ Google และการใช้งานที่เกี่ยวข้อง

User-agent: Google-Extended Disallow: /

บล็อกการใช้งานเพื่อฝึกอบรมโมเดลพื้นฐานของ Apple

User-agent: Applebot-Extended Disallow: /

ไม่บังคับ: บล็อกการรวบรวมชุดข้อมูลของ Common Crawl

User-agent: CCBot

Disallow: /

อนุญาตการคลานเพื่อค้นหาและดึงข้อมูลทั่วไป ยกเว้นเส้นทางที่ละเอียดอ่อน

User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/

Sitemap: https://www.example.org/sitemap.xml

การกำหนดค่านี้ทำให้ OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot และ Applebot อยู่ภายใต้กลุ่ม wildcard นอกจากนี้ยังแยกสิทธิ์การค้นหาและการฝึกอบรมออกจากกัน

สำหรับ Apple การบล็อก Applebot-Extended ในขณะที่อนุญาต Applebot จะช่วยรักษาระบบการค้นพบผ่านบริการของ Apple สำหรับ Google การบล็อก Google-Extended ไม่ได้บล็อกการค้นหาของ Google ทั่วไป (developers.google.com)

การกำหนดค่า 3: อนุญาต Crawler การค้นหาที่เลือกไว้อย่างชัดเจน

หากไฟล์ robots.txt ที่มีอยู่บล็อก Crawler ทั้งหมด ให้เพิ่มกลุ่มแยกสำหรับ Crawler การค้นหาที่คุณต้องการต้อนรับ

text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/

บล็อก Crawler อื่นๆ ทั้งหมด

User-agent: * Disallow: /

เมื่อใช้กลุ่มเฉพาะ ให้ทำซ้ำกฎเส้นทางที่ละเอียดอ่อนภายในแต่ละกลุ่ม Crawler บางตัวใช้กลุ่มที่ตรงกันที่สุดแทนที่จะรวมกับกลุ่ม wildcard Bing ได้จัดทำเอกสารพฤติกรรมนี้โดยตรง และ Google ให้คำแนะนำแยกต่างหากเกี่ยวกับกลุ่มที่เฉพาะเจาะจงกับ Crawler (bing.com)

ข้อจำกัดสำคัญของ robots.txt

  • Crawler อาจไม่สนใจ robots.txt
  • Crawler ที่ไม่หวังดีสามารถแกล้งทำเป็น Crawler ที่เชื่อถือได้
  • หน้าที่ถูกบล็อกยังคงสามารถรู้จักได้จากชื่อเรื่องหรือที่อยู่เว็บ
  • Robots.txt ไม่ได้ปกป้องรหัสผ่าน ไฟล์ส่วนตัว บันทึกข้อมูลลูกค้า หรือ Application Programming Interface (API) ที่เป็นความลับ
  • คำสั่ง Crawl-delay ไม่ใช่ส่วนหนึ่งของโปรโตคอลการยกเว้นหุ่นยนต์หลักและไม่ได้รับการสนับสนุนจาก Crawler ทุกตัว Anthropic และ Bing ได้จัดทำเอกสารการสนับสนุน ในขณะที่ Apple ระบุว่า Applebot ไม่ปฏิบัติตาม crawl-delay (rfc-editor.org)

Meta Tags และ HTTP Headers

ตัวอย่างหน้าสาธารณะ

สำหรับบทความสาธารณะ ให้ใช้ชื่อเรื่องที่ชัดเจน ผู้เขียน ที่อยู่เว็บ Canonical วันที่เผยแพร่ และวันที่แก้ไข

html

คำสั่ง max-snippet มีการจัดทำเอกสารหลักสำหรับ Google อย่าคิดว่า Crawler ปัญญาประดิษฐ์ทุกตัวรองรับคำสั่ง meta ทุกคำสั่ง

ตัวอย่างหน้าส่วนตัวหรือหน้าที่มีข้อมูลละเอียดอ่อน

html

ใช้สิ่งนี้สำหรับหน้าเว็บที่ไม่ควรปรากฏในผลการค้นหา หน้าเว็บจะต้องยังคงสามารถคลานได้นานพอที่ Crawler จะเห็นคำสั่งนั้น หากหน้าเว็บจะต้องเป็นส่วนตัวอย่างแท้จริง ให้ใช้การยืนยันตัวตนหรือการป้องกันด้วยรหัสผ่านแทน (developers.google.com)

ซ่อนเฉพาะส่วนที่ละเอียดอ่อนจาก Search Snippets

Google รองรับ data-nosnippet สำหรับส่วนเฉพาะของหน้า HTML:

html

ย่อหน้านี้อาจแสดงในผลการค้นหาได้

หมายเลขโทรศัพท์ส่วนบุคคล ที่อยู่ bolstered อีเมลส่วนตัว หรือบันทึกภายในจะอยู่ที่นี่

สิ่งนี้มีประโยชน์สำหรับรายละเอียดการติดต่อ บันทึกภายใน หรือข้อมูลที่ผู้ใช้สร้างขึ้น ไม่ใช่คำสั่งสากลสำหรับระบบปัญญาประดิษฐ์ทุกระบบ (developers.google.com)

ใช้ส่วนหัว X-Robots-Tag สำหรับไฟล์

Meta tags ไม่สามารถวางไว้ในไฟล์เอกสารแบบพกพา (PDF) รูปภาพ หรือไฟล์วิดีโอได้ ให้ใช้ส่วนหัวการตอบกลับ HTTP แทน:

text X-Robots-Tag: noindex, nosnippet

สำหรับหน้าเว็บที่ควรยังคงสามารถค้นหาได้ แต่ไม่ควรให้ข้อความสำหรับ Snippets หรือคำตอบของปัญญาประดิษฐ์ ให้ใช้:

text X-Robots-Tag: nosnippet

Google จัดทำเอกสาร X-Robots-Tag สำหรับทรัพยากรที่ไม่ใช่ HTML และ Apple ก็รองรับสำหรับ Applebot เช่นกัน (developers.google.com)

การควบคุมเฉพาะของ Apple

Apple รองรับ:

html

Apple ระบุว่า nosnippet ป้องกันไม่ให้หน้าเว็บถูกใช้เป็นบริบทเพิ่มเติมและเนื้อหาปัจจุบันเมื่อโมเดลของ Apple สร้างผลลัพธ์ หน้าเว็บอาจยังคงถูกค้นพบได้ผ่าน Apple Search, Spotlight, Siri และ Safari (support.apple.com)

สำหรับหน้าที่มี Paywall, Apple ยังรองรับข้อมูลที่มีโครงสร้างโดยใช้:

{ "@context": "https://schema.org", "isAccessibleForFree": false }

Apple ระบุว่าหน้าเว็บดังกล่าวอาจยังคงมีสิทธิ์ปรากฏในผลการค้นหา แต่จะไม่ถูกใช้เป็นบริบทเพิ่มเติมสำหรับคำตอบของปัญญาประดิษฐ์ (support.apple.com)

วิธีการยืนยันที่อยู่ Internet Protocol ของ Crawler

ทำไมการจับคู่ User-agent จึงไม่เพียงพอ

กฎเช่นนี้มีความอ่อนแอ:

text if User-Agent contains "GPTBot": allow

ใครๆ ก็สามารถส่งข้อความนั้นได้ กฎที่ดีกว่าคือ:

text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block

อย่าเชื่อถือส่วนหัว X-Forwarded-For เว้นแต่จะมาจากพร็อกซีหรือเครือข่ายส่งข้อมูล (Content Delivery Network) ที่องค์กรของคุณควบคุม

วิธีการยืนยันของผู้ให้บริการ

ผู้ให้บริการวิธีการยืนยันที่แนะนำ
OpenAIใช้ฟีดที่อยู่ Internet Protocol สดที่เผยแพร่ในเอกสารประกอบ Crawler ของ OpenAI สำหรับ OAI-SearchBot, GPTBot และ OAI-AdsBot รีเฟรชโดยอัตโนมัติแทนที่จะคัดลอกช่วงคงที่ลงใน Firewall
Googleใช้ช่วง Crawler ที่ Google เผยแพร่ หรือทำการตรวจสอบระบบชื่อโดเมนแบบย้อนกลับและส่งต่อ Crawler ของ Google ที่แท้จริงควรแก้ไขเป็นชื่อโฮสต์ของ Google ที่ได้รับการอนุมัติ และแก้ไขกลับไปยังที่อยู่เดิมได้
Anthropicใช้ฟีดที่อยู่ Crawler ที่เผยแพร่ในปัจจุบันเป็นตัวตรวจสอบเครือข่ายรอง วิธีการยกเลิกหลักของ Anthropic ยังคงเป็น robots.txt
Perplexityรวม User-agent กับฟีดที่อยู่ PerplexityBot หรือ Perplexity-User ปัจจุบัน Perplexity แนะนำโดยเฉพาะให้รวมเงื่อนไขทั้งสองไว้ในกฎ Web Application Firewall
Appleใช้การยืนยันระบบชื่อโดเมนแบบย้อนกลับภายใต้ applebot.apple.com จากนั้นทำการค้นหาแบบส่งต่อ Apple ยังเผยแพร่ช่วงที่อยู่ปัจจุบันในฟีด JSON
Common Crawlใช้การยืนยันระบบชื่อโดเมนแบบย้อนกลับภายใต้ crawl.commoncrawl.org และฟีดที่อยู่ CCBot ปัจจุบัน Common Crawl ตั้งข้อสังเกตว่าการยืนยันแบบย้อนกลับยังไม่พร้อมใช้งานสำหรับทราฟฟิก IPv6 บางส่วน
Microsoftใช้เครื่องมือ Verify Bingbot อย่างเป็นทางการ หรือวิธีการค้นหาแบบย้อนกลับและส่งต่อที่ Microsoft จัดทำเอกสารไว้
Amazonใช้รายการที่อยู่ Crawler ที่ Amazon เผยแพร่และจับคู่กับ User-agent ของ Amazon ที่เหมาะสม

Google, Apple, Common Crawl, OpenAI, Anthropic และ Perplexity ล้วนเผยแพร่วิธีการเฉพาะของผู้ให้บริการหรือฟีดที่อยู่ รายการเหล่านี้สามารถเปลี่ยนแปลงได้ ดังนั้นกระบวนการอัปเดตตามกำหนดเวลาจึงปลอดภัยกว่ารายการที่คัดลอกด้วยตนเองแบบถาวร (developers.google.com)

การออกแบบ Firewall อย่างง่ายอาจมีลักษณะดังนี้:

text อนุญาต OAI-SearchBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วงการค้นหาปัจจุบันของ OpenAI อนุญาต GPTBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วงการฝึกอบรมปัจจุบันของ OpenAI อนุญาต PerplexityBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วง PerplexityBot ปัจจุบัน อนุญาต Applebot เฉพาะเมื่อการยืนยัน DNS แบบย้อนกลับและส่งต่อสำเร็จ อนุญาต CCBot เฉพาะเมื่อ DNS แบบย้อนกลับและช่วง Common Crawl ปัจจุบันตรงกัน

จำกัดอัตราสำหรับ Crawler ที่ได้รับการยืนยันทั้งหมด บล็อกหรือท้าทายคำขอที่ไม่ได้รับการยืนยันที่อ้างว่าเป็น Crawler ที่เชื่อถือได้

อย่าใช้กฎอนุญาตแบบกว้างๆ กับผู้ให้บริการคลาวด์ทั้งหมด Crawler ที่ถูกต้องตามกฎหมายอาจใช้โครงสร้างพื้นฐานของคลาวด์ได้ แต่ทราฟฟิกส่วนใหญ่จากผู้ให้บริการคลาวด์นั้นไม่จำเป็นต้องเป็น Crawler

ใบอนุญาตแบบเปิดมีอิทธิพลต่อการรวมเข้าอย่างไร

CC BY 4.0 ในภาษาที่เข้าใจง่าย

ใบอนุญาต Creative Commons Attribution 4.0 International ซึ่งเรียกกันทั่วไปว่า CC BY 4.0 อนุญาตให้ผู้คนสามารถ:

  • คัดลอกและเผยแพร่ผลงานซ้ำ
  • ดัดแปลง แปล ผสมผสาน และต่อยอด
  • ใช้ในเชิงพาณิชย์

เงื่อนไขหลักคือ:

  • ให้เครดิตอย่างเหมาะสม
  • ลิงก์ไปยังใบอนุญาต
  • ระบุว่ามีการเปลี่ยนแปลงหรือไม่
  • อย่าชี้นำว่าผู้สร้างดั้งเดิมรับรองการนำไปใช้ซ้ำ
  • อย่าเพิ่มข้อจำกัดทางกฎหมายหรือทางเทคนิคที่ขัดขวางการใช้งานที่ได้รับอนุญาตตามใบอนุญาต

Creative Commons ยังเตือนด้วยว่าใบอนุญาตอาจไม่ครอบคลุมสิทธิ์ความเป็นส่วนตัว สิทธิ์ในการเผยแพร่ สิทธิ์ทางศีลธรรม สิทธิ์ในเครื่องหมายการค้า สิทธิ์ในสิทธิบัตร หรือเนื้อหาของบุคคลที่สาม (creativecommons.org)

ใบอนุญาตไม่ใช่การเชิญ Crawler ด้วยตัวมันเอง

การระบุ “CC BY 4.0” บนหน้าเว็บไม่ได้เป็นการรับประกันว่าองค์กรจะคลานหน้านั้น Crawler อาจยังคงถูกบล็อกได้โดย:

  • robots.txt
  • เครือข่ายส่งข้อมูล (Content Delivery Network)
  • Web Application Firewall
  • การจำกัดอัตรา
  • การท้าทายด้วย JavaScript
  • กำแพงการเข้าสู่ระบบ
  • การตอบสนองของเซิร์ฟเวอร์ที่ไม่ดี
  • Sitemap ที่เข้าถึงไม่ได้

ในทางกลับกัน การอนุญาตให้ Crawler เข้าถึงไม่ได้เป็นการให้สิทธิ์ลิขสิทธิ์ทุกประเภทที่จำเป็นสำหรับการใช้งานในภายหลังโดยอัตโนมัติ Robots.txt และการออกใบอนุญาตควรได้รับการออกแบบร่วมกัน

ทำไม CC BY จึงสนับสนุนการรวมที่กว้างขึ้นได้

ใบอนุญาตแบบเปิดที่ชัดเจนสามารถทำให้ทีมนักพัฒนาข้อมูล ระบบค้นหา และผู้ดูแลระบบผู้ช่วยเข้าใจนโยบายของผู้เผยแพร่ได้ง่ายขึ้น สามารถลดความไม่แน่นอนเกี่ยวกับการคัดลอก การดัดแปลง การใช้งานเชิงพาณิชย์ การแปล และการเผยแพร่ซ้ำ เมื่อกิจกรรมเหล่านั้นต้องการการอนุญาตลิขสิทธิ์

อย่างไรก็ตาม Creative Commons อธิบายว่าการฝึกอบรมปัญญาประดิษฐ์นั้นมีความซับซ้อนทางกฎหมาย ใบอนุญาตแบบจำกัดไม่ใช่วิธีที่มีประสิทธิภาพเสมอไปในการป้องกันการฝึกอบรม เนื่องจากบางการใช้งานสำหรับการฝึกอบรมอาจได้รับอนุญาตโดยข้อยกเว้นหรือข้อจำกัดด้านลิขสิทธิ์ Creative Commons ยังตั้งข้อสังเกตว่าเงื่อนไขใบอนุญาตอาจนำไปใช้กับการฝึกอบรมเครื่องจักรและผลลัพธ์ของโมเดลได้ยาก (creativecommons.org)

บทเรียนที่นำไปใช้ได้จริงคือ:

ใช้ CC BY เมื่อคุณต้องการการนำไปใช้ซ้ำอย่างถูกกฎหมายในวงกว้างอย่างแท้จริง อย่าใช้ใบอนุญาต Creative Commons แบบจำกัดเพื่อรับประกันการยกเลิกการฝึกอบรมปัญญาประดิษฐ์

การให้เครดิตช่วยปรับปรุงความชัดเจนของแหล่งที่มา

Creative Commons แนะนำวิธี TASL:

  • ชื่อเรื่อง
  • ผู้เขียน
  • แหล่งที่มา
  • ใบอนุญาต

ตัวอย่างเช่น:

“การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด” โดย Example Publishing, https://www.example.org/articles/ai-crawlers, ได้รับอนุญาตภายใต้ Creative Commons Attribution 4.0 International การเปลี่ยนแปลงที่ทำ: อัปเดตรายการ Crawler

การให้เครดิตที่ชัดเจนไม่ได้บังคับให้ผู้ช่วยทุกรายอ้างอิงหน้าเว็บ แต่ทำให้การอ้างอิงที่ถูกต้องง่ายขึ้นเมื่อระบบดึงชื่อเรื่อง ผู้เขียน แหล่งที่มา และข้อมูลใบอนุญาตของหน้าเว็บ (wiki.creativecommons.org)

เพิ่มข้อมูลบทความที่มีโครงสร้าง

ใช้ข้อมูลที่มองเห็นได้และข้อมูลที่มีโครงสร้างร่วมกัน:

Google แนะนำให้ใช้ข้อมูลผู้เขียนที่ชัดเจน หน้าผู้เขียน วันที่เผยแพร่ วันที่แก้ไข และหน้า Canonical ที่เสถียร สัญญาณเหล่านี้สามารถช่วยให้ระบบค้นหาเข้าใจว่าใครเป็นผู้สร้างเนื้อหาและเวอร์ชันใดเป็นเวอร์ชันที่เชื่อถือได้ สิ่งเหล่านี้ไม่รับประกันการจัดอันดับ การรวมเข้า หรือการอ้างอิง (developers.google.com)

ข้อความกฎหมายมาตรฐานสำหรับเว็บไซต์ที่เปิดกว้างและเป็นมิตรกับการอ้างอิง

ต่อไปนี้เป็นภาษาตัวอย่าง ไม่ใช่คำแนะนำทางกฎหมาย ควรให้ที่ปรึกษากฎหมายปรับให้เข้ากับเขตอำนาจศาล โครงสร้างการเป็นเจ้าของ ภาระผูกพันด้านความเป็นส่วนตัว และเนื้อหาของบุคคลที่สาม

คำแถลงใบอนุญาต CC BY 4.0

text

ใบอนุญาตเนื้อหา

เว้นแต่จะระบุไว้เป็นอย่างอื่น ข้อความต้นฉบับและเนื้อหาบรรณาธิการต้นฉบับบนหน้านี้ได้รับอนุญาตภายใต้ใบอนุญาต Creative Commons Attribution 4.0 International:

https://creativecommons.org/licenses/by/4.0/

การอนุญาตนี้อนุญาตให้คัดลอก เผยแพร่ซ้ำ ดัดแปลง แปล ใช้งานเชิงพาณิชย์ ประมวลผลด้วยเครื่องจักร จัดทำดัชนีการค้นหา ดึงข้อมูล สรุป และใช้งานในระบบปัญญาประดิษฐ์ โดยมีเงื่อนไขว่าต้องปฏิบัติตามเงื่อนไขของใบอนุญาต

การให้เครดิตที่แนะนำ:

“[ชื่อหน้า],” โดย [ผู้เขียนหรือองค์กร], [ที่อยู่หน้า Canonical], เผยแพร่หรืออัปเดต [วันที่], ได้รับอนุญาตภายใต้ Creative Commons Attribution 4.0 International การเปลี่ยนแปลงที่ทำ: [อธิบายการเปลี่ยนแปลง หรือระบุ ‘ไม่มี’]

โปรดเก็บรักษาข้อมูลผู้เขียน ผู้เผยแพร่ แหล่งที่มา ใบอนุญาต และการแก้ไขไว้เสมอเมื่อทำได้โดยสมเหตุสมผล คู่มือการให้เครดิตที่แนะนำนี้ไม่ได้เพิ่มข้อจำกัดให้กับใบอนุญาต Creative Commons และไม่ได้แทนที่ข้อความใบอนุญาต

วลี “รวมถึงระบบปัญญาประดิษฐ์” ชี้แจงเจตนาของผู้เผยแพร่ ไม่ควรนำมาใช้เพื่อแกล้งอ้างว่าผู้เผยแพร่เป็นเจ้าของสิทธิ์ในเนื้อหาที่สร้างโดยบุคคลอื่น

ประกาศสิทธิ์ในแบรนด์ ความเป็นส่วนตัว และของบุคคลที่สาม

text

สิทธิ์ในแบรนด์ ความเป็นส่วนตัว และของบุคคลที่สาม

ใบอนุญาตข้างต้นครอบคลุมเฉพาะเนื้อหาต้นฉบับที่ระบุว่าเป็นใบอนุญาตเท่านั้น ไม่ได้ให้สิทธิ์ในการใช้:

  • เครื่องหมายการค้า เครื่องหมายบริการ โลโก้ หรือชุดรูปแบบสินค้า
  • ชื่อ รูปภาพ หรือรูปเหมือนของบุคคล
  • ข้อมูลส่วนตัว ข้อมูลที่เป็นความลับ บัญชี สุขภาพ การเงิน หรือความปลอดภัย
  • เนื้อหาที่ผู้ใช้ส่งเข้ามา เว้นแต่จะระบุแยกต่างหากว่าเป็นใบอนุญาต
  • ภาพถ่าย ภาพประกอบ แผนที่ วิดีโอ เพลง คำอ้างอิง หรือเนื้อหาของบุคคลที่สามอื่นๆ
  • เนื้อหาที่ระบุว่าเป็น “สงวนลิขสิทธิ์” หรืออยู่ภายใต้ใบอนุญาตแยกต่างหาก

การใช้ชื่อ โลโก้ และเครื่องหมายของ Example Publishing จะต้องไม่สื่อถึงการสนับสนุน การอนุมัติ การเป็นพันธมิตร หรือการรับรอง โปรดลิงก์ไปยังหน้าต้นฉบับและแยกความแตกต่างระหว่างการอ้างอิง การถอดความ การสรุป และเนื้อหาที่สร้างขึ้นอย่างชัดเจน

ภาษานี้มีความสำคัญเนื่องจากใบอนุญาต Creative Commons ไม่ได้ให้สิทธิ์ทางกฎหมายทุกประเภทที่เชื่อมโยงกับหน้าเว็บโดยอัตโนมัติ (creativecommons.org)

คำแนะนำสำหรับการอ้างอิงการค้นหาและผู้ช่วย

text

คำแนะนำสำหรับการอ้างอิงการค้นหาและผู้ช่วย

เรายินดีต้อนรับการจัดทำดัชนีการค้นหา การดึงข้อมูลตามคำขอของผู้ใช้ การอ้างอิง และการสรุปเนื้อหาที่ได้รับอนุญาตบนเว็บไซต์นี้

เมื่ออ้างอิงเว็บไซต์นี้ โปรดใช้ชื่อหน้า ผู้เขียนหรือผู้เผยแพร่ ที่อยู่หน้า Canonical วันที่เผยแพร่หรืออัปเดต และลิงก์โดยตรงไปยังแหล่งที่มา โปรดระบุแหล่งที่มาว่าเป็นหนึ่งในข้อมูลนำเข้าจากแหล่งข้อมูลที่ใช้ แยกแยะการวิเคราะห์ที่สร้างขึ้นจากเนื้อหาที่ยกมา และอย่าระบุหรือสื่อว่า Example Publishing รับรองคำตอบที่สร้างขึ้น ผลิตภัณฑ์ บุคคล หรือบริการใดๆ

คำแนะนำนี้มีวัตถุประสงค์เพื่อปรับปรุงความถูกต้องและการให้เครดิต ไม่ได้ให้สิทธิ์เกินกว่าใบอนุญาตเนื้อหาที่เกี่ยวข้อง และไม่ได้อนุญาตเครื่องหมายการค้า ข้อมูลส่วนบุคคล ข้อมูลที่เป็นความลับ หรือเนื้อหาของบุคคลที่สาม

หากคุณต้องการการมองเห็นในการค้นหาแต่ไม่ต้องการให้ใบอนุญาตสำหรับการฝึกอบรมแบบกว้างๆ

text

การเข้าถึงการค้นหาและลิขสิทธิ์

หน้าสาธารณะของเราสามารถเข้าถึงได้โดย Crawler สำหรับการค้นหาและดึงข้อมูลที่ปฏิบัติตามกฎ ซึ่งระบุไว้ในไฟล์ robots.txt ของเรา การอนุญาตนี้มีวัตถุประสงค์เพื่อสนับสนุนการค้นพบ ผลการค้นหา การดึงข้อมูลตามคำขอของผู้ใช้ และการอ้างอิง

เว้นแต่จะมีการแสดงใบอนุญาตแยกต่างหาก เนื้อหาต้นฉบับทั้งหมดสงวนลิขสิทธิ์ การเข้าถึงหน้าสาธารณะไม่ได้ให้ใบอนุญาตแยกต่างหากสำหรับการพัฒนาโมเดล การฝึกอบรม การเผยแพร่ซ้ำ การนำกลับมาใช้ใหม่เชิงพาณิชย์ หรือการสร้างงานดัดแปลงที่เกินกว่าสิทธิ์ที่กฎหมายที่เกี่ยวข้องกำหนดไว้

โปรดอ้างอิงที่อยู่หน้า Canonical และผู้เผยแพร่เมื่ออ้างถึงเนื้อหานี้ ไม่มีสิ่งใดในเว็บไซต์นี้ที่ให้สิทธิ์ในการใช้เครื่องหมายการค้า โลโก้ ข้อมูลส่วนบุคคล ข้อมูลที่เป็นความลับ หรือเนื้อหาของบุคคลที่สาม

อย่าใช้คำแถลง CC BY และคำแถลงสงวนลิขสิทธิ์ทั้งหมดกับเนื้อหาเดียวกัน ระบุให้ชัดเจนว่าใบอนุญาตใดใช้กับเนื้อหาใด

เมทริกซ์ความเสี่ยง-ผลประโยชน์สำหรับการออกใบอนุญาตแบบเปิด

กฎหมายลิขสิทธิ์และกฎการฝึกอบรมปัญญาประดิษฐ์แตกต่างกันไปในแต่ละประเทศและยังคงไม่แน่นอน สำนักงานลิขสิทธิ์ของสหรัฐอเมริกายังคงตรวจสอบประเด็นเหล่านี้ ในขณะที่ Creative Commons อธิบายว่าการฝึกอบรมปัญญาประดิษฐ์นั้นขึ้นอยู่กับข้อเท็จจริงและมีความซับซ้อนทางกฎหมาย (copyright.gov)

แนวทางศักยภาพในการรวมเข้าประโยชน์หลักความเสี่ยงหลักความเหมาะสมที่สุด
CC BY 4.0สูงมากการคัดลอก ดัดแปลง ใช้งานเชิงพาณิชย์ แปล จัดทำดัชนี และนำไปใช้ซ้ำที่เกี่ยวข้องกับโมเดลในวงกว้างเมื่อจำเป็นต้องได้รับอนุญาตตามลิขสิทธิ์คู่แข่งเชิงพาณิชย์อาจนำเนื้อหาไปใช้ซ้ำหรือดัดแปลงได้ การให้เครดิตอาจไม่สมบูรณ์ ใบอนุญาตไม่สามารถควบคุมความเป็นส่วนตัว เครื่องหมายการค้า หรือสิทธิ์ของบุคคลที่สามได้ผู้เผยแพร่ที่ต้องการการนำไปใช้ซ้ำอย่างถูกกฎหมายในวงกว้างที่สุดและการให้เครดิตแหล่งที่มาที่แข็งแกร่ง
CC BY-SA 4.0สูง, แต่ซับซ้อนกว่าส่งเสริมวงจรการแบ่งปันแบบเปิดและกำหนดให้การดัดแปลงยังคงอยู่ภายใต้เงื่อนไขที่เข้ากันได้กฎ ShareAlike อาจนำไปใช้กับชุดข้อมูล การฝึกอบรมโมเดล และผลลัพธ์สาธารณะได้ยาก บางองค์กรอาจหลีกเลี่ยงเนื้อหาเนื่องจากความไม่แน่นอนโครงการเพื่อการศึกษาและสาธารณะที่ต้องการให้การดัดแปลงในลำน้ำยังคงเป็นแบบเปิด
CC BY-NC 4.0ปานกลางหรือต่ำจำกัดการใช้งานที่มุ่งเน้นผลประโยชน์เชิงพาณิชย์หรือค่าตอบแทนทางการเงินเป็นหลัก"ไม่ใช้ในเชิงพาณิชย์" อาจตีความได้ยาก อาจไม่รวมการค้นหา โมเดล และการใช้งานผู้ช่วยในเชิงพาณิชย์ ไม่ใช่การยกเลิกการฝึกอบรมที่รับประกันเนื้อหาที่มีวัตถุประสงค์เพื่อการไม่แสวงหาผลกำไร การศึกษา หรือการใช้งานในชุมชน
CC BY-ND 4.0ปานกลางอนุญาตการแบ่งปันในขณะที่จำกัดการดัดแปลงการแปล การแปลง และกรณีการใช้งานผู้ช่วยบางอย่างอาจกลายเป็นเรื่องไม่แน่นอนทางกฎหมาย มีความน่าสนใจน้อยลงสำหรับระบบที่สรุปหรือผสมผสานประกาศอย่างเป็นทางการหรืองานที่ไม่ต้องมีการเปลี่ยนแปลง
CC0 หรือการอุทิศให้เป็นสาธารณสมบัติสูงมากทำให้การนำไปใช้ซ้ำง่ายขึ้นและลบเงื่อนไขลิขสิทธิ์ส่วนใหญ่ออกเมื่อมีผลทางกฎหมายไม่ต้องมีการให้เครดิต การควบคุมการนำเสนอแบรนด์อ่อนแอ สิทธิ์ความเป็นส่วนตัว เครื่องหมายการค้า และการเผยแพร่ยังคงแยกจากกันข้อเท็จจริง ชุดข้อมูล เนื้อหาอ้างอิง หรืองานที่มีวัตถุประสงค์เพื่อการนำไปใช้ซ้ำโดยไม่มีข้อจำกัด
สงวนลิขสิทธิ์ทั้งหมดบวกการคลานค้นหาแบบเปิดสูงสำหรับการค้นหา, ต่ำสำหรับการฝึกอบรมสามารถรักษาการมองเห็นในการค้นหาและการอ้างอิงได้โดยไม่ต้องให้ใบอนุญาตการนำไปใช้ซ้ำแบบกว้างๆความไม่แน่นอนทางกฎหมายมากขึ้นสำหรับนักพัฒนาโมเดล อาจลดการรวมเข้าในชุดข้อมูลการฝึกอบรมและระบบการนำไปใช้ซ้ำเชิงพาณิชย์ผู้เผยแพร่ที่ต้องการการค้นพบและการอ้างอิง แต่ต้องการเจรจาใบอนุญาตที่กว้างขึ้นแยกต่างหาก

กลยุทธ์ที่สมดุลที่สุดสำหรับหลายองค์กรคือ:

  • CC BY 4.0 สำหรับข้อความบรรณาธิการสาธารณะที่เป็นต้นฉบับ
  • ป้ายกำกับแยกต่างหากสำหรับเนื้อหาของบุคคลที่สาม
  • ไม่มีข้อมูลส่วนบุคคลหรือข้อมูลที่เป็นความลับในที่สาธารณะ
  • อนุญาต Crawler สำหรับการค้นหาและดึงข้อมูล
  • อนุญาต Crawler สำหรับการพัฒนาโมเดลเฉพาะเมื่อองค์กรยอมรับการใช้งานนั้นอย่างแท้จริง
  • ใช้การให้เครดิตที่ชัดเจนและลิงก์ Canonical
  • ปกป้องเครื่องหมายการค้าผ่านประกาศแบรนด์แยกต่างหาก

รายการตรวจสอบการนำไปใช้งานจริง

เนื้อหาและการออกใบอนุญาต

  • ระบุว่าใครเป็นเจ้าของแต่ละหน้า รูปภาพ แผนภูมิ วิดีโอ และคำอ้างอิง
  • ออกใบอนุญาตเฉพาะเนื้อหาที่องค์กรของคุณควบคุมสิทธิ์
  • ทำเครื่องหมายเนื้อหาของบุคคลที่สามแยกต่างหาก
  • เพิ่มคำแถลงใบอนุญาตที่มองเห็นได้
  • ให้การอ้างอิงที่แนะนำโดยใช้ชื่อเรื่อง ผู้เขียน แหล่งที่มา และใบอนุญาต
  • เก็บโลโก้ เครื่องหมายการค้า ข้อมูลส่วนบุคคล และข้อมูลที่เป็นความลับไว้นอกขอบเขตของใบอนุญาต

Robots.txt

  • สร้างไฟล์ robots.txt สาธารณะที่รากของแต่ละโฮสต์
  • อนุญาต Crawler การค้นหาแยกจาก Crawler สำหรับการฝึกอบรม
  • บล็อกเส้นทางสำหรับการบริหารจัดการ บัญชี การชำระเงิน เส้นทางส่วนตัว และเส้นทางแอปพลิเคชันภายใน
  • อย่าพึ่งพา robots.txt เพื่อความปลอดภัย
  • ทดสอบไฟล์หลังจากทุกการปรับใช้เว็บไซต์ครั้งสำคัญ

Meta tags

  • ใช้ลิงก์ Canonical
  • เพิ่มผู้เขียน วันที่เผยแพร่ และวันที่แก้ไข
  • ใช้ noindex สำหรับหน้าเว็บที่ไม่ควรปรากฏในการค้นหา
  • ใช้ nosnippet หรือ data-nosnippet สำหรับส่วนที่ละเอียดอ่อนที่รองรับ
  • ใช้ X-Robots-Tag สำหรับไฟล์เอกสารแบบพกพา รูปภาพ และทรัพยากรที่ไม่ใช่ HTML อื่นๆ
  • โปรดจำไว้ว่า Crawler ต้องสามารถดึงข้อมูลหน้าเว็บได้ก่อนจึงจะสามารถอ่าน meta tags ของหน้าเว็บนั้นได้

ความปลอดภัยของเครือข่าย

  • บันทึกสตริง user-agent ที่อยู่ต้นทาง รหัสการตอบกลับ และเส้นทางคำขอ
  • ยืนยัน Crawler ที่เชื่อถือได้โดยใช้ฟีดที่อยู่อย่างเป็นทางการหรือวิธีการของระบบชื่อโดเมน
  • รีเฟรชฟีดที่อยู่โดยอัตโนมัติ
  • รวมการตรวจสอบ user-agent และที่อยู่ต้นทาง
  • จำกัดอัตรา Crawler ที่ได้รับการยืนยัน แทนที่จะให้สิทธิ์การเข้าถึงแบบไม่จำกัด
  • ท้าทายหรือบล็อกคำขอที่อ้างว่าเป็น Crawler ที่เชื่อถือได้แต่ไม่ผ่านการยืนยัน

การวัดผล

ติดตาม:

  • การเข้าชมจากบริการค้นหาปัญญาประดิษฐ์
  • การอ้างอิงไปยังหน้าต้นฉบับ
  • ความถี่ในการอ้างอิง
  • โหลดเซิร์ฟเวอร์โดย Crawler
  • คำขอที่คืนค่า 403, 404 หรือ 429
  • การเข้าถึงเส้นทางที่ไม่ตั้งใจของ Crawler
  • บทความปัจจุบันถูกค้นพบหลังจากเผยแพร่หรือไม่

บทสรุป

การรวมเข้าสูงสุดต้องอาศัย การเปิดกว้างแบบเลือกสรร ไม่ใช่การอนุญาตแบบครอบคลุมเพียงครั้งเดียว

ใช้ robots.txt เพื่อแยกการคลานสำหรับการค้นหา การดึงข้อมูลโดยผู้ใช้ การฝึกอบรม และชุดข้อมูลสาธารณะ ใช้ meta tags และ HTTP headers เพื่อจัดการการจัดทำดัชนีและ Snippets ใช้การยืนยันตัวตนสำหรับข้อมูลส่วนตัวใดๆ ยืนยันที่อยู่ Internet Protocol ของ Crawler แทนที่จะเชื่อเพียงชื่อ User-agent

ใบอนุญาตแบบเปิด เช่น CC BY 4.0 สามารถทำให้การนำไปใช้ซ้ำในวงกว้างง่ายขึ้นเมื่อคุณต้องการอย่างแท้จริง ข้อมูลการให้เครดิตที่ชัดเจน—ชื่อเรื่อง ผู้เขียน แหล่งที่มา ใบอนุญาต หน้า Canonical และวันที่อัปเดต—ยังสามารถทำให้ระบบค้นหาและผู้ช่วยระบุและอ้างอิงแหล่งที่มาที่ถูกต้องได้ง่ายขึ้น

ดังนั้น นโยบายการเผยแพร่ที่แข็งแกร่งที่สุดคือ:

**เปิดเผยเนื้อหาสาธารณะที่คุณต้องการให้ถูกค้นพบ ออกใบอนุญาตเนื้อหาที่คุณต้องการนำไปใช้ซ้ำอย่างชัดเจน ทำเครื่องหมายเนื้อหาที่คุณไม่ได้เป็นเจ้าของ ปกป้องข้อมูลส่วนตัวในระดับเซิร์ฟเวอร์ และให้สิทธิ์การอนุญาตที่แยกต่างหากและตรวจสอบได้แก่ Crawler ทุกตัว

บทความที่เกี่ยวข้อง

การสร้างศูนย์ข้อมูลนักวิจัย: ORCID, Crossref และโปรไฟล์นักวิชาการเป็นพื้นฐานของความน่าเชื่อถือ

การสร้างศูนย์ข้อมูลนักวิจัย: ORCID, Crossref และโปรไฟล์นักวิชาการเป็นพื้นฐานของความน่าเชื่อถือ

ใครเป็นผู้สร้างสรรค์ผลงานนี้? ผลงานนี้คืออะไรกันแน่? ทำไมถึงควรเชื่อถือความเชื่อมโยงระหว่างบุคคล ผลงาน และองค์กร?

อ่านบทความ
Core Web Vitals และ Latency: หน้าเว็บที่เร็วขึ้นจะได้รับการอ้างอิงจาก AI มากขึ้นหรือไม่?

Core Web Vitals และ Latency: หน้าเว็บที่เร็วขึ้นจะได้รับการอ้างอิงจาก AI มากขึ้นหรือไม่?

หน้าเว็บที่เร็วขึ้นอาจช่วยปรับปรุงการรวบรวมข้อมูลและความพร้อมใช้งานของเนื้อหาได้ แต่นั่นไม่ได้หมายความว่าความเร็วเพียงอย่างเดียวจะทำให้ระบบปัญญาประดิษ...

อ่านบทความ
เนื้อหา Q&A และ How-To ที่มีโครงสร้าง: สร้างคำตอบที่ AI ต้องการ

เนื้อหา Q&A และ How-To ที่มีโครงสร้าง: สร้างคำตอบที่ AI ต้องการ

การเพิ่มข้อมูลที่มีโครงสร้างประเภท QAPage หรือ HowTo จะทำให้หน้าเว็บมีแนวโน้มที่จะปรากฏในคำตอบที่สร้างโดย AI มากขึ้นหรือไม่...

อ่านบทความ
กลยุทธ์ใหม่เพื่อการได้รับ AI Citations จาก Google AI Overviews, Bing Copilot และ Perplexity

กลยุทธ์ใหม่เพื่อการได้รับ AI Citations จาก Google AI Overviews, Bing Copilot และ Perplexity

ปัจจุบัน Google มักจะแสดง AI Overview (คำตอบ AI เชิงสร้างสรรค์) ที่ด้านบนของผลการค้นหา ภาพรวมเหล่านี้ให้คำตอบที่กระชับ แล้วแสดงรายการ “แหล่งที่มา”...

อ่านบทความ

ชอบคอนเทนต์นี้ไหม?

สมัครรับจดหมายข่าวของเราเพื่อรับข้อมูลเชิงลึกด้านการตลาดคอนเทนต์และคู่มือการเติบโตล่าสุด

บทความนี้มีวัตถุประสงค์เพื่อให้ข้อมูลเท่านั้น เนื้อหาและกลยุทธ์อาจแตกต่างกันไปตามความต้องการเฉพาะของคุณ