การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด: วิธีการต้อนรับ AI Crawlers
อัปเดตเมื่อ 25 สิงหาคม 2569
เว็บไซต์ในปัจจุบันมีวิธีเข้าถึงผู้ชมได้มากกว่าหนึ่งทาง หน้าเว็บอาจถูกค้นพบผ่าน Google Search, สรุปโดย ChatGPT, อ้างอิงโดย Perplexity, ใช้ในการค้นหาของ Claude, แสดงผลผ่านบริการของ Apple, หรือถูกรวบรวมโดยคลังข้อมูลเว็บสาธารณะ
ระบบเหล่านี้ไม่ได้ใช้ Crawler เดียวกันทั้งหมดหรือปฏิบัติตามกฎเดียวกันทั้งหมด เว็บไซต์ที่บล็อก GPTBot อาจยังคงปรากฏในการค้นหาของ ChatGPT หากอนุญาต OAI-SearchBot เว็บไซต์ที่อนุญาต Applebot สามารถยังคงมองเห็นได้ในการค้นหาของ Apple ในขณะที่บล็อก Applebot-Extended จากการฝึกอบรมโมเดลปัญญาประดิษฐ์ Google-Extended ของ Google ไม่ใช่ Crawler ทั่วไปเลย แต่มันคือโทเค็นควบคุม robots.txt
ดังนั้น นโยบายที่ดีที่สุดจึงไม่ใช่แค่ “อนุญาตปัญญาประดิษฐ์” หรือ “บล็อกปัญญาประดิษฐ์” แต่เป็นการสร้างการอนุญาตแยกกันสำหรับ:
- การค้นหาและการค้นพบ
- การดึงข้อมูลตามคำขอของผู้ใช้
- การพัฒนาและการฝึกอบรมโมเดล
- ชุดข้อมูลสาธารณะ
- เนื้อหาที่ละเอียดอ่อน เป็นส่วนตัว หรือถูกจำกัด
บทความนี้จะนำเสนอรายการ Crawler ในปัจจุบัน ตัวอย่าง robots.txt คำแนะนำเกี่ยวกับ meta tag วิธีการยืนยันที่อยู่ Internet Protocol คำแนะนำเกี่ยวกับการออกใบอนุญาต Creative Commons ข้อความกฎหมายมาตรฐาน และเมทริกซ์ความเสี่ยง-ผลประโยชน์
สี่การควบคุมที่ผู้เผยแพร่ทุกรายควรเข้าใจ
1. robots.txt ควบคุมการคลานที่ร้องขอ
ไฟล์ robots.txt บอกไคลเอนต์อัตโนมัติที่ปฏิบัติตามกฎว่าพวกเขาสามารถร้องขอหน้าใดได้บ้าง มีประโยชน์สำหรับการจัดการปริมาณการเข้าชมของ Crawler และการแสดงความต้องการของผู้เผยแพร่
อย่างไรก็ตาม robots.txt ไม่ใช่ระบบควบคุมการเข้าถึง โปรโตคอลการยกเว้นหุ่นยนต์ระบุว่ากฎของมันไม่ใช่การอนุญาตการเข้าถึง Google ยังเตือนอีกว่าที่อยู่ที่ถูกบล็อกยังคงปรากฏในผลการค้นหาได้หากหน้าอื่น ๆ ลิงก์มายังที่อยู่นั้น ใช้รหัสผ่าน การยืนยันตัวตน หรือการควบคุมการเข้าถึงฝั่งเซิร์ฟเวอร์สำหรับข้อมูลที่เป็นความลับ (rfc-editor.org)
2. Meta tags ควบคุมการจัดทำดัชนีและ Snippets
Robots meta tags และส่วนหัวการตอบกลับ X-Robots-Tag สามารถควบคุมได้ว่าหน้าเว็บจะถูกจัดทำดัชนีหรือไม่ หรือเครื่องมือค้นหาจะแสดง Snippet ได้หรือไม่
การควบคุมเหล่านี้มักจะมองเห็นได้หลังจากที่ Crawler ได้รับอนุญาตให้ดึงข้อมูลหน้าเว็บแล้วเท่านั้น หาก robots.txt บล็อกหน้าเว็บก่อน Crawler อาจไม่เห็น meta tag นั้นเลย (developers.google.com)
3. การควบคุมเครือข่ายยืนยัน Crawler
ชื่อ User-agent นั้นง่ายต่อการคัดลอก ผู้โจมตีสามารถส่งคำขออ้างว่าเป็น GPTBot, Googlebot หรือ PerplexityBot
วิธีการที่แข็งแกร่งกว่าคือการรวมสิ่งเหล่านี้เข้าด้วยกัน:
- User-agent ที่อ้างสิทธิ์
- ช่วงที่อยู่ Internet Protocol ที่เผยแพร่
- การยืนยันระบบชื่อโดเมนแบบย้อนกลับ (Reverse Domain Name System)
- การยืนยันระบบชื่อโดเมนแบบส่งต่อ (Forward Domain Name System)
- การจำกัดอัตราและการตรวจสอบคำขอ
4. ใบอนุญาตให้สิทธิ์การนำไปใช้ซ้ำ
Robots.txt บอกสิ่งที่ Crawler ถูกขอให้ทำ ใบอนุญาตบอกสิ่งที่บุคคลหรือองค์กรสามารถทำกับเนื้อหาได้อย่างถูกกฎหมายเมื่อจำเป็นต้องได้รับอนุญาตตามลิขสิทธิ์
สิ่งเหล่านี้เป็นเครื่องมือที่แตกต่างกัน ใบอนุญาตแบบอนุญาตสามารถลดความไม่แน่นอนทางกฎหมายได้ แต่ไม่รับประกันว่า Crawler จะเยี่ยมชมหน้าเว็บนั้น โมเดลจะใช้มัน หรือผู้ช่วยจะอ้างอิงมัน
รายการ Crawler ที่สำคัญ
รายการต่อไปนี้ได้รับการตรวจสอบกับเอกสารประกอบของผู้ให้บริการที่มีอยู่เมื่อวันที่ 25 สิงหาคม 2569 ชื่อ User-agent, วัตถุประสงค์ และช่วงที่อยู่ Internet Protocol สามารถเปลี่ยนแปลงได้ ดังนั้นระบบการผลิตควรใช้เอกสารประกอบปัจจุบันและฟีดที่อยู่สดของผู้ให้บริการ
| ผู้ให้บริการ | Crawler หรือโทเค็น robots.txt | วัตถุประสงค์หลัก | การควบคุมที่สำคัญ |
|---|---|---|---|
| OpenAI | OAI-SearchBot | ค้นหาและวิเคราะห์หน้าเว็บสำหรับการค้นหาของ ChatGPT | อนุญาตเพื่อเพิ่มโอกาสที่หน้าเว็บจะปรากฏในผลการค้นหาของ ChatGPT |
| OpenAI | GPTBot | รวบรวมหน้าเว็บที่อาจใช้สำหรับการฝึกอบรมโมเดลปัญญาประดิษฐ์เชิงสร้างสรรค์ของ OpenAI | อนุญาตหรือไม่อนุญาตแยกจากการค้นหา |
| OpenAI | ChatGPT-User | ดึงหน้าเว็บหลังจากผู้ใช้ขอให้ ChatGPT หรือ Custom GPT เข้าถึง | ถูกเรียกใช้โดยผู้ใช้ไม่ใช่ Crawler เว็บอัตโนมัติ ดังนั้นกฎ robots.txt อาจไม่สามารถใช้ได้ |
| OpenAI | OAI-AdsBot | ตรวจสอบหน้าเว็บที่ส่งเป็นปลายทางโฆษณาของ ChatGPT | เกี่ยวข้องกับผู้ลงโฆษณาเป็นหลัก เนื้อหาที่รวบรวมไม่ได้ใช้ในการฝึกอบรมโมเดลพื้นฐานปัญญาประดิษฐ์เชิงสร้างสรรค์ |
Googlebot | Crawler หลักของ Google Search | ควบคุมการคลานของ Google Search ทั่วไป | |
Googlebot-Image, Googlebot-Video, Googlebot-News | รูปภาพ วิดีโอ และ Google News | สิ่งเหล่านี้มีโทเค็น robots.txt แยกกันและสามารถควบคุมได้อย่างอิสระ | |
GoogleOther | การคลานของ Google ทั่วไปสำหรับทีมผลิตภัณฑ์ต่างๆ รวมถึงการวิจัยและพัฒนา | ไม่ได้เป็นตัวแทนของผลิตภัณฑ์ Google ที่เฉพาะเจาะจง | |
Google-Extended | ควบคุมว่าเนื้อหาที่ Google คลานมานั้นสามารถใช้สำหรับการฝึกอบรมโมเดล Gemini และระบบการสร้างข้อมูลบางอย่างหรือไม่ | เป็นโทเค็นควบคุม robots.txt ไม่ใช่ User-agent ที่ขอแยกต่างหาก ไม่ส่งผลต่อการรวมในการค้นหาของ Google ทั่วไป | |
| Anthropic | ClaudeBot | รวบรวมเนื้อหาเว็บสาธารณะที่อาจนำไปสู่การพัฒนาโมเดล Claude | ไม่อนุญาตเพื่อส่งสัญญาณว่าเนื้อหาในอนาคตควรถูกยกเว้นจากชุดข้อมูลการฝึกอบรมของ Anthropic |
| Anthropic | Claude-SearchBot | ปรับปรุงคุณภาพผลการค้นหาของ Claude | อนุญาตสำหรับการมองเห็นในการค้นหาของ Claude |
| Anthropic | Claude-User | ดึงหน้าเว็บเพื่อตอบสนองต่อคำขอของผู้ใช้ไปยัง Claude | แยกจากการคลานอัตโนมัติ |
| Perplexity | PerplexityBot | จัดทำดัชนีหน้าเว็บสำหรับผลการค้นหาของ Perplexity | Perplexity กล่าวว่า Crawler นี้ไม่ได้ใช้เพื่อรวบรวมเนื้อหาสำหรับการฝึกอบรมโมเดลพื้นฐานปัญญาประดิษฐ์ |
| Perplexity | Perplexity-User | ดึงหน้าเว็บหลังจากผู้ใช้ร้องขอ | เอกสารประกอบของ Perplexity ระบุว่า Fetcher นี้โดยทั่วไปจะละเลย robots.txt เนื่องจากคำขอเริ่มต้นโดยผู้ใช้ |
| Apple | Applebot | รองรับ Apple Search, Spotlight, Siri, Safari และประสบการณ์ Apple อื่นๆ | อนุญาตสำหรับการค้นพบของ Apple |
| Apple | Applebot-Extended | ควบคุมว่าเนื้อหาที่ Applebot คลานมานั้นสามารถใช้ในการฝึกอบรมโมเดลพื้นฐานของ Apple ได้หรือไม่ | ไม่ได้คลานหน้าเว็บด้วยตัวเอง เป็นการควบคุมการใช้ข้อมูล |
| Common Crawl | CCBot | รวบรวมข้อมูลเว็บสาธารณะสำหรับคลังข้อมูลเว็บแบบเปิดของ Common Crawl | ไม่ใช่ผู้ช่วย แต่ชุดข้อมูลของมันสามารถใช้โดยนักวิจัยและนักพัฒนาปัญญาประดิษฐ์ |
| Microsoft | Bingbot | Crawler หลักของการค้นหา Bing | อนุญาตสำหรับการค้นพบและการมองเห็นในการค้นหาของ Bing |
| Microsoft | MicrosoftPreview, BingVideoPreview | ตัวอย่างหน้าเว็บและวิดีโอสำหรับผลิตภัณฑ์ Microsoft | สิ่งเหล่านี้สามารถควบคุมแยกจาก Bingbot ได้ |
| Amazon | Amzn-SearchBot | การค้นหาและการค้นพบเนื้อหาของ Amazon | Amazon กล่าวว่าไม่ได้คลานเนื้อหาสำหรับการฝึกอบรมโมเดลปัญญาประดิษฐ์เชิงสร้างสรรค์ |
| Amazon | Amzn-User | ดึงข้อมูลปัจจุบันเพื่อตอบสนองต่อการกระทำของผู้ใช้ รวมถึงคำขอจาก Alexa | ถูกเรียกใช้โดยผู้ใช้และแยกจากการคลานค้นหาอัตโนมัติ |
OpenAI จัดทำเอกสาร Crawler สำหรับการค้นหา การฝึกอบรม การโฆษณา และที่เรียกใช้โดยผู้ใช้เป็นตัวควบคุมที่แยกต่างหาก เอกสารประกอบของ OpenAI แนะนำโดยเฉพาะให้ OAI-SearchBot สำหรับการค้นหาของ ChatGPT ในขณะที่ใช้ GPTBot แยกกันสำหรับการตั้งค่าการฝึกอบรม (developers.openai.com)
Google ก็แยก Googlebot, GoogleOther และ Google-Extended เช่นกัน Google-Extended ไม่มี User-agent สำหรับคำขอ HTTP ของตัวเอง และการบล็อกมันก็ไม่ได้ทำให้หน้าเว็บหายไปจากการค้นหาของ Google (developers.google.com)
Anthropic จัดทำเอกสารบทบาทที่แยกจากกันสำหรับ ClaudeBot, Claude-SearchBot และ Claude-User นอกจากนี้ Anthropic ยังระบุว่าบอตของตนปฏิบัติตาม robots.txt และรองรับคำสั่ง Crawl-delay ที่ไม่ได้เป็นมาตรฐาน (support.anthropic.com)
Perplexity แยกความแตกต่างระหว่างการคลานค้นหาอัตโนมัติและการดึงข้อมูลตามคำขอของผู้ใช้ เอกสารประกอบปัจจุบันระบุว่า PerplexityBot เคารพ robots.txt ในขณะที่ Perplexity-User โดยทั่วไปจะไม่ทำเช่นนั้นเนื่องจากเป็นการตอบสนองต่อคำขอของผู้ใช้ (docs.perplexity.ai)
เอกสารประกอบปัจจุบันของ Apple มีความแตกต่างระหว่างการค้นหาและการฝึกอบรมเช่นเดียวกัน: Applebot รองรับการค้นพบ ในขณะที่ Applebot-Extended ช่วยให้ผู้เผยแพร่สามารถควบคุมการใช้งานสำหรับการฝึกอบรมได้โดยไม่ต้องลบหน้าเว็บออกจากการค้นหาของ Apple (support.apple.com)
การกำหนดค่า robots.txt ที่แนะนำ
วาง robots.txt ไว้ที่รากของแต่ละโฮสต์ เช่น:
text https://www.example.org/robots.txt
กฎจะใช้กับโฮสต์ โปรโตคอล และพอร์ตเฉพาะที่ไฟล์ถูกให้บริการ โดเมนย่อยแยกต่างหากอาจต้องมีไฟล์ของตัวเอง (developers.google.com)
การกำหนดค่า 1: การรวมสูงสุด
ใช้สิ่งนี้เมื่อเนื้อหาบรรณาธิการสาธารณะอาจถูกค้นพบ สรุป อ้างอิง จัดทำดัชนี และรวบรวมโดย Crawler ที่ปฏิบัติตามกฎ
text
หน้าสาธารณะสามารถเข้าถึงได้โดย Crawler ที่ปฏิบัติตามกฎ
User-agent: * Allow: /
ป้องกันเส้นทางส่วนตัว ธุรกรรม และการบริหารจัดการ
Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
สิ่งนี้อนุญาตให้ Crawler ที่ระบุชื่อ เช่น OpenAI, Google, Anthropic, Perplexity, Apple, Common Crawl, Microsoft และ Amazon เข้าถึงได้ เว้นแต่จะมีกฎเฉพาะอื่นบล็อกไว้
อย่าตั้งกฎครอบคลุม เช่น User-agent: * Disallow: / ไว้ใต้การกำหนดค่านี้ กลุ่มที่อยู่ด้านล่างหรือเฉพาะเจาะจงกว่าอาจเปลี่ยนวิธีการที่ Crawler ตีความไฟล์
การกำหนดค่า 2: อนุญาตการค้นหาแต่บล็อก Crawler สำหรับการพัฒนาโมเดล
นี่เป็นทางออกที่เหมาะสมที่สุดสำหรับผู้เผยแพร่ที่ต้องการการอ้างอิงและการเข้าชมจากการค้นหา แต่ไม่ต้องการส่งสัญญาณการอนุญาตสำหรับการรวบรวมเพื่อพัฒนาโมเดล
text
บล็อกการคลานเพื่อพัฒนาโมเดลของ OpenAI
User-agent: GPTBot Disallow: /
บล็อกการคลานเพื่อพัฒนาโมเดลของ Anthropic
User-agent: ClaudeBot Disallow: /
บล็อกการฝึกอบรมโมเดลของ Google และการใช้งานที่เกี่ยวข้อง
User-agent: Google-Extended Disallow: /
บล็อกการใช้งานเพื่อฝึกอบรมโมเดลพื้นฐานของ Apple
User-agent: Applebot-Extended Disallow: /
ไม่บังคับ: บล็อกการรวบรวมชุดข้อมูลของ Common Crawl
User-agent: CCBot
Disallow: /
อนุญาตการคลานเพื่อค้นหาและดึงข้อมูลทั่วไป ยกเว้นเส้นทางที่ละเอียดอ่อน
User-agent: * Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/ Disallow: /api/private/ Disallow: /internal-search/
Sitemap: https://www.example.org/sitemap.xml
การกำหนดค่านี้ทำให้ OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot และ Applebot อยู่ภายใต้กลุ่ม wildcard นอกจากนี้ยังแยกสิทธิ์การค้นหาและการฝึกอบรมออกจากกัน
สำหรับ Apple การบล็อก Applebot-Extended ในขณะที่อนุญาต Applebot จะช่วยรักษาระบบการค้นพบผ่านบริการของ Apple สำหรับ Google การบล็อก Google-Extended ไม่ได้บล็อกการค้นหาของ Google ทั่วไป (developers.google.com)
การกำหนดค่า 3: อนุญาต Crawler การค้นหาที่เลือกไว้อย่างชัดเจน
หากไฟล์ robots.txt ที่มีอยู่บล็อก Crawler ทั้งหมด ให้เพิ่มกลุ่มแยกสำหรับ Crawler การค้นหาที่คุณต้องการต้อนรับ
text User-agent: OAI-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Claude-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: PerplexityBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Googlebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Applebot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Bingbot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: CCBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
User-agent: Amzn-SearchBot Allow: / Disallow: /account/ Disallow: /admin/ Disallow: /checkout/ Disallow: /private/
บล็อก Crawler อื่นๆ ทั้งหมด
User-agent: * Disallow: /
เมื่อใช้กลุ่มเฉพาะ ให้ทำซ้ำกฎเส้นทางที่ละเอียดอ่อนภายในแต่ละกลุ่ม Crawler บางตัวใช้กลุ่มที่ตรงกันที่สุดแทนที่จะรวมกับกลุ่ม wildcard Bing ได้จัดทำเอกสารพฤติกรรมนี้โดยตรง และ Google ให้คำแนะนำแยกต่างหากเกี่ยวกับกลุ่มที่เฉพาะเจาะจงกับ Crawler (bing.com)
ข้อจำกัดสำคัญของ robots.txt
- Crawler อาจไม่สนใจ robots.txt
- Crawler ที่ไม่หวังดีสามารถแกล้งทำเป็น Crawler ที่เชื่อถือได้
- หน้าที่ถูกบล็อกยังคงสามารถรู้จักได้จากชื่อเรื่องหรือที่อยู่เว็บ
- Robots.txt ไม่ได้ปกป้องรหัสผ่าน ไฟล์ส่วนตัว บันทึกข้อมูลลูกค้า หรือ Application Programming Interface (API) ที่เป็นความลับ
- คำสั่ง
Crawl-delayไม่ใช่ส่วนหนึ่งของโปรโตคอลการยกเว้นหุ่นยนต์หลักและไม่ได้รับการสนับสนุนจาก Crawler ทุกตัว Anthropic และ Bing ได้จัดทำเอกสารการสนับสนุน ในขณะที่ Apple ระบุว่า Applebot ไม่ปฏิบัติตาม crawl-delay (rfc-editor.org)
Meta Tags และ HTTP Headers
ตัวอย่างหน้าสาธารณะ
สำหรับบทความสาธารณะ ให้ใช้ชื่อเรื่องที่ชัดเจน ผู้เขียน ที่อยู่เว็บ Canonical วันที่เผยแพร่ และวันที่แก้ไข
html
คำสั่ง max-snippet มีการจัดทำเอกสารหลักสำหรับ Google อย่าคิดว่า Crawler ปัญญาประดิษฐ์ทุกตัวรองรับคำสั่ง meta ทุกคำสั่ง
ตัวอย่างหน้าส่วนตัวหรือหน้าที่มีข้อมูลละเอียดอ่อน
html
ใช้สิ่งนี้สำหรับหน้าเว็บที่ไม่ควรปรากฏในผลการค้นหา หน้าเว็บจะต้องยังคงสามารถคลานได้นานพอที่ Crawler จะเห็นคำสั่งนั้น หากหน้าเว็บจะต้องเป็นส่วนตัวอย่างแท้จริง ให้ใช้การยืนยันตัวตนหรือการป้องกันด้วยรหัสผ่านแทน (developers.google.com)
ซ่อนเฉพาะส่วนที่ละเอียดอ่อนจาก Search Snippets
Google รองรับ data-nosnippet สำหรับส่วนเฉพาะของหน้า HTML:
html
ย่อหน้านี้อาจแสดงในผลการค้นหาได้
สิ่งนี้มีประโยชน์สำหรับรายละเอียดการติดต่อ บันทึกภายใน หรือข้อมูลที่ผู้ใช้สร้างขึ้น ไม่ใช่คำสั่งสากลสำหรับระบบปัญญาประดิษฐ์ทุกระบบ (developers.google.com)
ใช้ส่วนหัว X-Robots-Tag สำหรับไฟล์
Meta tags ไม่สามารถวางไว้ในไฟล์เอกสารแบบพกพา (PDF) รูปภาพ หรือไฟล์วิดีโอได้ ให้ใช้ส่วนหัวการตอบกลับ HTTP แทน:
text X-Robots-Tag: noindex, nosnippet
สำหรับหน้าเว็บที่ควรยังคงสามารถค้นหาได้ แต่ไม่ควรให้ข้อความสำหรับ Snippets หรือคำตอบของปัญญาประดิษฐ์ ให้ใช้:
text X-Robots-Tag: nosnippet
Google จัดทำเอกสาร X-Robots-Tag สำหรับทรัพยากรที่ไม่ใช่ HTML และ Apple ก็รองรับสำหรับ Applebot เช่นกัน (developers.google.com)
การควบคุมเฉพาะของ Apple
Apple รองรับ:
html
Apple ระบุว่า nosnippet ป้องกันไม่ให้หน้าเว็บถูกใช้เป็นบริบทเพิ่มเติมและเนื้อหาปัจจุบันเมื่อโมเดลของ Apple สร้างผลลัพธ์ หน้าเว็บอาจยังคงถูกค้นพบได้ผ่าน Apple Search, Spotlight, Siri และ Safari (support.apple.com)
สำหรับหน้าที่มี Paywall, Apple ยังรองรับข้อมูลที่มีโครงสร้างโดยใช้:
{ "@context": "https://schema.org", "isAccessibleForFree": false }
Apple ระบุว่าหน้าเว็บดังกล่าวอาจยังคงมีสิทธิ์ปรากฏในผลการค้นหา แต่จะไม่ถูกใช้เป็นบริบทเพิ่มเติมสำหรับคำตอบของปัญญาประดิษฐ์ (support.apple.com)
วิธีการยืนยันที่อยู่ Internet Protocol ของ Crawler
ทำไมการจับคู่ User-agent จึงไม่เพียงพอ
กฎเช่นนี้มีความอ่อนแอ:
text if User-Agent contains "GPTBot": allow
ใครๆ ก็สามารถส่งข้อความนั้นได้ กฎที่ดีกว่าคือ:
text if User-Agent is a known crawler and source Internet Protocol address is in the provider's official range: allow or rate-limit else: challenge, rate-limit, or block
อย่าเชื่อถือส่วนหัว X-Forwarded-For เว้นแต่จะมาจากพร็อกซีหรือเครือข่ายส่งข้อมูล (Content Delivery Network) ที่องค์กรของคุณควบคุม
วิธีการยืนยันของผู้ให้บริการ
| ผู้ให้บริการ | วิธีการยืนยันที่แนะนำ |
|---|---|
| OpenAI | ใช้ฟีดที่อยู่ Internet Protocol สดที่เผยแพร่ในเอกสารประกอบ Crawler ของ OpenAI สำหรับ OAI-SearchBot, GPTBot และ OAI-AdsBot รีเฟรชโดยอัตโนมัติแทนที่จะคัดลอกช่วงคงที่ลงใน Firewall |
| ใช้ช่วง Crawler ที่ Google เผยแพร่ หรือทำการตรวจสอบระบบชื่อโดเมนแบบย้อนกลับและส่งต่อ Crawler ของ Google ที่แท้จริงควรแก้ไขเป็นชื่อโฮสต์ของ Google ที่ได้รับการอนุมัติ และแก้ไขกลับไปยังที่อยู่เดิมได้ | |
| Anthropic | ใช้ฟีดที่อยู่ Crawler ที่เผยแพร่ในปัจจุบันเป็นตัวตรวจสอบเครือข่ายรอง วิธีการยกเลิกหลักของ Anthropic ยังคงเป็น robots.txt |
| Perplexity | รวม User-agent กับฟีดที่อยู่ PerplexityBot หรือ Perplexity-User ปัจจุบัน Perplexity แนะนำโดยเฉพาะให้รวมเงื่อนไขทั้งสองไว้ในกฎ Web Application Firewall |
| Apple | ใช้การยืนยันระบบชื่อโดเมนแบบย้อนกลับภายใต้ applebot.apple.com จากนั้นทำการค้นหาแบบส่งต่อ Apple ยังเผยแพร่ช่วงที่อยู่ปัจจุบันในฟีด JSON |
| Common Crawl | ใช้การยืนยันระบบชื่อโดเมนแบบย้อนกลับภายใต้ crawl.commoncrawl.org และฟีดที่อยู่ CCBot ปัจจุบัน Common Crawl ตั้งข้อสังเกตว่าการยืนยันแบบย้อนกลับยังไม่พร้อมใช้งานสำหรับทราฟฟิก IPv6 บางส่วน |
| Microsoft | ใช้เครื่องมือ Verify Bingbot อย่างเป็นทางการ หรือวิธีการค้นหาแบบย้อนกลับและส่งต่อที่ Microsoft จัดทำเอกสารไว้ |
| Amazon | ใช้รายการที่อยู่ Crawler ที่ Amazon เผยแพร่และจับคู่กับ User-agent ของ Amazon ที่เหมาะสม |
Google, Apple, Common Crawl, OpenAI, Anthropic และ Perplexity ล้วนเผยแพร่วิธีการเฉพาะของผู้ให้บริการหรือฟีดที่อยู่ รายการเหล่านี้สามารถเปลี่ยนแปลงได้ ดังนั้นกระบวนการอัปเดตตามกำหนดเวลาจึงปลอดภัยกว่ารายการที่คัดลอกด้วยตนเองแบบถาวร (developers.google.com)
การออกแบบ Firewall อย่างง่ายอาจมีลักษณะดังนี้:
text อนุญาต OAI-SearchBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วงการค้นหาปัจจุบันของ OpenAI อนุญาต GPTBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วงการฝึกอบรมปัจจุบันของ OpenAI อนุญาต PerplexityBot เฉพาะเมื่อที่อยู่ต้นทางอยู่ในช่วง PerplexityBot ปัจจุบัน อนุญาต Applebot เฉพาะเมื่อการยืนยัน DNS แบบย้อนกลับและส่งต่อสำเร็จ อนุญาต CCBot เฉพาะเมื่อ DNS แบบย้อนกลับและช่วง Common Crawl ปัจจุบันตรงกัน
จำกัดอัตราสำหรับ Crawler ที่ได้รับการยืนยันทั้งหมด บล็อกหรือท้าทายคำขอที่ไม่ได้รับการยืนยันที่อ้างว่าเป็น Crawler ที่เชื่อถือได้
อย่าใช้กฎอนุญาตแบบกว้างๆ กับผู้ให้บริการคลาวด์ทั้งหมด Crawler ที่ถูกต้องตามกฎหมายอาจใช้โครงสร้างพื้นฐานของคลาวด์ได้ แต่ทราฟฟิกส่วนใหญ่จากผู้ให้บริการคลาวด์นั้นไม่จำเป็นต้องเป็น Crawler
ใบอนุญาตแบบเปิดมีอิทธิพลต่อการรวมเข้าอย่างไร
CC BY 4.0 ในภาษาที่เข้าใจง่าย
ใบอนุญาต Creative Commons Attribution 4.0 International ซึ่งเรียกกันทั่วไปว่า CC BY 4.0 อนุญาตให้ผู้คนสามารถ:
- คัดลอกและเผยแพร่ผลงานซ้ำ
- ดัดแปลง แปล ผสมผสาน และต่อยอด
- ใช้ในเชิงพาณิชย์
เงื่อนไขหลักคือ:
- ให้เครดิตอย่างเหมาะสม
- ลิงก์ไปยังใบอนุญาต
- ระบุว่ามีการเปลี่ยนแปลงหรือไม่
- อย่าชี้นำว่าผู้สร้างดั้งเดิมรับรองการนำไปใช้ซ้ำ
- อย่าเพิ่มข้อจำกัดทางกฎหมายหรือทางเทคนิคที่ขัดขวางการใช้งานที่ได้รับอนุญาตตามใบอนุญาต
Creative Commons ยังเตือนด้วยว่าใบอนุญาตอาจไม่ครอบคลุมสิทธิ์ความเป็นส่วนตัว สิทธิ์ในการเผยแพร่ สิทธิ์ทางศีลธรรม สิทธิ์ในเครื่องหมายการค้า สิทธิ์ในสิทธิบัตร หรือเนื้อหาของบุคคลที่สาม (creativecommons.org)
ใบอนุญาตไม่ใช่การเชิญ Crawler ด้วยตัวมันเอง
การระบุ “CC BY 4.0” บนหน้าเว็บไม่ได้เป็นการรับประกันว่าองค์กรจะคลานหน้านั้น Crawler อาจยังคงถูกบล็อกได้โดย:
- robots.txt
- เครือข่ายส่งข้อมูล (Content Delivery Network)
- Web Application Firewall
- การจำกัดอัตรา
- การท้าทายด้วย JavaScript
- กำแพงการเข้าสู่ระบบ
- การตอบสนองของเซิร์ฟเวอร์ที่ไม่ดี
- Sitemap ที่เข้าถึงไม่ได้
ในทางกลับกัน การอนุญาตให้ Crawler เข้าถึงไม่ได้เป็นการให้สิทธิ์ลิขสิทธิ์ทุกประเภทที่จำเป็นสำหรับการใช้งานในภายหลังโดยอัตโนมัติ Robots.txt และการออกใบอนุญาตควรได้รับการออกแบบร่วมกัน
ทำไม CC BY จึงสนับสนุนการรวมที่กว้างขึ้นได้
ใบอนุญาตแบบเปิดที่ชัดเจนสามารถทำให้ทีมนักพัฒนาข้อมูล ระบบค้นหา และผู้ดูแลระบบผู้ช่วยเข้าใจนโยบายของผู้เผยแพร่ได้ง่ายขึ้น สามารถลดความไม่แน่นอนเกี่ยวกับการคัดลอก การดัดแปลง การใช้งานเชิงพาณิชย์ การแปล และการเผยแพร่ซ้ำ เมื่อกิจกรรมเหล่านั้นต้องการการอนุญาตลิขสิทธิ์
อย่างไรก็ตาม Creative Commons อธิบายว่าการฝึกอบรมปัญญาประดิษฐ์นั้นมีความซับซ้อนทางกฎหมาย ใบอนุญาตแบบจำกัดไม่ใช่วิธีที่มีประสิทธิภาพเสมอไปในการป้องกันการฝึกอบรม เนื่องจากบางการใช้งานสำหรับการฝึกอบรมอาจได้รับอนุญาตโดยข้อยกเว้นหรือข้อจำกัดด้านลิขสิทธิ์ Creative Commons ยังตั้งข้อสังเกตว่าเงื่อนไขใบอนุญาตอาจนำไปใช้กับการฝึกอบรมเครื่องจักรและผลลัพธ์ของโมเดลได้ยาก (creativecommons.org)
บทเรียนที่นำไปใช้ได้จริงคือ:
ใช้ CC BY เมื่อคุณต้องการการนำไปใช้ซ้ำอย่างถูกกฎหมายในวงกว้างอย่างแท้จริง อย่าใช้ใบอนุญาต Creative Commons แบบจำกัดเพื่อรับประกันการยกเลิกการฝึกอบรมปัญญาประดิษฐ์
การให้เครดิตช่วยปรับปรุงความชัดเจนของแหล่งที่มา
Creative Commons แนะนำวิธี TASL:
- ชื่อเรื่อง
- ผู้เขียน
- แหล่งที่มา
- ใบอนุญาต
ตัวอย่างเช่น:
“การออกใบอนุญาตและหุ่นยนต์เพื่อการรวมเข้าสูงสุด” โดย Example Publishing, https://www.example.org/articles/ai-crawlers, ได้รับอนุญาตภายใต้ Creative Commons Attribution 4.0 International การเปลี่ยนแปลงที่ทำ: อัปเดตรายการ Crawler
การให้เครดิตที่ชัดเจนไม่ได้บังคับให้ผู้ช่วยทุกรายอ้างอิงหน้าเว็บ แต่ทำให้การอ้างอิงที่ถูกต้องง่ายขึ้นเมื่อระบบดึงชื่อเรื่อง ผู้เขียน แหล่งที่มา และข้อมูลใบอนุญาตของหน้าเว็บ (wiki.creativecommons.org)
เพิ่มข้อมูลบทความที่มีโครงสร้าง
ใช้ข้อมูลที่มองเห็นได้และข้อมูลที่มีโครงสร้างร่วมกัน:
Google แนะนำให้ใช้ข้อมูลผู้เขียนที่ชัดเจน หน้าผู้เขียน วันที่เผยแพร่ วันที่แก้ไข และหน้า Canonical ที่เสถียร สัญญาณเหล่านี้สามารถช่วยให้ระบบค้นหาเข้าใจว่าใครเป็นผู้สร้างเนื้อหาและเวอร์ชันใดเป็นเวอร์ชันที่เชื่อถือได้ สิ่งเหล่านี้ไม่รับประกันการจัดอันดับ การรวมเข้า หรือการอ้างอิง (developers.google.com)
ข้อความกฎหมายมาตรฐานสำหรับเว็บไซต์ที่เปิดกว้างและเป็นมิตรกับการอ้างอิง
ต่อไปนี้เป็นภาษาตัวอย่าง ไม่ใช่คำแนะนำทางกฎหมาย ควรให้ที่ปรึกษากฎหมายปรับให้เข้ากับเขตอำนาจศาล โครงสร้างการเป็นเจ้าของ ภาระผูกพันด้านความเป็นส่วนตัว และเนื้อหาของบุคคลที่สาม
คำแถลงใบอนุญาต CC BY 4.0
text
ใบอนุญาตเนื้อหา
เว้นแต่จะระบุไว้เป็นอย่างอื่น ข้อความต้นฉบับและเนื้อหาบรรณาธิการต้นฉบับบนหน้านี้ได้รับอนุญาตภายใต้ใบอนุญาต Creative Commons Attribution 4.0 International:
https://creativecommons.org/licenses/by/4.0/
การอนุญาตนี้อนุญาตให้คัดลอก เผยแพร่ซ้ำ ดัดแปลง แปล ใช้งานเชิงพาณิชย์ ประมวลผลด้วยเครื่องจักร จัดทำดัชนีการค้นหา ดึงข้อมูล สรุป และใช้งานในระบบปัญญาประดิษฐ์ โดยมีเงื่อนไขว่าต้องปฏิบัติตามเงื่อนไขของใบอนุญาต
การให้เครดิตที่แนะนำ:
“[ชื่อหน้า],” โดย [ผู้เขียนหรือองค์กร], [ที่อยู่หน้า Canonical], เผยแพร่หรืออัปเดต [วันที่], ได้รับอนุญาตภายใต้ Creative Commons Attribution 4.0 International การเปลี่ยนแปลงที่ทำ: [อธิบายการเปลี่ยนแปลง หรือระบุ ‘ไม่มี’]
โปรดเก็บรักษาข้อมูลผู้เขียน ผู้เผยแพร่ แหล่งที่มา ใบอนุญาต และการแก้ไขไว้เสมอเมื่อทำได้โดยสมเหตุสมผล คู่มือการให้เครดิตที่แนะนำนี้ไม่ได้เพิ่มข้อจำกัดให้กับใบอนุญาต Creative Commons และไม่ได้แทนที่ข้อความใบอนุญาต
วลี “รวมถึงระบบปัญญาประดิษฐ์” ชี้แจงเจตนาของผู้เผยแพร่ ไม่ควรนำมาใช้เพื่อแกล้งอ้างว่าผู้เผยแพร่เป็นเจ้าของสิทธิ์ในเนื้อหาที่สร้างโดยบุคคลอื่น
ประกาศสิทธิ์ในแบรนด์ ความเป็นส่วนตัว และของบุคคลที่สาม
text
สิทธิ์ในแบรนด์ ความเป็นส่วนตัว และของบุคคลที่สาม
ใบอนุญาตข้างต้นครอบคลุมเฉพาะเนื้อหาต้นฉบับที่ระบุว่าเป็นใบอนุญาตเท่านั้น ไม่ได้ให้สิทธิ์ในการใช้:
- เครื่องหมายการค้า เครื่องหมายบริการ โลโก้ หรือชุดรูปแบบสินค้า
- ชื่อ รูปภาพ หรือรูปเหมือนของบุคคล
- ข้อมูลส่วนตัว ข้อมูลที่เป็นความลับ บัญชี สุขภาพ การเงิน หรือความปลอดภัย
- เนื้อหาที่ผู้ใช้ส่งเข้ามา เว้นแต่จะระบุแยกต่างหากว่าเป็นใบอนุญาต
- ภาพถ่าย ภาพประกอบ แผนที่ วิดีโอ เพลง คำอ้างอิง หรือเนื้อหาของบุคคลที่สามอื่นๆ
- เนื้อหาที่ระบุว่าเป็น “สงวนลิขสิทธิ์” หรืออยู่ภายใต้ใบอนุญาตแยกต่างหาก
การใช้ชื่อ โลโก้ และเครื่องหมายของ Example Publishing จะต้องไม่สื่อถึงการสนับสนุน การอนุมัติ การเป็นพันธมิตร หรือการรับรอง โปรดลิงก์ไปยังหน้าต้นฉบับและแยกความแตกต่างระหว่างการอ้างอิง การถอดความ การสรุป และเนื้อหาที่สร้างขึ้นอย่างชัดเจน
ภาษานี้มีความสำคัญเนื่องจากใบอนุญาต Creative Commons ไม่ได้ให้สิทธิ์ทางกฎหมายทุกประเภทที่เชื่อมโยงกับหน้าเว็บโดยอัตโนมัติ (creativecommons.org)
คำแนะนำสำหรับการอ้างอิงการค้นหาและผู้ช่วย
text
คำแนะนำสำหรับการอ้างอิงการค้นหาและผู้ช่วย
เรายินดีต้อนรับการจัดทำดัชนีการค้นหา การดึงข้อมูลตามคำขอของผู้ใช้ การอ้างอิง และการสรุปเนื้อหาที่ได้รับอนุญาตบนเว็บไซต์นี้
เมื่ออ้างอิงเว็บไซต์นี้ โปรดใช้ชื่อหน้า ผู้เขียนหรือผู้เผยแพร่ ที่อยู่หน้า Canonical วันที่เผยแพร่หรืออัปเดต และลิงก์โดยตรงไปยังแหล่งที่มา โปรดระบุแหล่งที่มาว่าเป็นหนึ่งในข้อมูลนำเข้าจากแหล่งข้อมูลที่ใช้ แยกแยะการวิเคราะห์ที่สร้างขึ้นจากเนื้อหาที่ยกมา และอย่าระบุหรือสื่อว่า Example Publishing รับรองคำตอบที่สร้างขึ้น ผลิตภัณฑ์ บุคคล หรือบริการใดๆ
คำแนะนำนี้มีวัตถุประสงค์เพื่อปรับปรุงความถูกต้องและการให้เครดิต ไม่ได้ให้สิทธิ์เกินกว่าใบอนุญาตเนื้อหาที่เกี่ยวข้อง และไม่ได้อนุญาตเครื่องหมายการค้า ข้อมูลส่วนบุคคล ข้อมูลที่เป็นความลับ หรือเนื้อหาของบุคคลที่สาม
หากคุณต้องการการมองเห็นในการค้นหาแต่ไม่ต้องการให้ใบอนุญาตสำหรับการฝึกอบรมแบบกว้างๆ
text
การเข้าถึงการค้นหาและลิขสิทธิ์
หน้าสาธารณะของเราสามารถเข้าถึงได้โดย Crawler สำหรับการค้นหาและดึงข้อมูลที่ปฏิบัติตามกฎ ซึ่งระบุไว้ในไฟล์ robots.txt ของเรา การอนุญาตนี้มีวัตถุประสงค์เพื่อสนับสนุนการค้นพบ ผลการค้นหา การดึงข้อมูลตามคำขอของผู้ใช้ และการอ้างอิง
เว้นแต่จะมีการแสดงใบอนุญาตแยกต่างหาก เนื้อหาต้นฉบับทั้งหมดสงวนลิขสิทธิ์ การเข้าถึงหน้าสาธารณะไม่ได้ให้ใบอนุญาตแยกต่างหากสำหรับการพัฒนาโมเดล การฝึกอบรม การเผยแพร่ซ้ำ การนำกลับมาใช้ใหม่เชิงพาณิชย์ หรือการสร้างงานดัดแปลงที่เกินกว่าสิทธิ์ที่กฎหมายที่เกี่ยวข้องกำหนดไว้
โปรดอ้างอิงที่อยู่หน้า Canonical และผู้เผยแพร่เมื่ออ้างถึงเนื้อหานี้ ไม่มีสิ่งใดในเว็บไซต์นี้ที่ให้สิทธิ์ในการใช้เครื่องหมายการค้า โลโก้ ข้อมูลส่วนบุคคล ข้อมูลที่เป็นความลับ หรือเนื้อหาของบุคคลที่สาม
อย่าใช้คำแถลง CC BY และคำแถลงสงวนลิขสิทธิ์ทั้งหมดกับเนื้อหาเดียวกัน ระบุให้ชัดเจนว่าใบอนุญาตใดใช้กับเนื้อหาใด
เมทริกซ์ความเสี่ยง-ผลประโยชน์สำหรับการออกใบอนุญาตแบบเปิด
กฎหมายลิขสิทธิ์และกฎการฝึกอบรมปัญญาประดิษฐ์แตกต่างกันไปในแต่ละประเทศและยังคงไม่แน่นอน สำนักงานลิขสิทธิ์ของสหรัฐอเมริกายังคงตรวจสอบประเด็นเหล่านี้ ในขณะที่ Creative Commons อธิบายว่าการฝึกอบรมปัญญาประดิษฐ์นั้นขึ้นอยู่กับข้อเท็จจริงและมีความซับซ้อนทางกฎหมาย (copyright.gov)
| แนวทาง | ศักยภาพในการรวมเข้า | ประโยชน์หลัก | ความเสี่ยงหลัก | ความเหมาะสมที่สุด |
|---|---|---|---|---|
| CC BY 4.0 | สูงมาก | การคัดลอก ดัดแปลง ใช้งานเชิงพาณิชย์ แปล จัดทำดัชนี และนำไปใช้ซ้ำที่เกี่ยวข้องกับโมเดลในวงกว้างเมื่อจำเป็นต้องได้รับอนุญาตตามลิขสิทธิ์ | คู่แข่งเชิงพาณิชย์อาจนำเนื้อหาไปใช้ซ้ำหรือดัดแปลงได้ การให้เครดิตอาจไม่สมบูรณ์ ใบอนุญาตไม่สามารถควบคุมความเป็นส่วนตัว เครื่องหมายการค้า หรือสิทธิ์ของบุคคลที่สามได้ | ผู้เผยแพร่ที่ต้องการการนำไปใช้ซ้ำอย่างถูกกฎหมายในวงกว้างที่สุดและการให้เครดิตแหล่งที่มาที่แข็งแกร่ง |
| CC BY-SA 4.0 | สูง, แต่ซับซ้อนกว่า | ส่งเสริมวงจรการแบ่งปันแบบเปิดและกำหนดให้การดัดแปลงยังคงอยู่ภายใต้เงื่อนไขที่เข้ากันได้ | กฎ ShareAlike อาจนำไปใช้กับชุดข้อมูล การฝึกอบรมโมเดล และผลลัพธ์สาธารณะได้ยาก บางองค์กรอาจหลีกเลี่ยงเนื้อหาเนื่องจากความไม่แน่นอน | โครงการเพื่อการศึกษาและสาธารณะที่ต้องการให้การดัดแปลงในลำน้ำยังคงเป็นแบบเปิด |
| CC BY-NC 4.0 | ปานกลางหรือต่ำ | จำกัดการใช้งานที่มุ่งเน้นผลประโยชน์เชิงพาณิชย์หรือค่าตอบแทนทางการเงินเป็นหลัก | "ไม่ใช้ในเชิงพาณิชย์" อาจตีความได้ยาก อาจไม่รวมการค้นหา โมเดล และการใช้งานผู้ช่วยในเชิงพาณิชย์ ไม่ใช่การยกเลิกการฝึกอบรมที่รับประกัน | เนื้อหาที่มีวัตถุประสงค์เพื่อการไม่แสวงหาผลกำไร การศึกษา หรือการใช้งานในชุมชน |
| CC BY-ND 4.0 | ปานกลาง | อนุญาตการแบ่งปันในขณะที่จำกัดการดัดแปลง | การแปล การแปลง และกรณีการใช้งานผู้ช่วยบางอย่างอาจกลายเป็นเรื่องไม่แน่นอนทางกฎหมาย มีความน่าสนใจน้อยลงสำหรับระบบที่สรุปหรือผสมผสาน | ประกาศอย่างเป็นทางการหรืองานที่ไม่ต้องมีการเปลี่ยนแปลง |
| CC0 หรือการอุทิศให้เป็นสาธารณสมบัติ | สูงมาก | ทำให้การนำไปใช้ซ้ำง่ายขึ้นและลบเงื่อนไขลิขสิทธิ์ส่วนใหญ่ออกเมื่อมีผลทางกฎหมาย | ไม่ต้องมีการให้เครดิต การควบคุมการนำเสนอแบรนด์อ่อนแอ สิทธิ์ความเป็นส่วนตัว เครื่องหมายการค้า และการเผยแพร่ยังคงแยกจากกัน | ข้อเท็จจริง ชุดข้อมูล เนื้อหาอ้างอิง หรืองานที่มีวัตถุประสงค์เพื่อการนำไปใช้ซ้ำโดยไม่มีข้อจำกัด |
| สงวนลิขสิทธิ์ทั้งหมดบวกการคลานค้นหาแบบเปิด | สูงสำหรับการค้นหา, ต่ำสำหรับการฝึกอบรม | สามารถรักษาการมองเห็นในการค้นหาและการอ้างอิงได้โดยไม่ต้องให้ใบอนุญาตการนำไปใช้ซ้ำแบบกว้างๆ | ความไม่แน่นอนทางกฎหมายมากขึ้นสำหรับนักพัฒนาโมเดล อาจลดการรวมเข้าในชุดข้อมูลการฝึกอบรมและระบบการนำไปใช้ซ้ำเชิงพาณิชย์ | ผู้เผยแพร่ที่ต้องการการค้นพบและการอ้างอิง แต่ต้องการเจรจาใบอนุญาตที่กว้างขึ้นแยกต่างหาก |
กลยุทธ์ที่สมดุลที่สุดสำหรับหลายองค์กรคือ:
- CC BY 4.0 สำหรับข้อความบรรณาธิการสาธารณะที่เป็นต้นฉบับ
- ป้ายกำกับแยกต่างหากสำหรับเนื้อหาของบุคคลที่สาม
- ไม่มีข้อมูลส่วนบุคคลหรือข้อมูลที่เป็นความลับในที่สาธารณะ
- อนุญาต Crawler สำหรับการค้นหาและดึงข้อมูล
- อนุญาต Crawler สำหรับการพัฒนาโมเดลเฉพาะเมื่อองค์กรยอมรับการใช้งานนั้นอย่างแท้จริง
- ใช้การให้เครดิตที่ชัดเจนและลิงก์ Canonical
- ปกป้องเครื่องหมายการค้าผ่านประกาศแบรนด์แยกต่างหาก
รายการตรวจสอบการนำไปใช้งานจริง
เนื้อหาและการออกใบอนุญาต
- ระบุว่าใครเป็นเจ้าของแต่ละหน้า รูปภาพ แผนภูมิ วิดีโอ และคำอ้างอิง
- ออกใบอนุญาตเฉพาะเนื้อหาที่องค์กรของคุณควบคุมสิทธิ์
- ทำเครื่องหมายเนื้อหาของบุคคลที่สามแยกต่างหาก
- เพิ่มคำแถลงใบอนุญาตที่มองเห็นได้
- ให้การอ้างอิงที่แนะนำโดยใช้ชื่อเรื่อง ผู้เขียน แหล่งที่มา และใบอนุญาต
- เก็บโลโก้ เครื่องหมายการค้า ข้อมูลส่วนบุคคล และข้อมูลที่เป็นความลับไว้นอกขอบเขตของใบอนุญาต
Robots.txt
- สร้างไฟล์ robots.txt สาธารณะที่รากของแต่ละโฮสต์
- อนุญาต Crawler การค้นหาแยกจาก Crawler สำหรับการฝึกอบรม
- บล็อกเส้นทางสำหรับการบริหารจัดการ บัญชี การชำระเงิน เส้นทางส่วนตัว และเส้นทางแอปพลิเคชันภายใน
- อย่าพึ่งพา robots.txt เพื่อความปลอดภัย
- ทดสอบไฟล์หลังจากทุกการปรับใช้เว็บไซต์ครั้งสำคัญ
Meta tags
- ใช้ลิงก์ Canonical
- เพิ่มผู้เขียน วันที่เผยแพร่ และวันที่แก้ไข
- ใช้
noindexสำหรับหน้าเว็บที่ไม่ควรปรากฏในการค้นหา - ใช้
nosnippetหรือdata-nosnippetสำหรับส่วนที่ละเอียดอ่อนที่รองรับ - ใช้
X-Robots-Tagสำหรับไฟล์เอกสารแบบพกพา รูปภาพ และทรัพยากรที่ไม่ใช่ HTML อื่นๆ - โปรดจำไว้ว่า Crawler ต้องสามารถดึงข้อมูลหน้าเว็บได้ก่อนจึงจะสามารถอ่าน meta tags ของหน้าเว็บนั้นได้
ความปลอดภัยของเครือข่าย
- บันทึกสตริง user-agent ที่อยู่ต้นทาง รหัสการตอบกลับ และเส้นทางคำขอ
- ยืนยัน Crawler ที่เชื่อถือได้โดยใช้ฟีดที่อยู่อย่างเป็นทางการหรือวิธีการของระบบชื่อโดเมน
- รีเฟรชฟีดที่อยู่โดยอัตโนมัติ
- รวมการตรวจสอบ user-agent และที่อยู่ต้นทาง
- จำกัดอัตรา Crawler ที่ได้รับการยืนยัน แทนที่จะให้สิทธิ์การเข้าถึงแบบไม่จำกัด
- ท้าทายหรือบล็อกคำขอที่อ้างว่าเป็น Crawler ที่เชื่อถือได้แต่ไม่ผ่านการยืนยัน
การวัดผล
ติดตาม:
- การเข้าชมจากบริการค้นหาปัญญาประดิษฐ์
- การอ้างอิงไปยังหน้าต้นฉบับ
- ความถี่ในการอ้างอิง
- โหลดเซิร์ฟเวอร์โดย Crawler
- คำขอที่คืนค่า
403,404หรือ429 - การเข้าถึงเส้นทางที่ไม่ตั้งใจของ Crawler
- บทความปัจจุบันถูกค้นพบหลังจากเผยแพร่หรือไม่
บทสรุป
การรวมเข้าสูงสุดต้องอาศัย การเปิดกว้างแบบเลือกสรร ไม่ใช่การอนุญาตแบบครอบคลุมเพียงครั้งเดียว
ใช้ robots.txt เพื่อแยกการคลานสำหรับการค้นหา การดึงข้อมูลโดยผู้ใช้ การฝึกอบรม และชุดข้อมูลสาธารณะ ใช้ meta tags และ HTTP headers เพื่อจัดการการจัดทำดัชนีและ Snippets ใช้การยืนยันตัวตนสำหรับข้อมูลส่วนตัวใดๆ ยืนยันที่อยู่ Internet Protocol ของ Crawler แทนที่จะเชื่อเพียงชื่อ User-agent
ใบอนุญาตแบบเปิด เช่น CC BY 4.0 สามารถทำให้การนำไปใช้ซ้ำในวงกว้างง่ายขึ้นเมื่อคุณต้องการอย่างแท้จริง ข้อมูลการให้เครดิตที่ชัดเจน—ชื่อเรื่อง ผู้เขียน แหล่งที่มา ใบอนุญาต หน้า Canonical และวันที่อัปเดต—ยังสามารถทำให้ระบบค้นหาและผู้ช่วยระบุและอ้างอิงแหล่งที่มาที่ถูกต้องได้ง่ายขึ้น
ดังนั้น นโยบายการเผยแพร่ที่แข็งแกร่งที่สุดคือ:
**เปิดเผยเนื้อหาสาธารณะที่คุณต้องการให้ถูกค้นพบ ออกใบอนุญาตเนื้อหาที่คุณต้องการนำไปใช้ซ้ำอย่างชัดเจน ทำเครื่องหมายเนื้อหาที่คุณไม่ได้เป็นเจ้าของ ปกป้องข้อมูลส่วนตัวในระดับเซิร์ฟเวอร์ และให้สิทธิ์การอนุญาตที่แยกต่างหากและตรวจสอบได้แก่ Crawler ทุกตัว
Auto