← GEO Optimization Platformแพ็กเกจบริการ

AI crawler 16 ตัวที่ต้องสนใจ และวิธีเช็กใน 5 นาทีว่าเข้าเว็บคุณได้ไหม

AI crawler 16 ตัวที่ต้องสนใจ และวิธีเช็กใน 5 นาทีว่าเข้าเว็บคุณได้ไหม

AI search ใช้บอตของตัวเอง (GPTBot, ClaudeBot, PerplexityBot และอีก 13 ตัว) ไฟล์ robots.txt ที่เขียนไว้ตั้งแต่ยุค Google อาจบล็อกทั้งหมดโดยไม่มีใครรู้ นี่คือเช็กลิสต์ที่เราใช้ตรวจทุกโปรเจกต์ พร้อมวิธีเช็กเว็บตัวเองใน 5 นาที

ก่อนจะไปถึงเรื่องคุณภาพเนื้อหา มีคำถามที่ตอบได้แค่ใช่หรือไม่ใช่ก่อน คือ AI crawler ดึงหน้าเว็บของคุณได้จริงหรือเปล่า จากเว็บที่เราตรวจสุขภาพมา คำตอบเป็น "ไม่ได้" บ่อยกว่าที่คิด และส่วนใหญ่เกิดขึ้นโดยไม่ได้ตั้งใจ

บอตที่เราตรวจทุกครั้ง

การตรวจสุขภาพมาตรฐานของเราเช็ก user agent 16 ตัวจากผู้ให้บริการ AI รายหลัก

  • OpenAI: GPTBot (เก็บข้อมูลเทรน), OAI-SearchBot (ดัชนีค้นหา), ChatGPT-User (เปิดดูตอนผู้ใช้ถาม)
  • Anthropic: ClaudeBot, Claude-Web, anthropic-ai
  • Perplexity: PerplexityBot, Perplexity-User
  • Google / Apple: Google-Extended (คุมการใช้ข้อมูลเทรน), Applebot, Applebot-Extended
  • อื่นๆ: Bytespider (ByteDance), Amazonbot, meta-externalagent (Meta), cohere-ai, YouBot

สามตัวที่ควรสนใจเป็นพิเศษคือบอตลงท้ายว่า "-User" (ChatGPT-User, Perplexity-User) เพราะมันดึงหน้าเว็บ ตอนที่ผู้ใช้กำลังถามคำถามอยู่ การบล็อกมันไม่ได้กระทบแค่การเทรนในอนาคต แต่ตัดคุณออกจากคำตอบวันนี้เลย

เว็บถูกบล็อกโดยไม่ได้ตั้งใจได้อย่างไร

  • ตั้ง Disallow: / ไว้กับบอตที่ไม่รู้จัก พบบ่อยในเทมเพลต robots.txt ที่อนุญาตเฉพาะ Googlebot กับ Bingbot ทำให้ AI crawler ทุกตัวตกอยู่ในกลุ่ม "ไม่รู้จัก"
  • ค่าเริ่มต้นของระบบกัน bot (WAF) Cloudflare และบริการคล้ายกันมีกฎบล็อก AI bot ที่อาจเปิดอยู่โดยเจ้าของเว็บไม่เคยเลือกเอง ดู robots.txt แล้วปกติดี แต่บอตโดน 403
  • กฎจำกัดจำนวนคำขอที่ตั้งไว้สำหรับคน ทำให้ AI crawler ถูกหน่วงจนแทบมองไม่เห็นเว็บ

เช็ก 5 นาที

  1. เปิด yourdomain.com/robots.txt แล้วอ่านแบบที่เครื่องอ่าน คือดูว่ากลุ่ม User-agent ไหนครอบคลุมบอตแต่ละตัว และอนุญาตหรือไม่
  2. ดึงหน้าแรกโดยสวมรอยเป็นบอตแล้วดูสถานะที่ได้ จากเทอร์มินัลใดก็ได้ ใช้คำสั่ง curl -sI -A "GPTBot" https://yourdomain.com/ แล้วอ่านบรรทัดแรกของคำตอบ ถ้าได้อย่างอื่นที่ไม่ใช่ 200 (เช่น 403, 406, 429) แปลว่ามีชั้นอื่นเหนือ robots.txt บล็อกอยู่ ส่วนใหญ่คือ WAF
  3. ยืนยันว่า robots.txt ประกาศ sitemap ไว้ (บรรทัด Sitemap: https://yourdomain.com/sitemap.xml) และ URL นั้นเปิดได้จริงเป็น XML ที่ถูกต้อง

ควรอนุญาตทั้งหมดไหม

เป็นการตัดสินใจทางธุรกิจ และมีเหตุผลที่ชอบธรรมถ้าจะปฏิเสธเฉพาะบอตที่เก็บข้อมูลเทรน (Google-Extended, GPTBot) แต่ยังอนุญาตบอตที่ใช้ค้นหา/เปิดดู สำหรับธุรกิจที่ ต้องการ ให้ AI มองเห็น เราแนะนำให้อนุญาตครบทั้ง 16 ตัวแบบระบุชัดเจนเป็นบล็อกละตัว เจตนาจะได้ไม่กำกวมและอยู่รอดเวลามีคนมาแก้เทมเพลตทีหลัง แต่เนื้อหาเป็นของคุณ เลือกอย่างตั้งใจดีกว่ารับค่าเริ่มต้นจากเทมเพลตที่เขียนตั้งแต่ยุคที่ยังไม่มี AI crawler

การเปิดทางให้บอตเข้าถึงเป็นงานที่ถูกที่สุดใน GEO ทั้งหมด แค่ไม่กี่บรรทัดในไฟล์ข้อความไฟล์เดียว และเป็นงานที่ทำให้งานอื่นทั้งหมดเป็นไปได้

ติดต่อฝ่ายขายดูผลงานลูกค้า