Miễn phí · không cần đăng ký

Kiểm tra bot AI có đọc được website của bạn không

Khi khách hỏi ChatGPT hay Perplexity về lĩnh vực của bạn, trợ lý AI chỉ có thể nhắc tới bạn nếu bot của nó đọc được website của bạn. Nhiều site chặn chúng mà chủ site không hề biết — cấu hình mặc định của hosting hoặc CDN.

Bot đọc được ≠ được trích dẫn — đây là điều kiện cần, không phải đủ.

Công cụ này kiểm hai lớp, không chỉ robots.txt

Lớp 1 — robots.txt

Đọc file robots.txt và xem nó cho phép hay chặn từng bot. Đây là lớp ai cũng kiểm được.

Lớp 2 — máy chủ có thật sự trả lời không

Gửi một yêu cầu mang đúng danh tính của từng bot và xem máy chủ/CDN trả về gì. Đây là chỗ phát hiện mâu thuẫn: robots.txt cho phép, nhưng hosting vẫn từ chối — và robots.txt không nói gì về việc đó.

8 bot đang được theo dõi

  • GPTBot (OpenAI)Thu thập nội dung để huấn luyện mô hình OpenAI (ChatGPT).
  • OAI-SearchBot (OpenAI)Lập chỉ mục để ChatGPT có thể trích dẫn/link trang trong câu trả lời tìm kiếm.
  • ClaudeBot (Anthropic)Thu thập nội dung cho Claude (Anthropic).
  • PerplexityBot (Perplexity)Thu thập để Perplexity trả lời kèm trích dẫn nguồn.
  • Google-Extended (Google)Cờ cho phép Gemini/AI Overviews dùng nội dung Googlebot đã thu thập — KHÔNG phải một crawler riêng, nên không kiểm được ở tầng CDN.
  • Bytespider (ByteDance)Crawler của ByteDance (TikTok/Doubao) — thu thập nội dung + huấn luyện mô hình.
  • CCBot (Common Crawl)Common Crawl — kho dữ liệu công khai nhiều mô hình nền tảng dùng để huấn luyện, không riêng một hãng.
  • meta-externalagent (Meta)Thu thập nội dung cho các tính năng AI tạo sinh của Meta.

Danh sách này là ảnh chụp hiện tại, không phải giới hạn — bối cảnh trợ lý AI đổi theo quý và COSMATE rà lại danh sách theo đó.

Muốn hiểu vì sao việc này quan trọng? Đọc blog COSMATE hoặc xem một bài COSMATE viết thật.