Công cụ miễn phí · không cần đăng ký

Những crawler AI nào có thể truy cập trang web của bạn?

Nhập tên miền của bạn, chúng tôi sẽ đọc robots.txt theo cách crawler đọc (RFC 9309), rồi cho biết từng user agent AI chính được phép, bị chặn một phần hay bị chặn hoàn toàn. Crawler tìm kiếm AI và trình tải theo yêu cầu người dùng cần quyền truy cập để trang của bạn được trích dẫn; crawler huấn luyện là lựa chọn riêng mà bạn có thể tự quyết định.

Xem xét lần cuối 16 tháng 9, 2026

Trình kiểm tra crawler AI

Chỉ áp dụng cho trang web công khai. Chúng tôi tải trang một lần dưới tên CitevanaBot và không lưu nội dung trang.

Cách hoạt động

  1. Chúng tôi tải /robots.txt từ tên miền của bạn và phân tích các nhóm user-agent, quy tắc allow và disallow, ký tự đại diện và các dòng sitemap.

  2. Với mỗi user agent AI, chúng tôi áp dụng nhóm khớp cụ thể nhất (hoặc nhóm *) và quy tắc khớp dài nhất, cho trang chủ và một số đường dẫn phổ biến.

  3. Bạn nhận được bản tóm tắt dễ hiểu, danh sách việc cần làm theo thứ tự ưu tiên, và bảng hiển thị nhà vận hành, mục đích và trạng thái của từng bot, kèm liên kết đến tài liệu chính thức của nhà vận hành.

Câu hỏi thường gặp

Crawler AI là gì?

Đó là trình khách tự động do một công ty AI vận hành. Một số thu thập nội dung để huấn luyện mô hình (ví dụ GPTBot hoặc ClaudeBot), một số xây dựng chỉ mục tìm kiếm cho câu trả lời AI (ví dụ OAI-SearchBot, Claude-SearchBot hoặc PerplexityBot), và một số chỉ tải trang khi người dùng yêu cầu (ví dụ ChatGPT-User hoặc Claude-User).

Tôi có nên chặn crawler AI không?

Tùy vào mục tiêu của bạn. Nếu muốn được trích dẫn trong câu trả lời AI, hãy cho phép các tác nhân tìm kiếm và tác nhân theo yêu cầu người dùng. Việc chặn crawler huấn luyện là một quyết định kinh doanh riêng; các nhà vận hành như OpenAI, Anthropic và Google công bố các token riêng biệt để bạn lựa chọn.

Làm sao để chỉ chặn việc huấn luyện AI?

Thêm một nhóm cho mỗi token huấn luyện, ví dụ "User-agent: GPTBot" và tiếp theo là "Disallow: /". Google cho biết token Google-Extended kiểm soát việc dùng dữ liệu cho huấn luyện và grounding của Gemini, và không ảnh hưởng đến thứ hạng trên Google Search.

robots.txt có đảm bảo bot sẽ không truy cập không?

Không. robots.txt là tiêu chuẩn tự nguyện. Các nhà vận hành được liệt kê ở đây cho biết họ tuân thủ, nhưng đây không phải cơ chế kiểm soát truy cập; hãy dùng xác thực hoặc quy tắc tường lửa cho nội dung cần giữ riêng tư.

Trình kiểm tra crawler AI của Citevana có miễn phí không?

Có. Bạn có thể dùng miễn phí mà không cần tài khoản, với giới hạn hằng ngày khá rộng rãi để ngăn lạm dụng.