Từ năm 2023, ngoài Googlebot và Bingbot quen thuộc, website của bạn đang đón thêm nhiều "khách" mới: GPTBot của OpenAI, ClaudeBot của Anthropic, Google-Extended, PerplexityBot, Bytespider của ByteDance và hàng chục bot AI khác đang tích cực crawl toàn bộ internet. Nếu tencongty.vn chưa khai báo gì cho các bot này trong robots.txt, mặc định chúng được phép truy cập và thu thập dữ liệu — và nội dung của bạn có thể trở thành nguồn huấn luyện cho các mô hình AI hoặc được trích dẫn trong câu trả lời AI mà không hỏi ý kiến trước.
Chặn hay để mặc định? Câu trả lời không đơn giản — phụ thuộc vào mục tiêu của từng website. Bài viết này giúp bạn hiểu các bot AI đang làm gì, kiểm tra trạng thái hiện tại của website, và cấu hình robots.txt theo đúng ý định.
Kiểm tra bot AI ngay: nhập tên miền vào công cụ kiểm tra bot AI trong robots.txt để xem danh sách bot AI nào đang được phép hay bị chặn. Không cần đăng nhập.
Các bot AI phổ biến cần biết
Tính đến giữa 2026, những bot AI đáng chú ý nhất đang hoạt động:
BotCông tyUser-AgentMục đích chínhGPTBotOpenAIGPTBotHuấn luyện mô hình GPTOAI-SearchBotOpenAIOAI-SearchBotWeb search trong ChatGPTClaudeBotAnthropicClaudeBotHuấn luyện mô hình ClaudeGoogle-ExtendedGoogle DeepMindGoogle-ExtendedHuấn luyện Gemini (khác Googlebot)PerplexityBotPerplexity AIPerplexityBotTrả lời AI trong PerplexityBytespiderByteDanceBytespiderAI của TikTok và ByteDanceCCBotCommon CrawlCCBotKho dữ liệu mở, nhiều mô hình dùngImagesiftBotSpawning.aiImagesiftBotCrawl ảnh cho dataset AI
Điều quan trọng cần phân biệt từ đầu: GPTBot (thu thập dữ liệu huấn luyện GPT) và OAI-SearchBot (tìm kiếm thời gian thực cho ChatGPT Search) là hai bot hoàn toàn khác nhau của cùng OpenAI. Chặn GPTBot ngăn nội dung đi vào dữ liệu huấn luyện, nhưng không ngăn ChatGPT Search tìm thấy và trích dẫn trang của bạn. Muốn làm cả hai việc, cần chặn cả hai bot.
Nên chặn hay để mặc định? Lợi và hại thực tế
Không có câu trả lời đúng-sai chung — phụ thuộc vào mục tiêu và loại nội dung:
Lý do nên chặn (một phần hoặc toàn bộ):
Nội dung có bản quyền hoặc giá trị thương mại cao mà bạn không muốn AI dùng miễn phí (khóa học, database độc quyền, nghiên cứu…)
Bạn không muốn nội dung được AI tóm tắt lại và trả lời thay vì người dùng vào thẳng website
Bot crawl nhiều gây tốn bandwidth và tải server bất thường
Lý do nên giữ nguyên (cho phép):
Nội dung mang mục tiêu lan rộng càng nhiều càng tốt (blog, tin tức, tài liệu hướng dẫn công khai)
Muốn được tìm thấy và trích dẫn trong ChatGPT Search, Perplexity — chặn OAI-SearchBot hay PerplexityBot đồng nghĩa với việc website không xuất hiện khi người dùng hỏi AI về chủ đề bạn đang viết
Website mới cần exposure từ mọi kênh — bao gồm cả kênh AI search đang phát triển nhanh
Thực tế phổ biến của nhiều webmaster: chặn bot huấn luyện (GPTBot, ClaudeBot, Google-Extended, CCBot) nhưng giữ nguyên bot tìm kiếm AI (OAI-SearchBot, PerplexityBot) để vẫn được khám phá qua các nền tảng AI search.
4 bước kiểm tra và cấu hình robots.txt cho bot AI
Bước 1 — Kiểm tra trạng thái hiện tại
Trước khi thay đổi gì, hãy biết website đang cho phép hay chặn bot AI nào. Câu trả lời thường là "không khai báo" — tức là tất cả đang được phép mặc định.
👉 Kiểm tra: công cụ kiểm tra bot AI trong robots.txt (nhập tên miền, xem danh sách bot AI và trạng thái hiện tại).
Kết quả bạn thường thấy: nếu robots.txt không có rule cho GPTBot hay ClaudeBot, công cụ sẽ báo "Cho phép (mặc định)" — tức là chúng đang crawl tự do dù bạn chưa hề chủ động cho phép.
Bước 2 — Cấu hình robots.txt theo chiến lược đã chọn
Sau khi quyết định chặn hay cho phép, bước tiếp theo là cập nhật file robots.txt.
👉 Tạo hoặc chỉnh: công cụ tạo robots.txt (chọn bot, chọn đường dẫn, xuất file .txt).
Dưới đây là một số mẫu cấu hình thực tế — tất cả dùng ký tự ASCII thuần trong tên User-Agent và đường dẫn:
Chặn bot huấn luyện AI, giữ bot tìm kiếm AI:
# Bot huan luyen AI — chan
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# Bot tim kiem AI — cho phep
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Bot tim kiem truyen thong — cau hinh binh thuong
User-agent: *
Disallow: /admin/Chặn tất cả bot AI bao gồm cả tìm kiếm:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /Lỗi hay gặp:
Nhầm
Google-ExtendedvớiGooglebot: chặnGoogle-Extendedkhông ảnh hưởng đến khả năng Googlebot index trang thông thường. Hai bot này hoàn toàn độc lập về mục đích và tuân theo rule riêng.Chỉ chặn GPTBot nhưng vẫn để CCBot tự do: CCBot là bot của Common Crawl — một tổ chức phi lợi nhuận tạo dataset mở được nhiều mô hình AI dùng, kể cả các mô hình không có bot crawler riêng. Nếu mục tiêu là ngăn dữ liệu vào training set, CCBot cũng cần chặn.
Dùng
Disallow: /choUser-agent: *vì nhầm: rule đó sẽ chặn cả Googlebot và ảnh hưởng SEO nghiêm trọng. Luôn đặt rule cho từng bot riêng, không gộp chung với*khi muốn chặn một nhóm cụ thể.
Bước 3 — Validate cú pháp sau khi chỉnh
Sau khi thêm các rule mới, validate toàn bộ file robots.txt để không có lỗi cú pháp hay rule mâu thuẫn.
👉 Kiểm tra cú pháp: công cụ kiểm tra robots.txt (nhập tên miền sau khi upload file mới, xem cảnh báo).
Lưu ý về thứ tự block: mỗi bot nên có một block riêng biệt thay vì gộp nhiều bot vào chung một block. Cú pháp nhiều User-agent trong một block (như User-agent: GPTBot\nUser-agent: ClaudeBot) được một số parser hỗ trợ, nhưng để chắc chắn tương thích, block riêng cho từng bot là cách an toàn nhất.
Bước 4 — Kiểm tra headers để phát hiện bot crawl bất thường
Robots.txt chỉ có hiệu lực với bot tuân thủ giao thức. Bot spam và scraper độc hại thường bỏ qua robots.txt hoàn toàn. Để phát hiện crawl bất thường từ phía server, bạn có thể xem headers phản hồi và nhật ký truy cập.
👉 Kiểm tra headers: công cụ kiểm tra HTTP headers (nhập URL, xem phản hồi server và các header bảo mật).
Nếu muốn kiểm soát cứng hơn — chặn bot theo User-Agent ở tầng server thay vì chỉ dựa vào robots.txt — cần cấu hình Nginx hoặc tường lửa ứng dụng (WAF). Cách này hiệu quả hơn với bot không tuân thủ, nhưng cần kỹ thuật nhiều hơn và phải cẩn thận không chặn nhầm người dùng thật.
Sau khi cập nhật robots.txt, bot AI mất bao lâu để cập nhật?
Bot AI như GPTBot thường đọc lại robots.txt mỗi vài ngày đến 1–2 tuần một lần — không có cơ chế "khai báo khẩn" như Google Search Console. Sau khi upload file mới, bạn chờ bot tự đọc lại trong chu kỳ tiếp theo. Nếu muốn nhanh hơn, một số công ty AI cung cấp form yêu cầu crawl lại hoặc opt-out chính thức — kiểm tra trang nhà phát triển của từng công ty để biết thêm.
Ngoài robots.txt, cách bổ sung là đưa điều khoản vào Terms of Service (Điều khoản sử dụng) nêu rõ quy định về việc thu thập dữ liệu tự động. Về mặt pháp lý, điều này có giá trị hơn robots.txt ở các thị trường có luật bản quyền dữ liệu.
Câu hỏi thường gặp (FAQ)
Chặn GPTBot có làm website mất traffic từ ChatGPT không? Chặn GPTBot ngăn nội dung đi vào dữ liệu huấn luyện GPT, nhưng không ảnh hưởng đến ChatGPT Search (dùng OAI-SearchBot riêng). Muốn không xuất hiện trong ChatGPT Search, cần chặn thêm OAI-SearchBot. Hai mục tiêu này cần xử lý bằng hai rule khác nhau.
Bot AI có bắt buộc tuân theo robots.txt không? Không có cơ chế bắt buộc kỹ thuật. Nhưng các bot uy tín từ OpenAI, Anthropic, Google đều cam kết tuân thủ robots.txt theo tài liệu chính thức của họ. Bot scraper ít uy tín và bot độc hại thường bỏ qua — với những trường hợp này cần chặn ở tầng server.
Có nên chặn tất cả bot AI không? Không nhất thiết. Nếu website là blog, tài liệu hướng dẫn hay thông tin dịch vụ muốn được biết đến rộng rãi, việc xuất hiện trong câu trả lời của ChatGPT Search hay Perplexity có thể là nguồn exposure và traffic mới. Chỉ nên chặn khi có lý do rõ ràng về bản quyền hoặc giá trị thương mại của nội dung.
ai.txt có thay thế được robots.txt không? ai.txt là đề xuất chưa được chuẩn hóa rộng rãi (tính đến giữa 2026). Hiện tại robots.txt vẫn là cơ chế chính thức được các bot AI lớn tuân thủ. Bạn có thể tạo thêm ai.txt nếu muốn, nhưng không thể thay thế robots.txt — cần duy trì cả hai nếu muốn phủ rộng nhất.
BKNS Tools — bộ công cụ SEO & website miễn phí cho người Việt. Kiểm tra bot AI · Tạo robots.txt · Kiểm tra robots.txt · Kiểm tra HTTP headers — không cần đăng nhập.




