Bạn nhận thông báo từ Google Search Console rằng "Robots.txt đang chặn URL" — nhưng trang đó lại là trang bán hàng chính của cửahàng.vn và cần được index? Hoặc ngược lại, trang admin nội bộ lại xuất hiện trên kết quả tìm kiếm vì không có rule nào chặn? Đây là những tình huống rất hay gặp, và trong hầu hết trường hợp, nguyên nhân đều nằm ở một vài dòng trong file robots.txt viết sai hoặc viết thiếu.
File robots.txt chỉ có vài dòng, nhưng một dòng sai có thể khiến Googlebot bỏ qua toàn bộ website hoặc index những trang bạn không muốn lên kết quả tìm kiếm. Bài viết này sẽ cùng bạn đi qua cú pháp cơ bản, cách tạo đúng, kiểm tra thực tế và khai báo sitemap — để chắc chắn file robots.txt đang bảo vệ và hỗ trợ SEO đúng như ý định.
Kiểm tra robots.txt ngay: nhập tên miền vào công cụ kiểm tra robots.txt để xem nội dung file hiện tại và phát hiện cảnh báo cú pháp. Không cần đăng nhập.
Robots.txt là gì và hoạt động thế nào?
File robots.txt nằm ở thư mục gốc của website (ví dụ https://tencongty.vn/robots.txt) và là tập tin đầu tiên các công cụ tìm kiếm đọc trước khi crawl. Nó chứa các chỉ thị nói với bot "được vào đây" hoặc "đừng vào đó".
Cú pháp gồm ba yếu tố chính:
Chỉ thịÝ nghĩaVí dụUser-agentBot áp dụng rule; * là tất cảUser-agent: GooglebotDisallowĐường dẫn bị cấm crawlDisallow: /admin/AllowĐường dẫn được phép (ghi đè Disallow)Allow: /admin/loginSitemapKhai báo vị trí sitemapSitemap: https://tencongty.vn/sitemap.xml
Một điểm quan trọng: robots.txt là gợi ý, không phải khóa cứng. Với Googlebot, Bingbot và hầu hết bot uy tín, đây là thỏa thuận được tôn trọng. Nhưng bot độc hại hoàn toàn có thể bỏ qua — để bảo vệ nội dung thật sự nhạy cảm, bạn vẫn cần xác thực ở tầng server.
Ngoài Googlebot và Bingbot, từ năm 2023 có thêm nhiều bot AI (GPTBot, ClaudeBot, Google-Extended…) đang crawl web. Phần kiểm tra bot AI ở Bước 3 sẽ đề cập riêng vấn đề này.
4 bước tạo và kiểm tra robots.txt chuẩn
Bước 1 — Tạo file robots.txt từ đầu
Thay vì gõ tay dễ sai dấu hoặc thiếu dòng trắng, bạn có thể dùng công cụ sinh tự động: chọn bot cần cấu hình, chọn đường dẫn chặn hoặc cho phép, khai báo sitemap — công cụ sẽ xuất file .txt sẵn sàng upload.
👉 Tạo: công cụ tạo robots.txt (chọn rule, xuất file .txt sẵn sàng upload lên server).
Ví dụ file robots.txt tối thiểu chuẩn cho website thông thường:
User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /
Sitemap: https://tencongty.vn/sitemap.xmlLỗi hay gặp:
Chặn toàn bộ website bằng
Disallow: /: rule này ngăn Googlebot index mọi thứ. Chỉ dùng khi bạn thực sự muốn website không xuất hiện trên tìm kiếm — ví dụ với staging site hoặc môi trường dev. Dùng nhầm trên production là sự cố nghiêm trọng.Thiếu dòng trắng giữa các block: mỗi nhóm
User-agent+Disallow/Allowphải cách nhau bằng một dòng trắng. Thiếu dòng trắng khiến bot đọc sai rule — và lỗi này không hề hiển thị rõ ràng.Chặn file CSS và JavaScript: Google cần đọc CSS/JS để hiểu layout và tính toán điểm Mobile Usability. Chặn
/assets/hay/static/thường gây điểm core web vitals thấp và cảnh báo trong Search Console.
Bước 2 — Kiểm tra cú pháp và logic
Sau khi có file, validate lại từng dòng trước khi upload. Một lỗi đánh máy nhỏ — chữ hoa/thường sai, thiếu dấu / ở cuối đường dẫn — có thể làm rule không hoạt động hoặc chặn nhầm trang.
👉 Kiểm tra: công cụ kiểm tra robots.txt (nhập URL tên miền hoặc dán nội dung, xem cảnh báo ngay).
Ví dụ hay gặp: bạn viết Disallow: /Admin/ (chữ A hoa), nhưng URL thực tế là /admin/ (chữ thường). Trên Linux server, hai đường dẫn này là khác nhau — rule không có tác dụng gì và trang admin vẫn được crawl bình thường.
Lỗi hay gặp:
Phân biệt hoa/thường: đường dẫn trong robots.txt phân biệt chữ hoa/thường tương ứng với hệ điều hành server. Trên Linux (phổ biến nhất),
/Admin/và/admin/là hai đường dẫn khác nhau.Rule mâu thuẫn: khi có cả
Disallow: /vàAllow: /posts/, các bot xử lý thứ tự ưu tiên theo cách khác nhau. Tốt nhất là viết cụ thể, không để rule xung đột nhau.
Bước 3 — Kiểm tra bot AI đang được phép hay bị chặn
Từ 2023, ngoài Googlebot còn có GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google DeepMind), PerplexityBot và nhiều bot AI khác đang crawl web. Nếu robots.txt chưa khai báo gì cho các bot này, mặc định chúng được phép crawl toàn bộ website.
👉 Kiểm tra: công cụ kiểm tra bot AI trong robots.txt (nhập tên miền, xem danh sách bot AI nào đang được phép hay bị chặn).
Bước này nhiều người bỏ qua, nhưng quan trọng nếu website có nội dung bản quyền hoặc bạn muốn kiểm soát xem AI nào được crawl dữ liệu. Lưu ý phân biệt: bot huấn luyện mô hình (GPTBot, ClaudeBot) và bot tìm kiếm AI (OAI-SearchBot, PerplexityBot) là khác nhau — chặn bot huấn luyện không ảnh hưởng đến khả năng website được tìm thấy qua ChatGPT Search hay Perplexity.
Bước 4 — Khai báo sitemap trong robots.txt
Khai báo sitemap trong robots.txt là bước hay bị bỏ sót nhưng rất có ích. Dòng Sitemap: giúp Googlebot và mọi bot tuân thủ giao thức biết chính xác file sitemap.xml nằm ở đâu mà không cần đoán.
👉 Kiểm tra sitemap: công cụ kiểm tra sitemap (nhập URL sitemap để xác nhận file hợp lệ trước khi khai báo).
Dòng khai báo đúng:
Sitemap: https://tencongty.vn/sitemap.xmlNếu website có nhiều sitemap (blog, sản phẩm, trang tĩnh), bạn có thể khai báo nhiều dòng Sitemap: liền nhau là được. Điều quan trọng là phải dùng URL tuyệt đối (đầy đủ https://) — đường dẫn tương đối như /sitemap.xml sẽ không được nhận diện.
Lỗi hay gặp:
Sitemap khai báo nhưng không tồn tại: file không có hoặc trả về 404. Luôn validate sitemap trước khi khai báo.
File robots.txt bị chặn chính nó: kiểm tra không có rule nào
Disallow: /robots.txttrong file — điều này không có ý nghĩa gì về SEO nhưng gây lỗi logic.
Thay đổi robots.txt có hiệu lực ngay không?
Không — thay đổi thường có hiệu lực trong vài ngày đến 1 tuần, tùy tần suất Googlebot ghé thăm website. Nếu cần Google cập nhật nhanh hơn, vào Google Search Console → mục "Kiểm tra URL" và yêu cầu index lại.
Một điều cần nhớ: chặn URL bằng robots.txt không xóa trang đó khỏi kết quả tìm kiếm nếu trang đã được index từ trước. Muốn xóa URL khỏi kết quả tìm kiếm thật sự, bạn cần dùng công cụ xóa URL trong Search Console, hoặc thêm thẻ <meta name="robots" content="noindex"> vào trang đó.
Câu hỏi thường gặp (FAQ)
Robots.txt có bắt buộc không? Không bắt buộc, nhưng nên có. Nếu website không có file robots.txt, Googlebot mặc định crawl mọi thứ — kể cả trang cảm ơn đặt hàng, trang kết quả tìm kiếm nội bộ hay trang có tham số URL lặp lại.
Làm sao biết Googlebot có đang bị chặn không? Nhập URL website vào công cụ kiểm tra robots.txt, thử với User-agent là Googlebot và đường dẫn cụ thể bạn muốn kiểm tra. Kết quả sẽ cho thấy URL đó được phép hay bị chặn, và bởi rule nào.
File robots.txt đặt ở thư mục nào? Nhất định phải là thư mục gốc: https://tencongty.vn/robots.txt. File đặt ở /blog/robots.txt hay bất kỳ đường dẫn khác đều không được nhận diện.
Robots.txt có bảo vệ được nội dung nhạy cảm không? Không. Bất kỳ ai biết đường dẫn đều có thể truy cập URL dù nó bị liệt trong robots.txt. Để bảo vệ thật sự, bạn cần xác thực ở tầng server (password, session). Robots.txt chỉ là chỉ dẫn cho bot, không phải cơ chế bảo mật.
BKNS Tools — bộ công cụ SEO & website miễn phí cho người Việt. Tạo robots.txt · Kiểm tra robots.txt · Kiểm tra bot AI · Kiểm tra sitemap — không cần đăng nhập.




