Nhiều chủ doanh nghiệp chỉ nghe tới robots.txt khi Search Console báo “URL bị tệp robots.txt chặn”, hoặc khi một người quen khuyên “chặn bớt cho Google khỏi đọc”. Robots.txt là một tệp chữ nhỏ, nhưng viết sai một dòng có thể làm cả website biến khỏi kết quả tìm kiếm. Bài này giải thích tệp đó làm được gì, không làm được gì, website doanh nghiệp thật sự cần viết những dòng nào và cách tự kiểm tra trong 5 phút.
Robots.txt là gì và nằm ở đâu
Robots.txt là tệp văn bản đặt ở gốc tên miền, ví dụ tenmien.vn/robots.txt. Khi máy thu thập của Google (Googlebot) tới website, việc đầu tiên nó làm là đọc tệp này để biết đường dẫn nào được vào, đường dẫn nào không. Theo tài liệu Google Search Central, tệp phải nằm đúng ở thư mục gốc, mỗi tên miền (và mỗi tên miền phụ) chỉ có một tệp, và tệp đặt trong thư mục con sẽ không có tác dụng.
Với website WordPress, nếu chưa ai tạo tệp riêng thì WordPress tự trả về một tệp ảo vài dòng, đủ dùng cho phần lớn website doanh nghiệp.
Robots.txt làm được gì và không làm được gì
Robots.txt điều khiển việc thu thập (máy có được vào đọc trang hay không), không điều khiển việc lập chỉ mục (trang có lên Google hay không). Google nói rõ robots.txt không phải cách để giữ một trang khỏi kết quả tìm kiếm: một trang bị chặn vẫn có thể hiện trên Google nếu nơi khác dẫn link tới nó, chỉ là kết quả không có đoạn mô tả.
- Muốn một trang không lên Google: dùng thẻ noindex trên trang đó, đặt mật khẩu, hoặc xoá trang. Đừng chặn trong robots.txt, vì khi bị chặn Google không đọc được thẻ noindex.
- Muốn giấu dữ liệu nhạy cảm: robots.txt không phải hàng rào bảo mật. Ai cũng đọc được tệp này, nên ghi “thư mục bí mật” vào đó là tự chỉ đường.
- Muốn bớt cho máy đọc những trang vô ích: đây mới là việc robots.txt làm tốt, ví dụ trang kết quả tìm kiếm nội bộ hay đường dẫn lọc sản phẩm sinh ra vô số biến thể.
Google chỉ hiểu bốn loại dòng: User-agent (dành cho máy nào), Disallow (không được vào), Allow (được vào) và Sitemap (địa chỉ sơ đồ trang). Dòng Crawl-delay mà nhiều bài cũ hay chép, Google không hỗ trợ.
Website doanh nghiệp cần viết những dòng nào
Với một website WordPress giới thiệu công ty vài chục trang, tệp tốt thường rất ngắn. Tệp ảo mặc định của WordPress gồm ba dòng: cho mọi máy (User-agent: *), không vào khu quản trị /wp-admin/, nhưng vẫn cho vào tệp admin-ajax.php mà nhiều tính năng ngoài trang cần dùng. Từ WordPress 5.5, khi website đang mở cho công cụ tìm kiếm, WordPress tự thêm dòng Sitemap trỏ tới sơ đồ trang có sẵn. Nếu bạn dùng plugin SEO có sơ đồ trang riêng, dòng Sitemap nên trỏ đúng địa chỉ của plugin đó; chi tiết trong bài Sitemap XML là gì và cách gửi lên Google.
Chỉ thêm dòng Disallow khi có lý do cụ thể. Ba trường hợp hợp lý ở website doanh nghiệp:
- Trang kết quả tìm kiếm nội bộ (đường dẫn có ?s=), vì mỗi từ khoá khách gõ lại tạo ra một trang mới vô nghĩa với Google.
- Đường dẫn giỏ hàng, thanh toán, tài khoản ở website bán hàng: trang riêng của từng khách, không có giá trị tìm kiếm.
- Bộ lọc sản phẩm tạo ra hàng nghìn tổ hợp đường dẫn (màu, cỡ, giá), làm Google tốn công đọc trang trùng lặp.
Câu hay được hỏi: có nên chặn máy thu thập của các công ty AI? Google có riêng mã Google-Extended để bạn chọn không cho nội dung được dùng huấn luyện mô hình Gemini, và nói rõ mã này không ảnh hưởng việc website có mặt hay thứ hạng trên Google Search. Chặn hay không là tuỳ bạn.
5 lỗi robots.txt hay gặp và cách nhận ra
| Lỗi | Hậu quả | Cách sửa |
|---|---|---|
| Còn dòng “Disallow: /” từ lúc làm web | Chặn toàn bộ website, trang mới không được đọc | Xoá dòng đó, giữ tệp mặc định |
| Chặn thư mục chứa CSS, JavaScript, ảnh | Google thấy trang vỡ bố cục, đánh giá sai trên điện thoại | Bỏ các dòng chặn /wp-content/ hoặc /wp-includes/ |
| Dùng robots.txt để giấu trang khỏi Google | Trang vẫn có thể hiện, không có mô tả | Bỏ chặn, đặt noindex cho trang |
| Dòng Sitemap trỏ địa chỉ cũ hoặc sai | Google đọc sơ đồ hỏng, bỏ sót trang mới | Sửa đúng địa chỉ sơ đồ đang chạy |
| Viết sai chữ hoa, chữ thường trong đường dẫn | Chặn nhầm hoặc không chặn được | Đường dẫn phân biệt hoa thường, chép đúng từng ký tự |
Lỗi đầu tiên hay gặp ở website vừa bàn giao. Từ WordPress 5.3, ô “Ngăn chặn các công cụ tìm kiếm đánh chỉ mục website này” trong Cài đặt › Đọc không còn ghi “Disallow: /” vào robots.txt mà chuyển sang thẻ noindex trên trang, nên nếu tệp vẫn có dòng đó thì nhiều khả năng ai đó đã tạo tệp thật trên máy chủ và quên sửa. Các bước khác cho website mới có trong bài Website mới bao lâu lên Google.
Tự kiểm tra robots.txt trong 5 phút
- Mở tệp bằng cửa sổ ẩn danh: gõ tenmien.vn/robots.txt. Đọc từng dòng Disallow và tự hỏi: trang này có cần lên Google không?
- Xem Báo cáo robots.txt trong Search Console: vào Cài đặt, mở mục Báo cáo robots.txt. Báo cáo cho biết Google đọc tệp lần cuối khi nào, có lỗi hay cảnh báo gì. Sau khi sửa một lỗi chặn nhầm, bạn có thể bấm “Yêu cầu thu thập lại dữ liệu” ngay tại đây thay vì chờ Google tự đọc lại (Google thường lưu bản cũ của tệp tới 24 giờ).
- Đối chiếu báo cáo Trang: lý do “URL bị tệp robots.txt chặn” có đúng là những đường dẫn bạn muốn chặn không. Nếu trang quan trọng nằm trong đó, sửa tệp ngay. Cách đọc các lý do khác xem bài Lỗi chưa lập chỉ mục trên Search Console: 12 lý do và cách xử lý.
Một lưu ý về máy chủ: nếu tệp robots.txt trả về lỗi máy chủ (mã 5xx) kéo dài, Google sẽ tạm dừng thu thập cả website. Đây là lý do website cần hosting ổn định và có người theo dõi sau mỗi lần cập nhật lớn. Nếu bạn chưa có ai lo phần này, xem trang Lưu trữ và bảo trì website của chúng tôi.
Tóm lại
- Robots.txt chỉ điều khiển việc máy tìm kiếm có được đọc trang hay không; muốn trang không lên Google thì dùng noindex, không dùng robots.txt.
- Website doanh nghiệp thường chỉ cần tệp mặc định của WordPress cộng dòng Sitemap đúng; chặn thêm khi có lý do cụ thể như trang tìm kiếm nội bộ, giỏ hàng.
- Kiểm bằng cách mở tenmien.vn/robots.txt và Báo cáo robots.txt trong Search Console; xoá ngay dòng “Disallow: /” còn sót từ lúc làm web.