Robots.txt là gì, website doanh nghiệp cần viết gì

Digotech

6 phút

Nhiều chủ doanh nghiệp chỉ nghe tới robots.txt khi Search Console báo “URL bị tệp robots.txt chặn”, hoặc khi một người quen khuyên “chặn bớt cho Google khỏi đọc”. Robots.txt là một tệp chữ nhỏ, nhưng viết sai một dòng có thể làm cả website biến khỏi kết quả tìm kiếm. Bài này giải thích tệp đó làm được gì, không làm được gì, website doanh nghiệp thật sự cần viết những dòng nào và cách tự kiểm tra trong 5 phút.

Robots.txt là gì và nằm ở đâu

Robots.txt là tệp văn bản đặt ở gốc tên miền, ví dụ tenmien.vn/robots.txt. Khi máy thu thập của Google (Googlebot) tới website, việc đầu tiên nó làm là đọc tệp này để biết đường dẫn nào được vào, đường dẫn nào không. Theo tài liệu Google Search Central, tệp phải nằm đúng ở thư mục gốc, mỗi tên miền (và mỗi tên miền phụ) chỉ có một tệp, và tệp đặt trong thư mục con sẽ không có tác dụng.

Với website WordPress, nếu chưa ai tạo tệp riêng thì WordPress tự trả về một tệp ảo vài dòng, đủ dùng cho phần lớn website doanh nghiệp.

Robots.txt làm được gì và không làm được gì

Robots.txt điều khiển việc thu thập (máy có được vào đọc trang hay không), không điều khiển việc lập chỉ mục (trang có lên Google hay không). Google nói rõ robots.txt không phải cách để giữ một trang khỏi kết quả tìm kiếm: một trang bị chặn vẫn có thể hiện trên Google nếu nơi khác dẫn link tới nó, chỉ là kết quả không có đoạn mô tả.

  • Muốn một trang không lên Google: dùng thẻ noindex trên trang đó, đặt mật khẩu, hoặc xoá trang. Đừng chặn trong robots.txt, vì khi bị chặn Google không đọc được thẻ noindex.
  • Muốn giấu dữ liệu nhạy cảm: robots.txt không phải hàng rào bảo mật. Ai cũng đọc được tệp này, nên ghi “thư mục bí mật” vào đó là tự chỉ đường.
  • Muốn bớt cho máy đọc những trang vô ích: đây mới là việc robots.txt làm tốt, ví dụ trang kết quả tìm kiếm nội bộ hay đường dẫn lọc sản phẩm sinh ra vô số biến thể.

Google chỉ hiểu bốn loại dòng: User-agent (dành cho máy nào), Disallow (không được vào), Allow (được vào) và Sitemap (địa chỉ sơ đồ trang). Dòng Crawl-delay mà nhiều bài cũ hay chép, Google không hỗ trợ.

Website doanh nghiệp cần viết những dòng nào

Với một website WordPress giới thiệu công ty vài chục trang, tệp tốt thường rất ngắn. Tệp ảo mặc định của WordPress gồm ba dòng: cho mọi máy (User-agent: *), không vào khu quản trị /wp-admin/, nhưng vẫn cho vào tệp admin-ajax.php mà nhiều tính năng ngoài trang cần dùng. Từ WordPress 5.5, khi website đang mở cho công cụ tìm kiếm, WordPress tự thêm dòng Sitemap trỏ tới sơ đồ trang có sẵn. Nếu bạn dùng plugin SEO có sơ đồ trang riêng, dòng Sitemap nên trỏ đúng địa chỉ của plugin đó; chi tiết trong bài Sitemap XML là gì và cách gửi lên Google.

Chỉ thêm dòng Disallow khi có lý do cụ thể. Ba trường hợp hợp lý ở website doanh nghiệp:

  • Trang kết quả tìm kiếm nội bộ (đường dẫn có ?s=), vì mỗi từ khoá khách gõ lại tạo ra một trang mới vô nghĩa với Google.
  • Đường dẫn giỏ hàng, thanh toán, tài khoản ở website bán hàng: trang riêng của từng khách, không có giá trị tìm kiếm.
  • Bộ lọc sản phẩm tạo ra hàng nghìn tổ hợp đường dẫn (màu, cỡ, giá), làm Google tốn công đọc trang trùng lặp.

Câu hay được hỏi: có nên chặn máy thu thập của các công ty AI? Google có riêng mã Google-Extended để bạn chọn không cho nội dung được dùng huấn luyện mô hình Gemini, và nói rõ mã này không ảnh hưởng việc website có mặt hay thứ hạng trên Google Search. Chặn hay không là tuỳ bạn.

5 lỗi robots.txt hay gặp và cách nhận ra

LỗiHậu quảCách sửa
Còn dòng “Disallow: /” từ lúc làm webChặn toàn bộ website, trang mới không được đọcXoá dòng đó, giữ tệp mặc định
Chặn thư mục chứa CSS, JavaScript, ảnhGoogle thấy trang vỡ bố cục, đánh giá sai trên điện thoạiBỏ các dòng chặn /wp-content/ hoặc /wp-includes/
Dùng robots.txt để giấu trang khỏi GoogleTrang vẫn có thể hiện, không có mô tảBỏ chặn, đặt noindex cho trang
Dòng Sitemap trỏ địa chỉ cũ hoặc saiGoogle đọc sơ đồ hỏng, bỏ sót trang mớiSửa đúng địa chỉ sơ đồ đang chạy
Viết sai chữ hoa, chữ thường trong đường dẫnChặn nhầm hoặc không chặn đượcĐường dẫn phân biệt hoa thường, chép đúng từng ký tự

Lỗi đầu tiên hay gặp ở website vừa bàn giao. Từ WordPress 5.3, ô “Ngăn chặn các công cụ tìm kiếm đánh chỉ mục website này” trong Cài đặt › Đọc không còn ghi “Disallow: /” vào robots.txt mà chuyển sang thẻ noindex trên trang, nên nếu tệp vẫn có dòng đó thì nhiều khả năng ai đó đã tạo tệp thật trên máy chủ và quên sửa. Các bước khác cho website mới có trong bài Website mới bao lâu lên Google.

Tự kiểm tra robots.txt trong 5 phút

  1. Mở tệp bằng cửa sổ ẩn danh: gõ tenmien.vn/robots.txt. Đọc từng dòng Disallow và tự hỏi: trang này có cần lên Google không?
  2. Xem Báo cáo robots.txt trong Search Console: vào Cài đặt, mở mục Báo cáo robots.txt. Báo cáo cho biết Google đọc tệp lần cuối khi nào, có lỗi hay cảnh báo gì. Sau khi sửa một lỗi chặn nhầm, bạn có thể bấm “Yêu cầu thu thập lại dữ liệu” ngay tại đây thay vì chờ Google tự đọc lại (Google thường lưu bản cũ của tệp tới 24 giờ).
  3. Đối chiếu báo cáo Trang: lý do “URL bị tệp robots.txt chặn” có đúng là những đường dẫn bạn muốn chặn không. Nếu trang quan trọng nằm trong đó, sửa tệp ngay. Cách đọc các lý do khác xem bài Lỗi chưa lập chỉ mục trên Search Console: 12 lý do và cách xử lý.

Một lưu ý về máy chủ: nếu tệp robots.txt trả về lỗi máy chủ (mã 5xx) kéo dài, Google sẽ tạm dừng thu thập cả website. Đây là lý do website cần hosting ổn định và có người theo dõi sau mỗi lần cập nhật lớn. Nếu bạn chưa có ai lo phần này, xem trang Lưu trữ và bảo trì website của chúng tôi.

Tóm lại

  • Robots.txt chỉ điều khiển việc máy tìm kiếm có được đọc trang hay không; muốn trang không lên Google thì dùng noindex, không dùng robots.txt.
  • Website doanh nghiệp thường chỉ cần tệp mặc định của WordPress cộng dòng Sitemap đúng; chặn thêm khi có lý do cụ thể như trang tìm kiếm nội bộ, giỏ hàng.
  • Kiểm bằng cách mở tenmien.vn/robots.txt và Báo cáo robots.txt trong Search Console; xoá ngay dòng “Disallow: /” còn sót từ lúc làm web.

Muốn áp dụng bài này cho website của bạn?

Để lại yêu cầu, Digotech xem website hiện tại của bạn và gọi lại trong giờ làm việc. Không mất phí.